跳至正文

智谱 GLM‑5.3‑Flash(牛来 / Ox‑Alpha)开源发布

牛来
牛来

026‑08‑26,智谱 AI 正式官宣:海外爆火匿名模型 Ox‑Alpha,国内俗称 “牛来”,正式型号为 GLM‑5.3‑Flash,当晚开源权重,采用 MIT 宽松协议,权重已发布在 Hugging Face。

背景:8 月 20 日以匿名 Ox‑Alpha 悄悄上线 OpenRouter、OpenCode,无品牌标识、预览期免费,直接登顶双平台调用榜,超过 DeepSeek,引爆全球开发者圈,被网友称为 “牛来”。

📐核心参数规格

  • 架构:MoE 320B‑A18B,总参数 3200 亿,激活仅 180 亿,45 层网络
  • 模态:GLM‑5 系列首个原生多模态,支持文本、图片、视频输入
  • 上下文:100 万 token 超长窗口,最大输出 131072 token(128K)
  • 创新架构:稀疏注意力 + 线性注意力混合,大幅压低长上下文推理成本
  • 预训练:30T token 多模态训练数据,全部流量跑在国产芯片算力上

⚡性能表现

  1. AA 综合智能指数 57 分,对标 Claude Opus 4.8 水平,整体能力超过 GLM‑5.2(753B)
  2. 强化代码、Agent 智能体能力;SWE 编程基准扩大样本实测约 63%,属于全球第一梯队
  3. 支持 PDF/PPTX/DOCX/XLSX 文档解析输出,适合办公、金融、代码仓库处理场景

💰API 定价

  • 常规价:GLM‑5.3 的 1/10;限时折扣:GLM‑5.3 的 1/20,约为 Claude Opus4.8 的 1/40
  • 上线初期开放免费体验周期,后续转为正式计费模式

📂开源信息

  • 协议:MIT 协议,允许商用、二次微调、本地部署、私有化落地
  • 获取:Hugging Face 智谱官方仓库可下载权重,支持本地推理、微调、二次开发

✨亮点总结

  1. 少见的 “先匿名海外公测爆火,再官宣 + 开源” 模式;
  2. MoE 大总参、小激活,兼顾强能力与推理成本;
  3. 原生多模态 + 百万上下文,MIT 协议对开发者非常友好;
  4. 全部算力跑国产芯片,国产大模型出海出圈案例。

GLM‑5.3‑Flash(牛来 / Ox‑Alpha)应用场景

核心优势:百万 token 超长上下文、原生图文视频多模态、强 Agent 智能体、强代码能力、MIT 开源可私有化、MoE 低推理成本。适合复杂长任务、多模态工程类、企业私有化部署。

1️⃣ AI 代码开发 & 编程 Agent(最强场景)智谱AI

  • 完整代码库分析:喂入百万级代码仓库,做代码解读、漏洞排查、重构、版本迁移
  • 视觉驱动编码:截图 UI 设计稿直接生成前端页面、移动端 App 完整交互代码;观察渲染结果自动迭代调试
  • SWE 软件工程:复现 bug、写单元测试、项目脚手架、全栈项目生成
  • 游戏开发:Godot、网页 3D 游戏,生成完整可运行游戏工程,多轮迭代优化
  • 适配 Cursor、OpenCode、ZCode 等 AI 编码工具,适合开发者、外包团队、内部研发助手

2️⃣ 通用 Agent 智能体、自动化工作流CSDN博...

  • 计算机操作 Agent (CUA/BUA):理解网页截图、GUI 界面,拆解复杂任务,调用工具循环执行、自检修正
  • 长程多步骤任务:可连续运行数小时,多轮自我迭代,适合复杂自动化流程
  • 企业内部智能助手:串联文档、数据库、联网搜索,完成调研、报告、工单处理

3️⃣ 长文档处理、企业办公文档解析(百万上下文)

支持 PDF、Word、PPT、Excel、扫描件图片、长报告批量处理

  • 财报、合同、法律卷宗、技术手册整本读取、要点提取、风险标注、对比分析
  • 批量文档总结、问答、生成 PPT/Excel 输出成品
  • 知识库 RAG 底座:百万上下文可以减少切片,大幅提升长文档问答准确率,私有化部署保障数据安全

4️⃣ 金融、研报、行业研究场景

  • 批量研报、财报、公告解析,自动做数据提取、观点汇总、横向对比
  • 行业深度报告撰写,自动引用原文溯源,输出完整分析文档

提示:不做投资决策,仅做信息整理

5️⃣ 多模态创意工程(图片 + 视频理解)

  1. 3D / 建模:Blender 场景生成,根据文字 / 参考图,生成完整室内、建筑、物件 3D 工程文件,长时间迭代渲染效果
  2. 视频理解:长视频内容分析、多人说话人区分、生成精准时间轴字幕、视频内容摘要
  3. CAD 图纸识别复刻:图纸图片转代码 / 参数化模型
  4. UI/UX 设计转代码:设计稿截图直接产出可运行前端代码

6️⃣ 企业私有化部署、行业二次微调(MIT 协议)

MIT 协议允许商用、二次微调、本地私有化部署,适合:

  • 政企、制造业、金融,数据不能出内网,本地跑前沿多模态大模型
  • 在基座基础上做行业微调,搭建垂直领域大模型(法务、工业文档、医疗文档等)
  • 中小公司自建 AI 能力,不用依赖闭源 API 高额费用

7️⃣ 教育、科研场景

  • 整本教材、论文集阅读答疑、文献综述生成
  • 理工科代码仿真、实验流程复现、科研辅助编程
  • 教学智能助教,处理超长课件、试卷材料

8️⃣ 不适合的场景(能力边界)

  1. 超高并发简单闲聊:MoE 架构更适合单条复杂长任务,简单高频问答性价比不如小模型;
  2. 实时毫秒级低延迟场景,长上下文推理会有一定耗时;
  3. 强实时高可靠生产业务,需要做输出校验,不能直接裸上生产。

选型小结

优先选牛来 (GLM‑5.3‑Flash):任务复杂、需要读巨量文档、要看图看视频、需要 Agent 多轮迭代、希望私有化开源商用。 简单问答、高并发对话,优先选更小的 GLM‑4 系列小模型。

👀 阅读量:37

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

分享
扫码分享

扫码分享本文

//这里粘贴百度统计完整script代码