
026‑08‑26,智谱 AI 正式官宣:海外爆火匿名模型 Ox‑Alpha,国内俗称 “牛来”,正式型号为 GLM‑5.3‑Flash,当晚开源权重,采用 MIT 宽松协议,权重已发布在 Hugging Face。
背景:8 月 20 日以匿名 Ox‑Alpha 悄悄上线 OpenRouter、OpenCode,无品牌标识、预览期免费,直接登顶双平台调用榜,超过 DeepSeek,引爆全球开发者圈,被网友称为 “牛来”。
📐核心参数规格
- 架构:MoE 320B‑A18B,总参数 3200 亿,激活仅 180 亿,45 层网络
- 模态:GLM‑5 系列首个原生多模态,支持文本、图片、视频输入
- 上下文:100 万 token 超长窗口,最大输出 131072 token(128K)
- 创新架构:稀疏注意力 + 线性注意力混合,大幅压低长上下文推理成本
- 预训练:30T token 多模态训练数据,全部流量跑在国产芯片算力上
⚡性能表现
- AA 综合智能指数 57 分,对标 Claude Opus 4.8 水平,整体能力超过 GLM‑5.2(753B)
- 强化代码、Agent 智能体能力;SWE 编程基准扩大样本实测约 63%,属于全球第一梯队
- 支持 PDF/PPTX/DOCX/XLSX 文档解析输出,适合办公、金融、代码仓库处理场景
💰API 定价
- 常规价:GLM‑5.3 的 1/10;限时折扣:GLM‑5.3 的 1/20,约为 Claude Opus4.8 的 1/40
- 上线初期开放免费体验周期,后续转为正式计费模式
📂开源信息
- 协议:MIT 协议,允许商用、二次微调、本地部署、私有化落地
- 获取:Hugging Face 智谱官方仓库可下载权重,支持本地推理、微调、二次开发
✨亮点总结
- 少见的 “先匿名海外公测爆火,再官宣 + 开源” 模式;
- MoE 大总参、小激活,兼顾强能力与推理成本;
- 原生多模态 + 百万上下文,MIT 协议对开发者非常友好;
- 全部算力跑国产芯片,国产大模型出海出圈案例。
GLM‑5.3‑Flash(牛来 / Ox‑Alpha)应用场景
核心优势:百万 token 超长上下文、原生图文视频多模态、强 Agent 智能体、强代码能力、MIT 开源可私有化、MoE 低推理成本。适合复杂长任务、多模态工程类、企业私有化部署。
1️⃣ AI 代码开发 & 编程 Agent(最强场景)智谱AI
- 完整代码库分析:喂入百万级代码仓库,做代码解读、漏洞排查、重构、版本迁移
- 视觉驱动编码:截图 UI 设计稿直接生成前端页面、移动端 App 完整交互代码;观察渲染结果自动迭代调试
- SWE 软件工程:复现 bug、写单元测试、项目脚手架、全栈项目生成
- 游戏开发:Godot、网页 3D 游戏,生成完整可运行游戏工程,多轮迭代优化
- 适配 Cursor、OpenCode、ZCode 等 AI 编码工具,适合开发者、外包团队、内部研发助手
2️⃣ 通用 Agent 智能体、自动化工作流CSDN博...
- 计算机操作 Agent (CUA/BUA):理解网页截图、GUI 界面,拆解复杂任务,调用工具循环执行、自检修正
- 长程多步骤任务:可连续运行数小时,多轮自我迭代,适合复杂自动化流程
- 企业内部智能助手:串联文档、数据库、联网搜索,完成调研、报告、工单处理
3️⃣ 长文档处理、企业办公文档解析(百万上下文)
支持 PDF、Word、PPT、Excel、扫描件图片、长报告批量处理
- 财报、合同、法律卷宗、技术手册整本读取、要点提取、风险标注、对比分析
- 批量文档总结、问答、生成 PPT/Excel 输出成品
- 知识库 RAG 底座:百万上下文可以减少切片,大幅提升长文档问答准确率,私有化部署保障数据安全
4️⃣ 金融、研报、行业研究场景
- 批量研报、财报、公告解析,自动做数据提取、观点汇总、横向对比
- 行业深度报告撰写,自动引用原文溯源,输出完整分析文档
提示:不做投资决策,仅做信息整理
5️⃣ 多模态创意工程(图片 + 视频理解)
- 3D / 建模:Blender 场景生成,根据文字 / 参考图,生成完整室内、建筑、物件 3D 工程文件,长时间迭代渲染效果
- 视频理解:长视频内容分析、多人说话人区分、生成精准时间轴字幕、视频内容摘要
- CAD 图纸识别复刻:图纸图片转代码 / 参数化模型
- UI/UX 设计转代码:设计稿截图直接产出可运行前端代码
6️⃣ 企业私有化部署、行业二次微调(MIT 协议)
MIT 协议允许商用、二次微调、本地私有化部署,适合:
- 政企、制造业、金融,数据不能出内网,本地跑前沿多模态大模型
- 在基座基础上做行业微调,搭建垂直领域大模型(法务、工业文档、医疗文档等)
- 中小公司自建 AI 能力,不用依赖闭源 API 高额费用
7️⃣ 教育、科研场景
- 整本教材、论文集阅读答疑、文献综述生成
- 理工科代码仿真、实验流程复现、科研辅助编程
- 教学智能助教,处理超长课件、试卷材料
8️⃣ 不适合的场景(能力边界)
- 超高并发简单闲聊:MoE 架构更适合单条复杂长任务,简单高频问答性价比不如小模型;
- 实时毫秒级低延迟场景,长上下文推理会有一定耗时;
- 强实时高可靠生产业务,需要做输出校验,不能直接裸上生产。
选型小结
优先选牛来 (GLM‑5.3‑Flash):任务复杂、需要读巨量文档、要看图看视频、需要 Agent 多轮迭代、希望私有化开源商用。 简单问答、高并发对话,优先选更小的 GLM‑4 系列小模型。
👀 阅读量:37 次
