定位:英伟达最新开源 MoE 大模型,主打本地 / 边缘 AI Agent(智能体)高频任务执行

名称全称:NVIDIA-Nemotron-3.5-Lightning-30B-A3B
一、核心硬件与架构参数
- 架构:Mamba-2 + MoE + GQA Attention 混合架构,52 层;128 专家,每 token 路由激活 Top-6 专家
- 参数量:总 30B(300 亿),推理仅激活≈3B(行业常标注 30B-A3B;精确理论值 31.6B / 激活 3.6B 为细分统计口径)
- 上下文窗口:最高 1,000,000 tokens(百万上下文)
- 词表:131072
- 训练规模:预训练>20T tokens
- 原生优化:MTP 多 token 预测、DFlash / DSpark 两套推测解码方案,大幅提升吞吐
- 特色功能:支持开关
thinking推理模式,可控思考 token 预算
二、显存与部署门槛(重点)
原生提供两种权重:
- BF16 完整版:≈60GB
- NVFP4 4bit 量化官方权重:≈15~16GB 显存即可运行 ✅ 消费级显卡可行性
- RTX 4090 / RTX 5090(24G)流畅跑百万上下文
- RTX 4080S/5080(16G)NVFP4 可部署,长上下文建议关闭部分优化
- 最低门槛:16GB VRAM;8G 卡只能极小上下文测试
支持平台:RTX 消费显卡、RTX PRO 工作站、DGX Spark、Jetson、H100/H200/GB200
三、许可协议(商用关键)
OpenMDW-1.1 License ✅ 允许商业用途、微调、蒸馏、二次分发 ✅ 开放权重、训练配方;禁止拆分单独出售模型权重牟利(协议限制) 权重已上架:Hugging Face、ModelScope、Ollama、LM Studio
四、适用场景(设计目标)
不主打深度复杂逻辑推理,定位多智能体系统里的「执行层模型」
- Agent 工具调用、API 调用、结果解析、重试逻辑
- 长链条自动化工作流、持久记忆检索(百万上下文存放历史任务)
- RAG 长文档摘要、信息抽取、日志分析
- 代码脚本生成、简单代码审查
- 本地私有化智能体(数据不出本机)
英伟达架构思路:Nemotron 3 Ultra(规划 / 复杂决策)+ Nemotron 3.5 Lightning(大批量子任务执行) 分层调度;同步配套发布 NeMo Switchyard 智能模型路由库。
五、性能亮点
- 同等显存占用下,吞吐最高可达传统稠密 30B 模型 4 倍
- Agent 基准 PinchBench:85.37%
- 相比前代 Nemotron 3 Nano,工具调用准确率显著提升,延迟降低
- 优势:大 MoE 容量、小激活开销,兼具大模型知识库与小模型推理速度
六、短板(必须知晓)
- 中文原生能力一般:预训练主体为英、日、德、法等;需要额外中文 LoRA 微调才能达到可用水平
- 硬核数学、复杂多步骤逻辑弱于 Nemotron 3 Super / Ultra,适合执行而非顶层规划
- GGUF 第三方量化刚起步,最优推理方案优先使用官方 NVFP4 权重 + SGLang / TensorRT-LLM
七、Nemotron 家族横向对比简表
表格
| 模型 | 总参 | 激活参 | 定位 |
|---|---|---|---|
| Nemotron 3.5 Lightning | 30B | 3B | 本地 Agent、高频执行、边缘部署 |
| Nemotron 3 Nano | 30B | 3B | 上一代轻量 MoE(已被 Lightning 迭代替代) |
| Nemotron 3 Super | 120B | 12B | 通用复杂对话、中等难度 Agent 规划 |
| Nemotron 3 Ultra | 550B | 55B | 旗舰深度推理、复杂任务统筹 |
八、快速上手渠道
- HF 官方仓库:
nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 - Ollama 已提供一键运行镜像
- 推理框架原生支持:TensorRT-LLM、SGLang、vLLM
👀 阅读量:293 次
