跳至正文

英伟达最新开源 MoE 大模型NVIDIA-Nemotron-3.5-Lightning-30B-A3B

定位:英伟达最新开源 MoE 大模型,主打本地 / 边缘 AI Agent(智能体)高频任务执行

英伟达
英伟达

名称全称:NVIDIA-Nemotron-3.5-Lightning-30B-A3B

一、核心硬件与架构参数

  • 架构:Mamba-2 + MoE + GQA Attention 混合架构,52 层;128 专家,每 token 路由激活 Top-6 专家
  • 参数量:总 30B(300 亿),推理仅激活≈3B(行业常标注 30B-A3B;精确理论值 31.6B / 激活 3.6B 为细分统计口径)
  • 上下文窗口:最高 1,000,000 tokens(百万上下文)
  • 词表:131072
  • 训练规模:预训练>20T tokens
  • 原生优化:MTP 多 token 预测、DFlash / DSpark 两套推测解码方案,大幅提升吞吐
  • 特色功能:支持开关 thinking 推理模式,可控思考 token 预算

二、显存与部署门槛(重点)

原生提供两种权重:

  1. BF16 完整版:≈60GB
  2. NVFP4 4bit 量化官方权重≈15~16GB 显存即可运行消费级显卡可行性
  • RTX 4090 / RTX 5090(24G)流畅跑百万上下文
  • RTX 4080S/5080(16G)NVFP4 可部署,长上下文建议关闭部分优化
  • 最低门槛:16GB VRAM;8G 卡只能极小上下文测试

支持平台:RTX 消费显卡、RTX PRO 工作站、DGX Spark、Jetson、H100/H200/GB200

三、许可协议(商用关键)

OpenMDW-1.1 License允许商业用途、微调、蒸馏、二次分发 ✅ 开放权重、训练配方;禁止拆分单独出售模型权重牟利(协议限制) 权重已上架:Hugging Face、ModelScope、Ollama、LM Studio

四、适用场景(设计目标)

不主打深度复杂逻辑推理,定位多智能体系统里的「执行层模型」

  1. Agent 工具调用、API 调用、结果解析、重试逻辑
  2. 长链条自动化工作流、持久记忆检索(百万上下文存放历史任务)
  3. RAG 长文档摘要、信息抽取、日志分析
  4. 代码脚本生成、简单代码审查
  5. 本地私有化智能体(数据不出本机)

英伟达架构思路:Nemotron 3 Ultra(规划 / 复杂决策)+ Nemotron 3.5 Lightning(大批量子任务执行) 分层调度;同步配套发布 NeMo Switchyard 智能模型路由库。

五、性能亮点

  • 同等显存占用下,吞吐最高可达传统稠密 30B 模型 4 倍
  • Agent 基准 PinchBench:85.37%
  • 相比前代 Nemotron 3 Nano,工具调用准确率显著提升,延迟降低
  • 优势:大 MoE 容量、小激活开销,兼具大模型知识库与小模型推理速度

六、短板(必须知晓)

  1. 中文原生能力一般:预训练主体为英、日、德、法等;需要额外中文 LoRA 微调才能达到可用水平
  2. 硬核数学、复杂多步骤逻辑弱于 Nemotron 3 Super / Ultra,适合执行而非顶层规划
  3. GGUF 第三方量化刚起步,最优推理方案优先使用官方 NVFP4 权重 + SGLang / TensorRT-LLM

七、Nemotron 家族横向对比简表

表格

模型总参激活参定位
Nemotron 3.5 Lightning30B3B本地 Agent、高频执行、边缘部署
Nemotron 3 Nano30B3B上一代轻量 MoE(已被 Lightning 迭代替代)
Nemotron 3 Super120B12B通用复杂对话、中等难度 Agent 规划
Nemotron 3 Ultra550B55B旗舰深度推理、复杂任务统筹

八、快速上手渠道

  • HF 官方仓库:nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
  • Ollama 已提供一键运行镜像
  • 推理框架原生支持:TensorRT-LLM、SGLang、vLLM
👀 阅读量:292
标签:

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

分享
扫码分享

扫码分享本文

//这里粘贴百度统计完整script代码