Nemotron 3 是什么:定位与核心架构
Nemotron 3 是英伟达于 2025 年 12 月 15 日发布的开源大语言模型系列。该系列包含 Nano、Super、Ultra 三个型号,分别对应 300 亿、1000 亿、5000 亿参数规模。根据官方定位,该系列面向多智能体系统和工业级推理场景,强调高吞吐、低成本与可审计性。

该系列采用分阶段发布策略。Nano 作为首个型号已正式上线,Super 与 Ultra 预计在 2026 年上半年陆续推出。这种分层设计让开发者能按需选择,避免资源浪费。
发布时间与系列构成
Nemotron 3 于 2025 年 12 月 15 日发布。系列包含三个型号:
- Nano:300 亿参数,每次激活约 30 亿参数,针对高效任务优化。
- Super:约 1000 亿参数,每次激活约 100 亿参数,面向多智能体应用。
- Ultra:约 5000 亿参数,每次激活约 500 亿参数,用于复杂 AI 应用。
根据新浪财经 2025 年 12 月 16 日报道,Nano 已上市,Super 与 Ultra 尚未完全推出。官方数据表明,Nano 的 token 吞吐量比前代高 4 倍,推理 token 生成量减少 60%。
混合 Mamba-Transformer MoE 架构
该系列的核心是混合 Mamba-Transformer 专家架构。它融合三种技术:
- Mamba 层:以低内存开销追踪长程依赖,支持 100 万 token 上下文。
- Transformer 层:通过注意力机制捕捉复杂逻辑,提升代码与数学推理精度。
- MoE 路由:动态调用专家网络,每个 token 仅激活部分参数,提高计算效率。
这种架构让模型在保持精度的同时显著降低推理成本。官方数据显示,Nano 的吞吐量提升 4 倍,推理 token 生成量减少 60%。
Nemotron 3 主要功能:从长上下文到多智能体
Nemotron 3 的功能围绕长上下文、多智能体协作与推理效率展开。以下逐项说明。
100 万 token 上下文窗口
该系列原生支持最高 100 万 token 的上下文窗口。这一能力让模型能够完整保存任务背景、历史记录与复杂计划。
实际应用包括:处理大型代码库、分析学术论文、支持多智能体共享长期记忆。相比传统文本切割,它避免了信息碎片化。
多 Token 预测与潜在 MoE
多 Token 预测(MTP)让模型一次预测多个未来 token。这提供更丰富的训练信号,促使模型提前规划推理步骤。官方说明,MTP 在规划、轨迹生成、代码生成等场景中特别有效。
潜在 MoE(Latent MoE)是 Super 与 Ultra 版本的进阶技术。它先将数据投影到更小的潜在维度进行专家路由,再投影回原维度。这样能以相同计算成本调用四倍专家数量,提升复杂推理精度。
推理成本与吞吐量优化
官方数据显示,Nano 版吞吐量提升 4 倍,推理 token 生成量减少 60%。这得益于混合架构与动态稀疏激活。
具体而言,MoE 机制让每个 token 仅激活约 30 亿参数,而非全部 300 亿。这大幅降低计算开销。同时,NVFP4 低精度训练格式在 GB300 芯片上提供 FP8 三倍的峰值吞吐量。
Nemotron 3 怎么快速上手:部署与调用
开发者可通过多种渠道获取并部署该系列模型。以下介绍主要方式。
从 Hugging Face 获取模型权重
模型权重已在 Hugging Face 平台开放。开发者可直接下载使用。
以 Nano 为例,模型 ID 为 nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B。使用 Transformers 库加载的示例代码:
from transformers import AutoTokenizer, AutoModelForCausalLM
tokenizer = AutoTokenizer.from_pretrained("nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B")
model = AutoModelForCausalLM.from_pretrained("nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B")
使用 NVIDIA NIM 微服务部署
企业用户可通过 NVIDIA NIM 微服务部署模型。NIM 支持在 NVIDIA 加速基础设施上安全、可扩展地运行。
该方式适合对隐私和控制权要求较高的场景。部署位置可以是本地数据中心或云端。
API 端点与集成方式
该系列支持通过 API 调用,并与多种框架集成。
- LangChain:用于构建智能体工作流。
- OpenRouter:提供统一 API 访问多个模型。
- vLLM、SGLang、llama.cpp:主流推理引擎支持。
根据掘金 2026 年 7 月 27 日报道,Nemotron 3 Ultra 可通过 Nous Portal 免费使用两周,模型变体为
nvidia/nemotron-3-ultra:free。
Nemotron 3 同类工具横向比较
本节将 Nemotron 3 与主流开源模型进行对比。维度包括参数规模、架构、上下文长度与推理效率。
与 Llama 3.1 系列对比
Llama 3.1 系列基于传统 Transformer 架构。Nemotron 3 采用混合 Mamba-Transformer MoE 架构。
| 比较维度 | Nemotron 3 Nano | Llama 3.1 70B |
|---|---|---|
| 总参数 | 300 亿 | 700 亿 |
| 激活参数 | 30 亿 | 700 亿 |
| 上下文窗口 | 100 万 token | 128K token |
| 架构 | 混合 Mamba-Transformer MoE | 纯 Transformer |
根据搜狐 2024 年 10 月 17 日报道,Nemotron-70B 基于 Llama-3.1-70B 开发,但 Nemotron 3 系列是全新架构。
与 DeepSeek R1 对比
DeepSeek R1 是开源推理模型,强调推理能力。Nemotron 3 更侧重多智能体与长上下文。
- 推理能力:DeepSeek R1 在数学与代码推理上表现突出。Nemotron 3 通过 MTP 与潜在 MoE 优化长序列推理。
- 开源程度:两者均开放权重。但 Nemotron 3 额外开源训练数据与工具链。
- 部署成本:Nemotron 3 Nano 的激活参数仅 30 亿,推理成本更低。
与 Mistral 系列对比
Mistral 系列以高效著称。Nemotron 3 在长上下文与多智能体优化上更具优势。
- 长上下文:Mistral 大型模型通常支持 128K token。Nemotron 3 支持 100 万 token。
- 多智能体:Nemotron 3 专为多智能体协同设计,Mistral 系列未特别优化此场景。
- 效率:两者均采用 MoE,但 Nemotron 3 的混合架构进一步降低内存开销。
Nemotron 3 应用场景:企业级智能体落地
该系列已应用于多个行业。以下列举典型场景。
网络安全:CrowdStrike 的漏洞排查
CrowdStrike 将 Nemotron 模型应用于旗下专用智能体。该智能体可不间断排查漏洞、划分风险等级并修复配置错误。
根据 IT 之家 2026 年 6 月 1 日报道,这既能更快抵御网络攻击,也减轻了安全团队的运维压力。
软件开发:Cursor 与 CodeRabbit 的集成
Cursor 与 CodeRabbit 等软件开发智能体正在集成该模型。
- Cursor:用于代码生成与调试辅助。
- CodeRabbit:用于代码审查,以更低成本实现更高准确性。
根据腾讯网 2026 年 3 月 12 日报道,CodeRabbit 将 Nemotron 3 Super 与专有模型集成。
企业流程自动化:Palantir 与西门子
Palantir 将 Nemotron 模型接入其前线部署工程师(AI FDE)平台,实现复杂任务自主执行。
西门子等行业领导者正在部署和定制该模型,用于电信、半导体设计和制造领域的工作流程自动化。
Nemotron 3 优势和不足:技术收益与限制
该系列带来显著技术收益,但也存在当前限制。
降低推理成本与提升吞吐量
通过 MoE 架构与 MTP 技术,推理成本大幅降低。官方数据显示,Nano 的 token 吞吐量提升 4 倍,推理 token 生成量减少 60%。
这意味着实际推理成本可降低 60% 以上。对于大规模部署 AI 应用的企业,这一优势明显。
开源透明度与可审计性
训练数据、权重与技术报告全部开放。英伟达开源了 3 万亿 token 的预训练数据集、1300 万监督微调样本以及 90 万+强化学习任务。
这为企业提供前所未有的透明度。企业可在自有基础设施上部署,确保数据不离开内部环境。
当前限制:Super 与 Ultra 尚未完全发布
截至 2026 年初,Super 与 Ultra 仍在陆续推出中。Nano 已上市,但更高规格型号的可用性有限。
根据新浪财经 2025 年 12 月 16 日报道,Super 与 Ultra 当时尚未完全发布。这限制了需要大规模参数模型的企业用户。
Nemotron 3 最近更新带来的变化
2026 年以来,该系列持续迭代。以下梳理主要更新。
Nemotron 3 Super 正式发布
2026 年 3 月,Super 版上线。根据腾讯网 2026 年 3 月 12 日报道,该模型拥有 1200 亿参数,其中 120 亿参数在推理时活跃。
它专为大规模运行复杂的智能体 AI 系统设计。Perplexity 将其作为 Computer 中 20 个协调模型之一。
Nemotron 3 Ultra 与 Nemotron 3.5 Lightning
2026 年 6 月,Ultra 发布。根据 IT 之家 2026 年 6 月 1 日报道,Ultra 拥有 5500 亿参数,推理速度最高提升 5 倍,使用成本最高降低 30%。
2026 年 8 月,推出 Nemotron 3.5 Lightning。根据腾讯网 2026 年 8 月 12 日报道,该模型为 300 亿参数 MoE 架构,文本输出速度最高提升四倍。
总体评价:技术成熟度与推荐指数
Nemotron 3 在技术成熟度上表现突出。混合架构与长上下文能力经过实际部署验证。
对于需要构建多智能体系统的企业,该系列值得评估。Nano 已可用于生产环境。Super 与 Ultra 的陆续发布扩展了能力边界。
但需注意,部分高级功能依赖 NVIDIA 硬件。在非 NVIDIA 环境下的性能可能受限。
数据隐私与安全:开源模型的可控性
该系列的开源特性赋予企业高度可控性。模型权重、训练数据与工具链全部开放。
企业可在自有基础设施上部署,避免数据外流。对于政府、金融、医疗等监管行业,这一点至关重要。
英伟达还提供 Nemotron Agentic Safety Dataset,包含约 11,000 条智能体安全轨迹标注示例,帮助团队诊断和缓解安全风险。
学习曲线:从入门到生产部署
上手难度中等。开发者需要熟悉 Python 与 Transformers 库。
文档质量较高。官方提供模型卡、技术报告与示例代码。典型学习周期:
- 入门:1-2 天,完成模型加载与推理。
- 微调:1-2 周,掌握数据处理与训练流程。
- 生产部署:2-4 周,完成 NIM 或 vLLM 部署与性能调优。
对于非技术用户,直接使用云服务 API 是更简单的路径。
局限性与已知问题:开发者需注意的边界
目前存在一些公开限制与已知问题。
- 硬件依赖:NVFP4 等优化在 NVIDIA GPU 上效果最佳。其他硬件可能无法充分利用。
- 模型可用性:Super 与 Ultra 的某些变体仍在逐步推出。
- 社区生态:相比 Llama 等模型,第三方教程与适配工具较少。
根据掘金 2026 年 7 月 27 日报道,使用 Nous Portal 免费版时必须选择带
:free后缀的模型变体,否则会按付费档计费。
集成生态:API、插件与 Webhook 支持
该系列支持多种集成方式。
- API:通过 OpenRouter、NVIDIA NIM 提供标准 API。
- 插件:支持 LangChain、Hermes Agent 等智能体框架。
- Webhook:暂无官方 Webhook 支持,但可通过自定义服务实现。
根据 IT 之家 2026 年 7 月 8 日报道,LangChain 的 Deep Agents harness 已针对 Nemotron 3 Ultra 调优,在开放模型中达到最高准确率,推理成本比领先闭源模型低 10 倍。
