← 返回 2026-09-28 简报

什么是 Nemotron 3.5 Lightning?

What Is Nemotron 3.5 Lightning

语音播报
摘要
事件:OpenRouter上线NVIDIA Nemotron 3.5 Lightning模型,专为高频Agent执行任务设计,提供标准与免费版本。 要点:30B参数MoE架构,仅激活3B参数,支持百万上下文及工具调用,吞吐量达同类模型四倍。 影响:显著降低长运行Agent的延迟与成本,适合代码编辑等明确目标场景,开发者可按需选择标准或免费接口。

智能体在规划任务时可能需要做出一次艰难的决策,而在执行该任务时则可能涉及数十次调用。这些后续的调用负责读取文件、选择工具、验证结果并决定下一步的操作。NVIDIA 为此工作流中高频调用的部分构建了 Nemotron 3.5 Lightning。

Nemotron 3.5 Lightning 是一个拥有 300 亿参数的混合专家(MoE)模型,每个 token 激活约 30 亿个参数。它支持工具调用、编码任务、指令遵循以及其他范围明确的智能体步骤。

该名称容易与 Nemotron 3 Ultra 混淆,但这两个模型是为智能体工作流的不同部分而构建的。在它们之间进行选择会影响整个运行过程的成本、延迟和可靠性。

Nemotron 3.5 Lightning 概览

规格:Nemotron 3.5 Lightning

模型类型:混合 Mamba-2、注意力机制和混合专家语言模型

模型大小:总共 300 亿参数,激活 30 亿

输入与输出:文本到文本

模型上下文限制:根据 NVIDIA 的模型卡片,最多支持 100 万个 token

OpenRouter 标准模型:所有当前提供商均提供 262,144-token 上下文。完成限制因提供商而异,从 32,768 到 235,929 个 token 不等

OpenRouter 免费模型:1,000,000-token 上下文,最多 65,536 个完成 token

工具调用:两个模型均列出。当前四个标准提供商中的两个列出了该功能

结构化输出:在所有四个当前提供商的标准模型中列出。未在免费模型中列出

OpenRouter 模型 ID:nvidia/nemotron-3.5-lightning 和 nvidia/nemotron-3.5-lightning:free

权重:BF16 参考权重,以及优化的 NVFP4 和 GGUF 版本

许可证:OpenMDW-1.1

发布日期:2026 年 8 月 11 日

本表中的端点限制和功能数据来源于我们于 2026 年 9 月 11 日的模型页面。在设计特定限制时,请先查看标准模型页面或免费模型页面。

30B MoE 且 3B 激活参数意味着什么?

通过订阅,您同意接收 OpenRouter 通讯:模型使用数据、产品更新和研究报道,大约每周一封电子邮件。您可以通过每封电子邮件中的链接随时取消订阅。请参阅我们的隐私政策。

Nemotron 3.5 Lightning 是一个稀疏混合专家模型。它总共包含 300 亿个参数,但并非对每个 token 都使用所有专家。路由器会在模型处理每个 token 时选择一个较小的专家子集,从而将激活参数数量降至约 30 亿。您也会看到这种写法为 30B-A3B,意为总共 300 亿参数和约 30 亿激活参数。

这种设计使模型拥有比 3B 稠密模型更大的总容量,而无需为每个 token 运行全部 300 亿个参数。这就是 Lightning 如何将相对较大的检查点与频繁智能体调用所需的吞吐量相结合的方式。

激活数量并非完整的计算或内存规格。整个模型仍然需要存储,并且在推理期间共享层也会运行。硬件要求取决于精度、上下文长度、推理引擎、批处理策略和缓存配置。

Lightning 还使用混合架构,而非纯粹的 Transformer 堆栈。NVIDIA 的模型卡片描述了交错排列的 Mamba-2 和 MoE 层以及选定的注意力层。它还支持可配置的推理,并附带多 token 预测功能以及两种推测解码草稿器 DSpark 和 DFlash,以实现更快的生成,同时提供针对推理优化的 NVFP4 检查点。

Nemotron 3.5 Lightning 旨在用于什么场景?

长期运行的智能体会进行大量模型调用。其中一些调用需要复杂的规划。大部分工作则较为狭窄,例如选择工具、生成参数、检查结果、编辑文件或决定下一步操作。

NVIDIA 将 Lightning 定位为这一执行层。当您的工作负载具有以下特征时,该模型是一个候选方案:

智能体进行多次调用,且延迟或成本在运行过程中累积。

每次调用都有明确的目标以及完成该目标所需的足够上下文。

模型需要使用工具、遵循指令或返回结构化数据。

您需要可自定义的开放权重模型,以便针对特定领域或部署目标进行调整。

例如,编码代理可以使用更大的推理模型来检查代码库并制定实施计划。Lightning 随后可以处理单个步骤,如定位符号、编辑文件、运行工具以及解释结果。

Nemotron 3.5 Lightning 与 Nemotron 3 Ultra 对比

NVIDIA 从 Nemotron 3 Ultra 中提炼出了 Lightning,但这两个模型并不 interchangeable(可互换)。Lightning 是用于高吞吐量代理执行的小型模型。Ultra 是用于复杂推理和编排的大型模型。

Nemotron 3.5 Lightning | Nemotron 3 Ultra

OpenRouter 模型 ID | nvidia/nemotron-3.5-lightning | nvidia/nemotron-3-ultra-550b-a55b

总参数量 | 30B | 550B

激活参数量 | 3B | 55B

主要用途 | 高吞吐量执行和专门任务 | 复杂推理和编排

OpenRouter 上的上下文支持 | 当前所有提供商均支持 262,144 tokens | 根据提供商不同,支持 202,800 至 262,144 tokens

工具调用支持 | 在四个当前提供商中的两个上列出 | 在所有当前提供商上列出

结构化输出支持 | 在所有当前提供商上列出 | 在四个当前提供商中的一个上列出

2026年9月11日的提供商价格 | 输入每百万 token $0.065 至 $0.10,输出每百万 token $0.18 至 $0.25 | 输入每百万 token $0.50 至 $0.625,输出每百万 token $2.20 至 $3.125

NVIDIA 报告称,Lightning 的吞吐量可达同类开放模型的四倍。在 NVIDIA 的 PinchBench 测试中,它在保持相当准确度的情况下,完成 10,000 个代理任务的速度提高了多达 30%。这些是厂商报告的测试结果,因此请根据您的自身工作负载测试吞吐量和任务完成情况。

区别在于调用的难度和后果。当某个步骤需要对模糊问题进行深度推理、为长工作流程制定计划或做出难以逆转的决策时,Ultra 是更合适的选择。当任务范围明确且重复频率足够高,使得延迟和成本变得重要时,Lightning 是更合适的选择。

您无需将一个模型分配给整个代理。将复杂调用路由到 Ultra,将频繁执行调用路由到 Lightning。然后衡量这种组合是否在不降低可靠性的情况下提高了每个完成任务的成本效益。

在 OpenRouter 上在这两个模型之间进行路由

如果您更愿意将模型选择交给我们,请使用 Auto Router(自动路由器)。将 openrouter/auto 作为模型 ID 发送,Auto Router 会在根据任务类型、模型能力、工具支持和成本选择模型之前对提示进行分类。cost_tier(成本层级)设置选择一个从低到高的成本区间。它不会将从较便宜模型的对话升级到较昂贵的模型。如果您希望 Auto Router 仅在 Lightning 和 Ultra 之间进行选择,请使用 allowed_models(允许使用的模型)限制其选择范围。

在 OpenRouter 之外在这两个模型之间进行路由

NVIDIA 的 NeMo Switchyard 将此路由模式实现为开源编排层。其升级路由器以较低成本的模型开始每次对话,当检测到持续困难时,LLM 裁判会将会话移动到更具能力的模型。在 LangChain 对 145 个多步骤代理任务的评估中,在 Lightning 和 Claude Opus 4.8 之间进行路由,与仅使用前沿模型的基线相比,成本降低了 74%,同时将约 7% 的调用发送到前沿模型。准确度降低了约六个百分点。这一结果展示了该基准测试上的路由权衡。它并非针对 Lightning 和 Ultra 组合的基准测试。在依赖任何节省之前,请在您自己的任务上测试任何路由设置。

上下文窗口有多长?

Nemotron 3.5 Lightning 在模型级别支持多达 100 万个 tokens。您的应用程序可用的上下文取决于为其提供服务的端点。

2026年9月11日,所有提供标准模型ID的提供商均开放了262,144个token的上下文窗口。不同提供商的生成限制各不相同,范围从32,768到235,929个token不等。:free模型则暴露出完整的100万token上下文窗口,并将生成量限制在65,536个token。

如果请求需要超过262,144个token,目前只有免费端点在OpenRouter上暴露该模型完整的100万token上下文。NVIDIA在该端点上的通知指出,使用情况会被记录用于安全目的以及改进NVIDIA的产品和服务,并建议用户不要上传机密信息或个人数据。对于敏感或生产环境下的长上下文负载,请选择其他端点或模型。

在两个模型ID之间切换时,这种差异至关重要。在免费端点上成功的请求可能会超出标准端点的上下文限制。免费端点也列出了工具调用功能,但未列出response_format或结构化输出。

请查看模型页面,而不要将架构的最大上下文视为每个提供商的承诺。我们在模型页面上显示了每个端点的当前限制和支持的参数。

开放权重与本地部署

NVIDIA在OpenMDW-1.1许可下发布了BF16参考检查点。模型卡片将BF16版本描述为后训练、领域适配、研究以及生产优化变体的起点。NVIDIA还发布了用于定制和评估的训练数据和配方,模型卡片指出该版本已准备好用于商业用途。

对于直接推理,NVIDIA推荐其NVFP4版本。它还提供了支持本地系统的GGUF检查点。BF16指南列出了单GPU部署所需的H100 80GB或A100 80GB硬件。优化后的版本针对RTX 5090、RTX PRO 6000和DGX Spark等硬件进行了目标优化。

在本地运行模型并不意味着每台机器都能提供完整的100万token上下文窗口。在NVIDIA当前的Ollama指南中,默认上下文大小随可用VRAM缩放:低于24GB时为4K,24GB至低于48GB时为32K,48GB及以上时为256K。llama.cpp示例使用约40K。您可以提高这些限制,但这可能需要更多的内存或CPU卸载。

权重已公开,“开放权重”是最准确的描述。在重新分发修改后的模型或围绕其条款做出部署决策之前,请阅读OpenMDW-1.1许可协议。

如何在OpenRouter上调用Nemotron 3.5 Lightning

如果您不想配置GPU或管理推理引擎,可以通过OpenRouter调用Lightning。标准模型ID保持相同的API,同时我们将请求路由到该模型的可用提供商。

安装OpenRouter TypeScript SDK。

npm install @openrouter/sdk

在环境中设置OPENROUTER_API_KEY,然后使用Lightning模型ID发送请求。标准模型列出了结构化输出,因此您可以要求JSON schema并让响应符合该schema。

import { OpenRouter } from "@openrouter/sdk" ;

const openRouter = new OpenRouter ({
apiKey: process.env. OPENROUTER_API_KEY ,
});

const result = await openRouter.chat. send ({
chatRequest: {
model: "nvidia/nemotron-3.5-lightning" ,
messages: [
{
role: "user" ,
content:
'Ticket: "Checkout returns a 500 after I click Pay. Started this morning, three customers affected." Return its category and priority.' ,
},
],
responseFormat: {
type: "json_schema" ,
jsonSchema: {
name: "triage" ,
strict: true ,
schema: {
type: "object" ,
properties: {
category: { type: "string" },
priority: { type: "string" , enum: [ "low" , "medium" , "high" ] },
},
required: [ "category" , "priority" ],
additionalProperties: false ,
},
},
},
provider: {
requireParameters: true ,
},
},
});

if ( ! ( "choices" in result)) {
throw new Error ( "Expected a non-streaming response" );
}

console.log(result.choices[0]?.message.content);
当我们在2026年9月11日运行此请求时,模型返回了{"category": "Bug (Payment Checkout)", "priority": "medium"}。采样输出在不同运行之间会有所差异,而请求保证的是模式(schema)而非具体值。

同一模型对 response_format 和结构化输出的支持因提供商而异。默认情况下,我们优先选择支持您发送的 tools 和 response_format 参数的提供商;不支持某个参数的提供商将忽略该参数。如示例所示,将 require_parameters 设置为 true 会将请求限制为支持其中所有参数的提供商。有关完整行为,请参阅提供商路由文档。

要尝试免费端点,请将模型 ID 更改为 nvidia/nemotron-3.5-lightning:free。免费端点未列出 response_format,因此请删除该字段并自行验证 JSON。它适用于评估和低容量实验,其限制和可用性也与标准端点不同。

不要通过免费端点提交机密信息或个人数据。其模型页面载有 NVIDIA 的通知,指出使用记录将用于安全目的以及改进 NVIDIA 的产品和服务。在决定发送哪些提示词之前,请查阅该通知。

默认情况下,我们按价格顺序对标准模型的提供商进行负载均衡。有两种变体可以改变这种排序。nvidia/nemotron-3.5-lightning:nitro 按吞吐量对提供商进行排序,而 nvidia/nemotron-3.5-lightning:exacto 则偏好具有更强工具调用质量信号的提供商。对于选择用于延迟和工具使用的模型,Nitro 和 Exacto 是两种值得了解的变体。

Lightning 接受 tools 和 tool_choice,因此你也可以在智能体循环中使用它。请参阅我们的工具调用智能体循环指南,以获取完整的请求、工具执行和迭代流程。

你应该使用 Nemotron 3.5 Lightning 吗?

当你需要一个快速、开放权重的模型用于频繁且定义明确的智能体步骤时,Nemotron 3.5 Lightning 值得评估。其 30B-A3B 架构、工具支持和较低的列示令牌价格使其成为那些原本会将每次调用发送给更大推理模型的智能体的候选执行模型。

将模型名称作为起点,而非决策依据。从你的智能体执行的工具调用和任务中构建评估集。测量整个运行过程中的任务成功率、重试次数、延迟和总成本。如果智能体重复执行该调用或频繁升级结果以至于抵消了节省的成本,那么更便宜的调用并无帮助。

从 nvidia/nemotron-3.5-lightning 开始,或使用 nvidia/nemotron-3.5-lightning:free 在添加付费流量之前测试该模型。

常见问题解答

什么是 Nemotron 3.5 Lightning?

Nemotron 3.5 Lightning 是 NVIDIA 的开放权重 30B 混合专家语言模型,每个令牌约有 3B 个激活参数。NVIDIA 将其定位为用于高容量智能体执行、工具使用、编码、指令遵循和专门任务。

Nemotron 3.5 Lightning 与 Nemotron 3 Ultra 相同吗?

不。Nemotron 3.5 Lightning 有 30B 总参数和 3B 激活参数。Nemotron 3 Ultra 有 550B 总参数和 55B 激活参数。Lightning 针对频繁的执行步骤,而 Ultra 针对复杂的推理和编排。

30B-A3B 是什么意思?

30B-A3B 意味着该模型总共有 300 亿个参数,每个令牌激活约 30 亿个参数。混合专家路由器为每个令牌选择模型专家的一个子集,而不是运行所有专家。

标准 OpenRouter 模型 nvidia/nemotron-3.5-lightning 将其支持的参数列为 tools、tool_choice、response_format 和结构化输出。支持情况因提供商而异,因此如果你的请求依赖于其中任何一个参数,请将 require_parameters 设置为 true。免费模型列出了 tools 和 tool_choice,但未列出 response_format 或结构化输出。

是否有免费的 Nemotron 3.5 Lightning API?

是的。我们列出了由 NVIDIA 免费提供的 nvidia/nemotron-3.5-lightning:free 模型,该模型由 NVIDIA 提供服务且不收取任何令牌费用。免费模型的速率限制和可用性不同于付费模型,且此端点附带 NVIDIA 数据通知。请勿通过该端点发送机密信息或个人数据。

我可以在本地运行 Nemotron 3.5 Lightning 吗?

可以。NVIDIA 在 OpenMDW-1.1 许可证下发布了 BF16、NVFP4 和 GGUF 权重。BF16 参考检查点针对单个 80GB H100 或 A100 GPU。

本条评分 8.4 score-v1
  • 来源权威 8
    注册表 priority=8(OpenRouter)
  • 时效 0.4
    发布 5.9 天前,已衰减到地板 0.4
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)
历史
刊期得分排名结果
2026-09-28 8.4 17 入选
2026-09-27 8.4 28 未入选
2026-09-25 8.77 46 未入选
2026-09-24 9.22 49 未入选
2026-09-23 9.95 36 未入选
原文链接:https://openrouter.ai/blog/insights/nemotron-3-5-lightning/
来源:OpenRouter
以上内容由 AI 自动翻译,仅供参考。
← 返回简报