跳到正文
openrouter blog·· 10 天前精選AI 評分74

NVIDIA 釋出 Nemotron 3.5 Lightning:30B 混合專家模型專為高頻工具呼叫設計

What Is Nemotron 3.5 Lightning

AI 導讀

NVIDIA 釋出 Nemotron 3.5 Lightning,這是一款 30B 混合專家語言模型,每個 token 只啟用約 3B 引數,專為高頻工具呼叫與執行層任務設計。

推薦理由

NVIDIA 推出的 Nemotron 3.5 Lightning 以 30B 模型,3B 引數,適合工具呼叫,讀者可評估成本與效能。

正文 · AI 翻譯

代理程式可能只需一次複雜的呼叫來規劃任務,之後則需要數十次呼叫來執行。後續的呼叫會讀取檔案、選擇工具、驗證結果並決定下一步。NVIDIA 為此高頻工作流程打造了 Nemotron 3.5 Lightning。

Nemotron 3.5 Lightning 是一個擁有 300 億引數的混合專家模型,每個 token 只啟用約 30 億引數。它支援工具呼叫、編碼任務、指令執行以及其他範圍明確的代理步驟。

名稱容易與 Nemotron 3 Ultra 混淆,但兩者設計用於代理工作流程的不同階段。選擇哪一個會影響整個執行的成本、延遲與可靠性。

Nemotron 3.5 Lightning 一覽

規格Nemotron 3.5 Lightning
模型型別Hybrid Mamba-2、注意力與混合專家語言模型
模型大小30B 總引數,3B 活躍引數
輸入與輸出文字到文字
模型上下文限制最高 100 萬 tokens,參照 NVIDIA 的模型卡
OpenRouter 標準模型每個現行供應商均提供 262,144 token 的上下文。完成限制因供應商而異,從 32,768 到 235,929 token
OpenRouter 免費模型1,000,000 token 上下文,最多 65,536 token 完成
工具呼叫兩個模型皆列出。四個現行標準供應商中有兩個列出
結構化輸出標準模型在四個現行供應商上皆列出。免費模型未列出
OpenRouter 模型 IDnvidia/nemotron-3.5-lightning 與 nvidia/nemotron-3.5-lightning:free
權重BF16 參考權重,另外提供最佳化的 NVFP4 與 GGUF 版本
授權OpenMDW-1.1
發布日期2026 年 8 月 11 日

此表格中的端點限制與功能均來自我們於 2026 年 9 月 11 日的模型頁面。請在設計前先檢查 標準模型頁面 或 免費模型頁面。

30B MoE 搭配 3B 活躍引數是什麼意思?

Nemotron 3.5 Lightning 是一個稀疏混合專家模型。它總共擁有 300 億引數,但並非每個 token 都會使用所有專家。路由器會在模型處理每個 token 時選擇較小的專家子集,從而將活躍引數數量降至約 30 億。你也會看到以 30B-A3B 的形式表示,意即 300 億總引數與約 30 億活躍引數。

此設計使模型比 30 億引數的稠密模型擁有更大的總容量,而不必為每個 token 執行所有 300 億引數。這就是 Lightning 將相對較大的檢查點與頻繁代理呼叫所需的吞吐量結合的方式。

活躍引數數量並非完整的計算或記憶體規格。完整模型仍須儲存,且共享層在推論時也會執行。硬體需求取決於精度、上下文長度、推論引擎、批次策略與快取配置。

Lightning 亦採用混合架構,而非純 Transformer 堆疊。NVIDIA 模型卡描述了交錯的 Mamba-2 與 MoE 層,並選擇性加入注意力層。它亦支援可配置的推理,並隨附多 token 預測與兩個推測式解碼草稿器 DSpark 與 DFlash,以加速產生,同時提供針對推論調校的 NVFP4 檢查點。

Nemotron 3.5 Lightning 主要設計用途為何?

長期執行的代理程式會發出大量模型呼叫。部分呼叫需要複雜規劃,而許多工作範圍較窄,例如選擇工具、產生引數、驗證結果、編輯檔案或決定下一步。

NVIDIA 將 Lightning 定位於執行層級。當您的工作負載具備以下特徵時,該模型可作為候選。

  • 代理程式會進行多次呼叫,延遲或成本會隨整個執行而累積。
  • 每一次呼叫都有明確目標且具備足夠上下文以完成任務。
  • 模型需要使用工具、遵循指令或回傳結構化資料。
  • 您想要可自訂的開放權重,以適用於特定領域或部署目標。

例如,編碼代理程式可以使用更大的推理模型來檢查倉庫並決定實作計畫;Lightning 則可處理個別步驟,例如定位符號、編輯單一檔案、執行工具並解讀結果。

Nemotron 3.5 Lightning 與 Nemotron 3 Ultra 的比較

NVIDIA 從 Nemotron 3 Ultra 提煉的 Lightning,但兩個模型並不相互可替換。Lightning 是較小的模型,適用於高頻代理執行;Ultra 則為較大的模型,適用於複雜推理與協調。

Nemotron 3.5 LightningNemotron 3 Ultra
OpenRouter 模型 IDnvidia/nemotron-3.5-lightningnvidia/nemotron-3-ultra-550b-a55b
總引數量30B550B
活躍引數量3B55B
主要角色高頻執行與專業任務複雜推理與協調
OpenRouter 上的上下文每個現行供應商皆提供 262,144 令牌依供應商不同,提供 202,800 至 262,144 令牌
工具呼叫列於四個現行供應商中的兩個列於所有現行供應商
結構化輸出列於所有現行供應商列於四個現行供應商中的一個
2026 年 9 月 11 日的供應商價格$0.065 至 $0.10/M 輸入,$0.18 至 $0.25/M 輸出$0.50 至 $0.625/M 輸入,$2.20 至 $3.125/M 輸出

NVIDIA 報告稱 Lightning 的吞吐量可達相同規模開放模型的四倍。在 NVIDIA 的 PinchBench 測試中,它以相似準確度完成 10,000 個代理任務,速度提升高達 30%。這些為供應商報告的結果,請自行測試吞吐量與任務完成度。

區別在於呼叫的難度與後果。當一步需要在模糊問題上進行深度推理、制定長流程計畫或作出難以逆轉的決策時,Ultra 更合適;若任務範圍明確且重複度足夠,延遲與成本成為關鍵,Lightning 更適用。

您不必將單一模型分配給整個代理。將複雜呼叫路由至 Ultra,頻繁執行呼叫路由至 Lightning,然後衡量混合配置是否在不降低可靠性的前提下提升每完成任務的成本。

Diagram of a two-model agent pattern. A planning model such as Nemotron 3 Ultra inspects the task, writes the plan, and delegates each step. Nemotron 3.5 Lightning runs a loop of calling a tool, checking the result, and taking the next step. A note says your application or a model router decides which model handles each call.

在 OpenRouter 上在兩個模型之間路由

若您願意將模型選擇交給我們,請使用 Auto Router。將 openrouter/auto 作為模型 ID 傳送,Auto Router 會先分類提示,再根據任務型別、模型能力、工具支援與成本選擇模型。cost_tier 設定選擇成本區間,從 low 到 max。它不會將對話從較便宜的模型升級至更昂貴的模型。若您希望 Auto Router 僅在 Lightning 與 Ultra 之間選擇,請用 allowed_models 限制其選項。

在 OpenRouter 之外在兩個模型之間路由

NVIDIA 的 NeMo Switchyard 將此路由模式實作為開源的協調層。其升級路由器在每段對話開始時使用成本較低的模型,當 LLM 判斷持續困難時,會將會話遷移到更強大的模型。在 LangChain 的評估中對 145 個多步驟代理任務進行測試,Lightning 與 Claude Opus 4.8 之間的路由將成本較僅使用前沿模型基線低 74%,同時將約 7% 的呼叫送至前沿模型。準確率大約低六個點。此結果顯示該基準上的路由折衷。它不是 Lightning 與 Ultra 組合的基準。請在依賴節省前,先在自己的任務上測試任何路由設定。

上下文視窗長度是多少?

Nemotron 3.5 Lightning 在模型層級支援多達 1 百萬個 token。可供您應用程式使用的上下文取決於提供該模型的端點。

於 2026 年 9 月 11 日,所有標準模型 ID 背後的供應商都公開 262,144 個 token 的上下文視窗。完成限制因供應商而異,從 32,768 到 235,929 個 token。:free 模型公開完整的 1 百萬 token 上下文視窗,且將完成量限制為 65,536 個 token。

若請求需要超過 262,144 個 token,僅免費端點目前在 OpenRouter 上公開模型完整的 1 百萬 token 上下文。NVIDIA 在該端點的通知指出使用情形將被記錄以供安全目的及改進 NVIDIA 產品與服務,並請您勿上傳機密資訊或個人資料。對於敏感或生產環境的長上下文工作負載,請選擇其他端點或模型。

當您在兩個模型 ID 之間切換時,這種差異會產生影響。在免費端點成功的請求可能會超過標準端點的上下文限制。免費端點還列出了工具呼叫,但未列出 response_format 或結構化輸出。

請檢視模型頁面,而非將架構的最大上下文視為所有供應商的承諾。我們在模型頁面上顯示每個端點的當前限制與支援引數。

開放權重與本地部署

NVIDIA 以 OpenMDW-1.1 授權發布 BF16 參考檢查點。模型卡描述 BF16 版本為後續訓練、領域適配、研究及產出最佳化變體的起點。NVIDIA 還發布訓練資料與客製化與評估的配方,模型卡表示此版本已準備好商業使用。

對於直接推論,NVIDIA 推薦其 NVFP4 版本。它也為支援的本地系統提供 GGUF 檢查點。BF16 指南列出了 H100 80GB 或 A100 80GB 作為單 GPU 部署的硬體。最佳化版本針對 RTX 5090、RTX PRO 6000 以及 DGX Spark 等硬體。

在本地執行模型並不代表每臺機器都能提供完整的 1 百萬 token 上下文視窗。在 NVIDIA 當前的 Ollama 指南中,預設上下文隨可用 VRAM 變動。低於 24GB 時為 4K,24GB 到低於 48GB 時為 32K,48GB 或以上時為 256K。llama.cpp 範例使用約 40K。您可以提高這些限制,並且此舉可能需要更多記憶體或 CPU 離載。

權重公開可取得,且「open-weight」是最清楚的描述。在您重新釋出修改後的模型或根據其條款做部署決策前,請閱讀 OpenMDW-1.1 授權。

如何在 OpenRouter 上呼叫 Nemotron 3.5 Lightning

若你不想自行配置 GPU 或管理推理引擎,請透過 OpenRouter 呼叫 Lightning。標準模型 ID 保持相同的 API,同時我們將請求路由至該模型可用的各供應商。

安裝 OpenRouter TypeScript SDK。

npm install @openrouter/sdk

在環境中設定 OPENROUTER_API_KEY,然後使用 Lightning 模型 ID 傳送請求。標準模型列出結構化輸出,因此你可以要求 JSON 架構,並讓回應符合該架構。

import { OpenRouter } from "@openrouter/sdk";

const openRouter = new OpenRouter({
  apiKey: process.env.OPENROUTER_API_KEY,
});

const result = await openRouter.chat.send({
  chatRequest: {
    model: "nvidia/nemotron-3.5-lightning",
    messages: [
      {
        role: "user",
        content:
          'Ticket: "Checkout returns a 500 after I click Pay. Started this morning, three customers affected." Return its category and priority.',
      },
    ],
    responseFormat: {
      type: "json_schema",
      jsonSchema: {
        name: "triage",
        strict: true,
        schema: {
          type: "object",
          properties: {
            category: { type: "string" },
            priority: { type: "string", enum: ["low", "medium", "high"] },
          },
          required: ["category", "priority"],
          additionalProperties: false,
        },
      },
    },
    provider: {
      requireParameters: true,
    },
  },
});

if (!("choices" in result)) {
  throw new Error("Expected a non-streaming response");
}

console.log(result.choices[0]?.message.content);

我們於 2026 年 9 月 11 日執行此請求時,模型回傳 {"category": "Bug (Payment Checkout)", "priority": "medium"}。取樣輸出在不同執行間會有所差異,而請求保證的是結構,而非具體值。

同一模型內,response_format 與結構化輸出的供應商支援程度不同。預設我們會偏好支援你傳送的 tools 與 response_format 引數的供應商,若供應商不支援某引數則會忽略。將 require_parameters 設為 true(如範例所示)會將請求限制於支援所有引數的供應商。請參閱 供應商路由檔案 以瞭解完整行為。

若要試用免費端點,請將模型 ID 改為 nvidia/nemotron-3.5-lightning:free。免費端點不列出 response_format,因此請移除該欄位並自行驗證 JSON。它對於評估與低量實驗很有用,且其限制與可用性與標準端點不同。

請勿透過免費端點提交機密資訊或個人資料。其模型頁面載有 NVIDIA 的通知,說明使用情況會被記錄以提升安全與 NVIDIA 產品與服務。請在決定傳送哪些提示前先閱讀該通知。

預設情況下,我們會根據價格對標準模型的供應商進行負載平衡。兩個變體會改變這個排序。nvidia/nemotron-3.5-lightning:nitro 依吞吐量排序供應商,nvidia/nemotron-3.5-lightning:exacto 則偏好具有更強工具呼叫品質訊號的供應商。對於以延遲和工具使用為目的的模型,Nitro 與 Exacto 是兩個值得了解的變體。

Lightning 接受 tools 與 tool_choice,因此你也可以在代理迴圈中使用它。請參閱我們的 工具呼叫代理迴圈指南 以瞭解完整的請求、工具執行和迭代流程。

你應該使用 Nemotron 3.5 Lightning 嗎?

當你需要快速、開放權重模型以執行頻繁且明確的代理步驟時,Nemotron 3.5 Lightning 值得評估。其 30B-A3B 架構、工具支援以及低列示的每個 token 價格,使其成為代理通常會將每一次呼叫傳送到更大型推理模型的替代執行模型。

將模型名稱作為起點,而非決策。從代理執行的工具呼叫與任務建立評估集。測量整個執行過程中的任務成功率、重試次數、延遲與總成本。若代理頻繁重複呼叫或升級結果,較便宜的呼叫將無法帶來節省。

先從 nvidia/nemotron-3.5-lightning 開始,或使用 nvidia/nemotron-3.5-lightning:free 測試模型,再加入付費流量。

常見問題

Nemotron 3.5 Lightning 是什麼?

Nemotron 3.5 Lightning 是 NVIDIA 的開放權重 30B 混合專家語言模型,每個 token 約有 3B 活躍引數。NVIDIA 將其定位於高量代理執行、工具使用、編碼、指令遵循及專業任務。

Nemotron 3.5 Lightning 與 Nemotron 3 Ultra 相同嗎?

不是。Nemotron 3.5 Lightning 擁有 30B 總引數和 3B 活躍引數;Nemotron 3 Ultra 擁有 550B 總引數和 55B 活躍引數。Lightning 針對頻繁執行步驟;Ultra 針對複雜推理與編排。

30B-A3B 是什麼意思?

30B-A3B 表示該模型總共有 30 億引數,並且每個 token 會啟動大約 3 億引數。混合專家路由器會為每個 token 選擇模型專家的子集,而不是執行所有專家。

Nemotron 3.5 Lightning 支援工具呼叫與結構化輸出嗎?

標準的 OpenRouter 模型,nvidia/nemotron-3.5-lightning,列出了 tools、tool_choice、response_format 以及結構化輸出作為其支援的引數。支援度因供應商而異,若您的請求依賴其中之一,請將 require_parameters 設為 true。免費模型列出 tools 和 tool_choice,但不包含 response_format 或結構化輸出。

有免費的 Nemotron 3.5 Lightning API 嗎?

是的。我們列出 nvidia/nemotron-3.5-lightning:free,由 NVIDIA 提供且不收取 token 費用。免費模型的速率限制與可用性與付費模型不同,且此端點帶有 NVIDIA 資料通知。請勿透過此端點傳送機密資訊或個人資料。

我可以在本機執行 Nemotron 3.5 Lightning 嗎?

可以。NVIDIA 以 OpenMDW-1.1 授權發布 BF16、NVFP4 與 GGUF 權重。BF16 參考檢查點針對單一 80GB H100 或 A100。NVFP4 與 GGUF 版本則針對支援的本機硬體,例如 RTX 5090、RTX PRO 6000 與 DGX Spark。選擇部署前請先檢查 NVIDIA 目前的模型卡與授權。

來源:openrouter blog · openrouter.ai