
圖片來源: NVIDIA and Local AI Community Fuel Open Source Models and Intelligent Agents | NVIDIA Blog
本地 AI 的新紀元:NVIDIA Nemotron 3.5 與開源生態系
想過讓 AI 代理(AI Agents)直接在你的工作站執行,不必仰賴雲端服務嗎?這正是當前開源社群最活躍的領域。隨著 NVIDIA 與開源界合作加深,本地 AI 不再只是實驗性質,已能成為處理複雜任務的日常夥伴。
Nemotron 3.5 Lightning:為效率而生
NVIDIA 推出的 Nemotron 3.5 Lightning 是一款 300 億參數的 Mixture-of-Experts (MoE) 模型(包含 30 億活躍參數),專為隨時待命的代理執行層任務設計。
該模型的核心在於針對代理任務進行了優化,並在預訓練階段融入了多標記預測(Multi-Token Prediction, MTP)技術,且經歷了專門的 MTP 提升階段。不同於傳統模型逐字生成,MTP 與投機解碼技術能大幅提升生成速度。這讓其生成速度可達同尺寸類似模型的 4 倍;在 PinchBench 基準測試中,它更達到了 86% 的準確率,且處理 10,000 個代理任務的完成速度比 Qwen3.6 35B 快上 30%。對於需要頻繁編寫程式、處理大量文件的開發者而言,這種速度與吞吐效率的提升直接影響了日常生產力。
本地微調:把模型留在自己家
模型開源只是開端,關鍵在於客製化。由於 Nemotron 3.5 採用了 OpenMDW-1.1 開放許可證並釋出權重,開發者能針對特定領域進行微調。
你可以根據自己的程式風格調整模型,或是利用它來執行特定的企業工作流程。透過 NVIDIA NeMo Automodel 與 NeMo Megatron Bridge,所有的 LoRA 或全參數監督微調(SFT)過程與資料都能保留在本地系統,無需擔憂隱私資料上傳至第三方伺服器。
開發者的實務考量
在部署本地 AI 時,常面臨硬體與架構選擇的挑戰:
- 資源限制: 個人電腦與本地端可使用 llama.cpp、Ollama、LM Studio 或 Unsloth 等主流開源推理工具部署。若是在 DGX Spark 等高性能工作站或資料中心,則建議搭配 vLLM、SGLang 或 TensorRT-LLM 引擎來大幅提升處理效率。
- 投機解碼與草稿模型: 該模型隨附了專用的投機解碼(Speculative decoding)草稿模型(如 DSpark 與 DFlash)。其中 DSpark 草稿模型被特別推薦用於 DGX Spark 本地端推論以及低併發的資料中心工作負載,能藉此大幅降低推論延遲、加速代理反應。
- 本地集群協同: NVIDIA 已與 EXO Labs 等團隊展開深度合作,開發者可以利用 EXO 推論軟體在 DGX Spark 等本地設備上協同運行多機群,讓管理與調度本地硬體資源變得更加簡單與去中心化。
生態系的擴展
開源界的進展不只在 Nemotron。Meta 推出的 Muse Glimmer 同樣鎖定在 NVIDIA 平台上運行本地代理人(Agent)與程式編寫任務。此外,LTX-2.5 則將高品質的開源影片生成技術帶入本地,在配備 2 台 NVIDIA GB200 GPU 的企業級本地部署環境下,生成一段 10 秒 720p 影片僅需 6.8 秒,讓創作者能在自有機台上快速製作電影級的高畫質影片。
這些模型能運作順暢,背後得益於持續優化的硬體加速與軟體堆疊技術。無論是 RTX 5090 顯卡、NVIDIA Jetson 或是 DGX Spark,軟硬體的緊密配合,讓本地端的智慧能力已逐步拉近與雲端服務的距離。
下一步
若想親自嘗試,可以從 NVIDIA Local AI 資訊列表 開始。隨著 Unsloth 等開源微調與推理工具的普及,運行與微調 AI 的門檻已降至新低。
建議開發者參考 官方 GitHub cookbook。親手搭建一個屬於自己的代理 AI,當你意識到所有的計算與數據都保留在螢幕後的機器裡時,那種掌控感非常踏實。

圖片來源: nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 · Hugging Face



