
邁向自動駕駛新境界:NVIDIA Alpamayo 2 Super 具身智能模型深度解析
對於自動駕駛系統,尤其是機器人計程車(Robotaxi),真正的挑戰往往不是日常平穩的路線,而是突發、罕見且難以預測的長尾路況(Long-tail events)。在這些關鍵時刻,車輛不能僅依賴傳統的物體檢測或單純的路徑預測,還必須具備強大的物理邏輯推理能力,理解環境中的因果關係,做出安全決策,並將其轉化為舒適的行駛路徑。
為了解決這個硬核痛點,NVIDIA 推出了 Alpamayo 2 Super。這是一款專為自駕 percetion、planning 和決策任務設計的開源具身智能基礎模型(VLA, Vision-Language-Action),現已全面開放商業使用。
技術架構:VLM 底座與擴散動作專家的融合
Alpamayo 2 Super 並非普通的端到端模型,它基於全新的 NVIDIA Cosmos 3 Super Reasoner 進行建構,並在訓練後期經過了大規模的強化學習(Reinforcement Learning)優化。其總參數規模為 340 億(34B),架構設計極具特色:
- 32B 參數的 VLM 主幹網路(Backbone): 負責進行全周圍視野的多模態場景理解、邏輯推理與視覺問答(VQA)。
- 2.3B 參數的擴散式動作專家(Diffusion-based Action Expert): 專注於生成高精度的駕駛軌跡,能以 10 步擴散推論(Diffusion steps)生成平滑的規劃路線。
豐富的多模態輸入維度
傳統自駕模型通常只接收圖像,而 Alpamayo 2 Super 支援極其豐富的異構資料輸入:
- 多相機/多時間步圖像(Image/Video): 支援 360 度全方位相機覆蓋。標準測試中支援 6 到 7 顆相機,並且每顆相機輸入 4 幀同步歷史畫面,提供完整的環景時空上下文資訊。
- 文字指令(Text): 用於指導特定場景任務或進行 VQA 互動。
- 自車運動歷史(Egomotion History): 輸入包含 3 軸位移(x, y, z)與 9 維的 $3 \times 3$ 旋轉矩陣 $R_{\text{rot}}$,幫助模型結合自身慣性狀態做出精準決策。
5 大協同輸出:全透明的「因果決策鏈」
當車輛做出某個決定(如急煞或讓車)時,黑盒模型往往無法給出原因,這給安全驗證帶來極大困難。Alpamayo 2 Super 每一次推理都會同時產生 5 種高度緊密耦合的輸出,讓開發者能全面「透視」AI 的決策大腦:
- 駕駛軌跡(Trajectory): 輸出包含 64 個高頻路徑點,精確描述車輛在未來 0.1 至 6.4 秒間的 3D 位置與旋轉姿態。
- 因果推理鏈(Chain-of-Causation, CoC): 輸出詳細的文字推理鏈條,說明做出此路徑選擇的因果邏輯(例如:「因為前方左側車輛正在剪入,所以選擇減速讓行」)。
- 自車意圖(Meta-action): 輸出明確的車輛高階意圖(如讓路、變道、停車)。
- 自動標註欄位(Reasoning Auto-labels): 為車隊數據自動生成結構化的因果標籤,大幅提高訓練數據分析效率。
- 2D 視覺定位問答(Visual Grounding VQA): 在回答視覺提問時,會同時輸出 2D 的圖像邊界框坐標(Grounding coordinates),將其推理邏輯與圖像中的具體物體或區域(如特定紅綠燈或行人)進行視覺綁定。
性能表現:登頂 LingoQA 基準測試
在 NVIDIA 官方的嚴格評測中,Alpamayo 2 Super 展現了頂尖的自動駕駛邏輯推理與閉環控制表現:
- LingoQA 基準測試排名第一: 在近 40 款參與評估的模型中,Alpamayo 2 Super 以 79.2 的 Lingo-Judge 評分高居榜首。在 NVIDIA 測試中,它分別領先 Qwen2.5-VL 72B 達 17.0 分、領先 Gemini 2.5 Pro 達 15.1 分、領先 GPT-4o 達 23.2 分。
- 閉環控制(AlpaSim Score): 在 PhysicalAI-AV-NuRec 數據集的 913 個挑戰性場景中,閉環模擬評分達到 1.50 ± 0.13。
- 開路軌跡評估(Open-Loop Evaluation): 在 PhysicalAI-AV 數據集的 1434 個極限樣本中,其 6.4 秒預測的最小平均位移誤差(minADE_6)僅為 0.911 米。
訓練數據:十億級視覺語料與百萬小時影片
這項強大泛化能力的背後,是龐大的多模態自駕語料庫。模型的訓練集包含了:
- 11.5 萬小時 的多相機自駕影片,並帶有精確的車輛自車運動與駕駛軌跡標註。
- 370 萬條 高質量的因果推理鏈(CoC)文字軌跡標註。
- 總計覆蓋了超過 10 億張駕駛圖像 以及少於 10 億個文字 Token,完美平衡了自駕物理世界規律與人類邏輯知識的融合。
雲端到車端的「蒸餾部署」策略
Alpamayo 2 Super 雖然性能無與倫比,但 34B 的體積並不適合直接塞入量產車端硬體。因此,NVIDIA 推薦採用高效的**「雲端教學,車端部署」**雙核心架構:
- 雲端大腦(Teacher Model): 在雲端執行 Alpamayo 2 Super,負責處理高難度的長尾場景分析、自動標註、模型審批(Critiquing),以及生成高質量的因果推理 traces。
- 車端小腦(Student Model): 利用雲端生成的高質量推理數據,將知識蒸餾至更輕量、更具成本效益的 Alpamayo 1.5(10B) 或 Alpamayo 1(10B) 模型。經過車端特定推理引擎加速優化後,這些小模型能以極低延遲、即時地在量產車端晶片上運行。
開發者環境與硬體要求
1. 商業友善的開源授權
- 模型權重(Model Weights): 採用 OpenMDW-1.1 授權,這是 Linux 基金會專為 AI 研發與發布制定的寬鬆開源授權,允許開發者自由微調、衍生新模型並直接用於商業車隊,為企業提供了極高的自主權與數據私密性。
- 原始碼(Source Code): 採用寬鬆的 Apache License 2.0 授權。
2. 開發相依環境要求
- 操作系統: Linux (Ubuntu 推薦)
- PyTorch 版本: $\ge 2.8$
- Transformers 版本: $\ge 4.57.1$
- DeepSpeed 版本: $\ge 0.17.4$
3. 單卡推論硬體與顯存配置
模型針對 NVIDIA GPU 架構進行了深度優化。官方提供在單張 NVIDIA H100 80GB HBM3 GPU 上的實測推論記憶體指標(在 7 相機、4 歷史影格、不啟用 CFG 且 10 步擴散推論下):
- 實測顯存峰值(Device Memory Peak): 72,115 MiB (約 72.1 GB)
- PyTorch 峰值分配/保留: 69.316 GiB / 69.463 GiB 這表明,整個 34B 參數的 VLA 模型推論完全可以在單張 80GB 顯存的 Hopper GPU 上滿載順暢運行。
常見問題快速解答
Q:Alpamayo 2 Super 與第一代 Alpamayo 1.5 相比有哪些重大提升? A:Alpamayo 2 Super 的參數規模是前代的 3 倍多(34B vs 10B)。這使得它在面對罕見的、牽涉到多個道路代理(車輛、行人等)的複雜互動情境時,展現出極強的零樣本(Zero-shot)邏輯泛化能力。此外,它能融合 360 度環景相機畫面,克服了前代單一視野的死角限制。
Q:模型輸出的駕駛軌跡長度是多少? A:它輸出 64 個三維軌跡點(XYZ 位置和姿態),時間間隔為 0.1 秒,總共預測未來 6.4 秒內的行駛路徑,這足以應對高速公路與都市街道中的複雜機動動作。
Q:如何將這個模型整合進現有的安全驗證流程中? A:模型的因果推理鏈(CoC)輸出與 NVIDIA Halos 安全驗證工作流深度原生整合,並原生支持對齊 ISO/PAS 8800 自動駕駛安全標準,能直接導出作為車輛安全合規與事件追溯的關鍵安全日誌(Safety log)。
Q:如果在使用過程中遇到程式 bug 或需要討論該怎麼辦? A:
- 使用方法與技術討論: 請造訪 Alpamayo NV 開發者論壇 與全球自駕社區交流。
- 回報 bug 與功能需求: 可直接至官方 GitHub 儲存庫 Issues 提交,會有專職 Responder 自動分配處理。
- 安全漏洞提交: 請至 NVIDIA 官方安全中心使用 NVIDIA 漏洞揭露計畫 進行私密通報,請勿公開發布。
結語
NVIDIA Alpamayo 2 Super 的開源,為整個自動駕駛與機器人計程車行業打通了從適應到商業化部署的直達通路。它不僅在 LingoQA 上取得了傲視群雄的成績,更通過 OpenMDW-1.1 與 5 大決策鏈輸出,在技術透明度與商業落地可行性之間取得了絕佳平衡。
如果您正在開發下一代自駕 Percetion 與 Motion Planning 系統,可直接前往 NVIDIA Alpamayo 2 Super Hugging Face 頁面 下載權重,開啟更具因果邏輯、更安全的自駕開發旅程。



