
突破資料瓶頸:小米機器人模型 Xiaomi-Robotics-1 (XR-1)
傳統工業機器人多半動作僵硬,僅能執行重複性的單一任務。相較之下,「具身智慧」(Embodied AI)的核心在於讓機器人理解環境並執行靈活操作。小米機器人團隊近期公開了 Xiaomi-Robotics-1 技術成果,這套擁有 50 億參數的通用視覺-語言-動作(Vision-Language-Action, VLA)模型,旨在為機器人在陌生環境中的移動操作建立一套通用的理解與控制邏輯。
圖片來源: GitHub - XiaomiRobotics/Xiaomi-Robotics-1: Code for Xiaomi-Robotics-1 · GitHub
兩階段訓練:預訓練與後訓練
傳統訓練機器人,常需針對特定動作進行昂貴的人工標註,導致資料極度匱乏。小米團隊改採類似大型語言模型的兩階段訓練法:預訓練(Pre-training)建立廣度,隨後進行後訓練(Post-training)進行對齊。
1. 預訓練階段(Pre-training)
小米團隊使用了超過 10 萬小時的真實世界操作軌跡資料。這些資料主要來自不限載體(Embodiment-free)的 UMI(Universal Manipulation Interface)軌跡,涵蓋家庭、商業、工業和戶外等 1,700 多個場景。由於資料不限載體,模型學習的是通用的物理與視覺操作邏輯,而非特定單一機器人的動作指令。研究表明,預訓練的縮放行為(Scaling behavior)能非常可靠地經由後訓練轉移至真實世界的機器人性能,且未出現飽和跡象。
2. 後訓練與對齊階段(Post-training)
後訓練階段使用了超過 1 萬小時的跨實體資料(Cross-embodiment data),包括小米內部的真實機器人資料、經過篩選的開源機器人資料,以及高質量的手動標註 UMI 資料。此階段沿著兩大主軸進行對齊:
- 實體對齊(Embodiment alignment):透過跨實體數據將通用的動作生成能力映射到具體的機器人實體上。
- 指令對齊(Instruction alignment):將模型的行為從僅能依據「場景轉換描述」做出反應,轉變為能真正理解「自然語言指令」並直接執行動作。
技術架構:Qwen3-VL 與 Mixture-of-Transformers (MoT)
Xiaomi-Robotics-1(簡稱 XR-1)在架構設計上實現了高效與強大泛化的結合:
- VLM 底座:模型將預訓練的視覺語言模型 Qwen3-VL 與擴散式 Transformer(Diffusion-Transformer, DiT)相耦合。
- Mixture-of-Transformers (MoT) 架構:DiT 與 VLM 的層數(Layer count)完全匹配,但 DiT 採用了較小的隱藏維度(Hidden size),藉此實現更快的推理速度並降低計算延遲。
- 非同步執行(Asynchronous execution):優化了動作與計算的非同步執行機制,將推理延遲降到最低,確保機器人能即時(Real-time)做出反應。
- 靈活部署:構建於 Hugging Face transformers 生態系之上(將依賴版本固定在
4.57.1),並針對消費級 GPU 進行了部署優化。
評測表現
小米團隊在多個主流機器人模擬器上對 XR-1 進行了評測,均取得 State-of-the-Art (SOTA) 的頂尖成績。截至 2026 年 7 月 15 日,XR-1 在 RoboCasa365 和 RoboDojo 的排行榜上均榮登榜首。
模擬基準測試表現
| 基準測試 (Benchmark Name) | XR-1 成功率 | 次優模型 (2nd Best) | 相對提升 (Relative Gain) |
|---|---|---|---|
| RoboCasa | 74.5% | 72.6% | +2.6% |
| RoboCasa365 | 57.4% | 46.6% | +23.2% |
| VLABench | 59.1% | 53.2% | +11.1% |
| RoboDojo | 13.93% | 8.80% | +58.3% |
真實世界任務快速適應能力 (Efficient Adaptation)
XR-1 展現了極高的數據利用效率。在面對全新且複雜的真實世界任務時,平均每項任務僅需不到 10 小時或 40 小時的示範數據,即可實現極高的成功率,顯著超越基準模型 $\pi_{0.5}$:
| 評估任務 (Real-world Task) | XR-1 (<10h 平均示範) | $\pi_{0.5}$ (<10h 平均示範) | XR-1 (<40h 平均示範) | $\pi_{0.5}$ (<40h 平均示範) |
|---|---|---|---|---|
| Phone Packing (手機包裝) | 70% | 30% | 80% | 40% |
| Printer Refilling (印表機加紙) | 70% | 20% | 60% | 20% |
| Laundry Loading (放衣服進洗衣機) | 80% | 40% | 100% | 50% |
| Box Packing (紙箱打包) | 80% | 70% | 100% | 100% |
| 整體平均成功率 (Overall) | 75% | 40% | 85% | 53% |
技術常見問答
為什麼使用不限載體的資料進行預訓練?
高品質動作資料極為稀缺。利用不限載體(Embodiment-free)的 UMI 軌跡進行預訓練,模型能歸納出底層的物理規律與視覺邏輯,進而擺脫對特定硬體結構與操作軌跡的綁定,實現優異的跨實體泛化能力。
機器人是否能透過少量示範學習新技能?
是的。由於預訓練與後續 1 萬小時的 cross-embodiment 後訓練已建立穩固的邏輯與通用動作基礎,針對特定新任務的適應微調(Fine-tuning),平均僅需數小時的示範數據(如平均小於 10 小時),即可達到平均 75% 的高成功率,大幅降低了對龐大示範資料的需求。
如何進行本地後訓練(Fine-tuning)與部署?
開發團隊已在 GitHub 倉庫的 xr1/ 目錄中釋出了完整的後訓練、推理和基準評估代碼。開發者可參考 xr1/README.md 來設置環境、進行權重格式轉換、準備自訂數據並完成部署。開源的 5B 權重版本為 Xiaomi-Robotics-1-5B。
這項技術對未來有何影響?
根據發表於 2026 年 7 月 16 日的技術報告 (arXiv:2607.15330),這項研究展示了具身智慧大規模預訓練與對齊的可行性。未來的家務與工業機器人將具備開箱即用的移動操作能力,無需針對特定環境或家具進行繁瑣的手動配置,而是能直接基於視覺觀察,自然理解並操作不同環境中的物體。



