
邁向服務真實生活的 AI Agent:dots3-note Preview 簡介
在人工智慧發展的進程中,我們一直希望能構建出真正能解決生活問題的 AI。這需要模型不只是感知世界或進行複雜推理,更要具備主動性與持續學習的能力,能夠隨著世界的變化和與用戶的交互而不斷進化。
為此,小紅書團隊旗下 dots studio 正式開源了 dots3-note Preview。這是 dots3 智慧體模型家族(家族規劃包括 note、jazz 與 aria,用以覆蓋不同的任務複雜度、響應速度與計算成本)中首款開源且最輕量的多模態 Mixture-of-Experts (MoE) 基礎模型。模型採用 Apache 2.0 協議發布,在多項封閉可驗證任務、長程 Agent 任務及多模態感知評測中,展現出比肩甚至超越數倍於其尺寸的大模型之卓越實力。
🛠️ 極致的輕量化與多模態架構
dots3-note Preview 擁有 280B 總參數,推論時實際僅需 16B 激活參數,這使其在保持極高計算效率與低延遲的同時,依然具備強悍的長文本與多模態理解能力。它原生支援高達 512K 字符的超長上下文視窗,可同時理解與處理文本、圖像、影片(包含影片內嵌音軌)以及語音等跨模態輸入。
其底層硬核架構規格如下:
| 架構屬性 | 規格參數 |
|---|---|
| 骨幹類型 | 混合專家多模態解碼器(Multimodal MoE) |
| 參數規模 | 280B 總參數 / 16B 激活參數 |
| 多代幣預測 (MTP) | 1 個共享層(1.13B 參數),顯著最佳化多步生成效率 |
| 網路層數 | 1 個稠密層(Dense) + 45 個稀疏專家層(MoE) |
| 專家路由機制 | 256 個總專家 + 1 個共享專家,推論時動態路由啟用 Top-8 專家 |
| 隱藏層維度 (Hidden Size) | 5120 |
| FFN 隱藏維度 | 13824(稠密層) / 1536(每個專家獨立維度) |
| 注意力機制排程 | 13 個全域雙自我注意力(DSA,Top-2048) + 33 個滑動視窗注意力(SWA)交替 (~1:3) |
| 視覺編碼器 | MoE ViT 架構(總參數 7B,推論激活 1.2B) |
| 語音編碼器 | 稠密語音特徵提取器(800M 參數) |
| 支援精度與格式 | 原生 BF16 與 FP8 極低精度推論 |
🧠 TEMPO 技術:自我評價與長程任務強化訓練
在開發能夠執行長程複雜任務的 AI Agent 時,傳統的強化學習面臨兩大工程瓶頸:一是 Agent 完成一次探索往往需要十餘個小時,訓練效率極其低下;二是稀疏的外部反饋(Sparse Rewards)使得模型難以進行有效的信用分配(Credit Assignment)。PPO 等 Actor-Critic 方法雖然能緩解此問題,但傳統 Critic 僅能透過固定算力的前向計算來估算價值,無法像 Actor 一樣透過多步推理、反思或調用工具來動態推導狀態好壞。
為了解決這個瓶頸,研究團隊提出了全新的 TEMPO(Test-time-scaled Value Estimation with Macro-step Policy Optimization) 技術。
TEMPO 的核心邏輯在於將一個超長程任務拆解為多個巨集步驟(Macro-steps),每個巨集步驟內部包含多輪模型與環境的緊密互動。在每個巨集步驟結束時,同一個 Agent 會自動從 Actor 狀態切換為 Critic 角色。此時,模型會發揮其強大的「自我評價(Self-critiquing)」能力,透過允許在測試時擴展計算(Test-time scaling)的深度推理分析,精確評估當前多個不同軌跡分支(即使兩者在環境得分上看似相同)的優劣,預測剩餘預期回報。
實驗數據與蒙特卡洛採樣分析表明,**「評價比生成更容易」**這一假設在複雜任務中高度成立。即使面對模型當前尚無法完全通關的超難 level,它在化身為 Critic 時,依然能精確識別出真正突破環境規律、更接近可行解的潛在狀態。
🚀 實戰成果:IMO 2026 滿分金牌
在 2026 年的國際數學奧林匹亞(IMO 2026)中,研究團隊基於 dots3-note Preview 的分支版本,構建了一套精密的內部測試腳本(Harness)。該系統讓 Agent 遞歸地生成數學證明,並調用外部工具對證明的嚴謹性進行自我評估、查錯與自我強化。這套充分發揮了「自我評價」能力的系統,最終成功取得了 IMO 官方認證的 42/42 點滿分金牌成績,驗證了遞歸自我評價(Recursive Self-critiquing)對於解決無確定反饋、模糊長程任務的決定性價值。
🎯 模擬真實生活:從封閉實驗室走向開放動態環境
目前的 AI 測試基準多屬於封閉、狀態可枚舉且結果對錯分明的環境。然而,真實生活中的複雜任務往往具有三大根本挑戰:用戶需求模糊且隨對話隨時變動、任務執行週期橫跨數天需要長程狀態維護、外部環境(如天氣、價格、航班狀態等)隨時發生非對稱異步變化。
為了衡量並縮小實驗室與真實生活之間的差距,團隊搭建了覆蓋出行、醫療、採購、履約等真實生活場景的模擬時間線,並開源了兩項面向真實生活場景的全新評測基準環境,歡迎社群復現:
- VibeSearchBench(主動多輪深度研究檢索):
評估意圖逐步披露條件下的多輪搜索,涵蓋 20 個專業領域的 200 項任務。每項任務由極其模糊的初始請求與 Persona-driven 用戶模擬器構成,約束條件隨多輪對話逐步披露。Agent 可以執行
search、visit和code,最終透過預測知識圖譜與標準圖譜的 Node/Triplet Matching(主要指標為 Triplet F1)來嚴格評估。 - VibeLifeBench(動態跨階段長程任務執行): 評估非靜態環境下的跨階段任務落實,包含 10 個領域的 20 項長程任務。任務跨越 20 到 30 個生命週期階段,所有用戶消息、業務通知與後端狀態(如機型變更、突發天氣等)均按模擬時間線動態自然發生,並通過 1247 項高細粒度原子檢查(Atomic Checks),直接評估模型的跨階段狀態一致性維護、工具實際執行結果與最終交付質量。
💻 快速部署與開發指南
dots3-note Preview 的 FP8 量化版本已獲得主流推理引擎的原生適配,建議部署於 單台 8 卡 GPU 節點 上以獲得最優的並行度與吞吐性能。
1. 服務端部署配置
SGLang 部署(推薦)
推薦直接使用官方釋出的開發鏡像 lmsysorg/sglang:dev-dots3-note。若要啟用多代幣預測(MTP / NEXTN 架構)將首字延遲(TPOT)降低 50% 以上,可使用以下一鍵啟動命令:
docker run --gpus all --ipc=host -p 8000:8000 lmsysorg/sglang:dev-dots3-note sglang serve --model-path dots-studio/dots3-note-prev-fp8 --served-model-name dots3-note-prev --host 0.0.0.0 --port 8000 --context-length 524288 --enable-dp-attention --dp-size 8 --tp-size 8 --ep-size 8 --moe-dense-tp-size 1 --page-size 64 --trust-remote-code --attention-backend fa3 --moe-a2a-backend deepep --enable-multimodal --speculative-algorithm NEXTN --speculative-num-steps 3 --speculative-eagle-topk 1 --speculative-num-draft-tokens 4 --speculative-draft-model-path dots-studio/dots3-note-prev-fp8
- 無視覺載入(純文字模式):若僅需文字推論,可加上
--language-only選項。 - 工具調用解析器:啟動 OpenAI 相容工具調用時,請加上
--tool-call-parser dots。
vLLM 部署
vLLM 官方主分支已支持 native 載入。您可使用如下腳本在 8 卡 NVIDIA H100 平台上部署 FP8 模型(TP=8,EP=8 專家並行):
vllm serve dots-studio/dots3-note-prev-fp8 --served-model-name dots3-note-prev --host 0.0.0.0 --tensor-parallel-size 8 --enable-expert-parallel --moe-backend deep_gemm --max-model-len 262144
- ** speculative 投機解碼**:若要啟用 MTP 多代幣投機解碼,可加上
--speculative-config '{"method":"mtp","num_speculative_tokens":3}'。 - 工具調用解析器:添加
--enable-auto-tool-choice --tool-call-parser dots。
2. 客戶端 OpenAI-compatible API 調用語法
以下是使用 Python SDK 進行非思考(Direct response)模式下的文字與多模態調用示例:
from openai import OpenAI
client = OpenAI(base_url="http://127.0.0.1:8000/v1", api_key="EMPTY")
# 1. 基礎問答(關閉思考模式)
response = client.chat.completions.create(
model="dots3-note-prev",
messages=[
{"role": "user", "content": "你好!請用兩句話簡短介紹你自己。"},
],
temperature=1.0,
top_p=0.95,
max_tokens=256,
# enable_thinking 設為 False 返回直接回答;設為 True 則啟用推理思考
extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)
print("直接回答:", response.choices.message.content)
# 2. 多模態圖像識別
image_message = [
{
"role": "user",
"content": [
{"type": "image_url", "image_url": {"url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/cats.png"}},
{"type": "text", "text": "這張圖片裡有幾隻貓?"},
]
}
]
multimodal_response = client.chat.completions.create(
model="dots3-note-prev",
messages=image_message,
temperature=1.0,
top_p=0.95,
extra_body={"chat_template_kwargs": {"enable_thinking": False}},
)
print("圖像識別結果:", multimodal_response.choices.message.content)
❓ 常見問題技術解答
Q:dots3-note Preview 適合處理包含多音軌的長影片或複雜音訊嗎?
答:非常適合。模型具備文本、圖像、影片及語音的原生融合能力。在輸入影片(如 .mp4)時,系統會自動配合 PyTorch 端的 torchcodec 以及系統安裝的 FFmpeg 工具,同時提取並解碼影片畫面與內嵌的音軌資訊,實現真正的視聽多模態聯合推理。
Q:如何讓模型展現「在線自我學習」與記憶更新能力?
答:這主要得益於其獨特的長程任務強化學習訓練策略。團隊專門構建了數千個「不依賴先驗知識」的新穎虛擬超長程探索環境(例如需要與環境交互數千輪、耗時長達 40 小時以上的 ARC-AGI-3)。當任務長度顯著超過模型的 512K 上下文長度限制時,模型會自行學會在陌生環境中通過主動交互進行觀察,提出假設並驗證,隨後將有效決策沉澱並寫入為 MEMORY.md 記憶檔案,並在接下來的交互中反覆讀取並修正該記憶。這種行為模式使其泛化與適應陌生世界的能力更接近人類。
Q:在推論或 Agent 任務中,如何配置引導參數以達到最佳效果? 答:
- 常規生成:建議將
temperature設定為 1.0,top_p設為 0.95 以保證生成的多樣性與質量。 - 深度推理:在需要超高準確度的邏輯任務中,請將
enable_thinking設為True(默認配置)。 - Agent 長線任務:強烈建議在
extra_body的chat_template_kwargs中加入preserve_thinking=True,這允許模型在多輪對話中跨步驟完整保留歷史消息中的思維推理上下文(reasoning_content),對於任務連續性至關重要。
Q:當前面向真實生活部署,該模型存在哪些技術局限性? 答:dots3-note Preview 作為階段性預覽版本,其強化學習訓練仍在持續迭代中。目前在幻覺抑制、文本與多模態極致平衡度、以及特定長程任務的穩定性上仍有提升空間。此外,將本機的模擬能力(如 VibeLifeBench)轉化為完全真實的生活服務體驗,仍需要結合外部 Harness、Harness Proxy、安全與權限隔離機制等系統工程的協同完善。



