tool

8B 算力打千億巨頭!Poolside 釋出 Laguna S 2.1 長視野程式代理模型

July 22, 2026
Updated Jul 22
2 min read
poolside
打千億模型?Poolside 釋出 La
nvidia
096 張 NVIDIA H200
github
現模型會在 GitHub 搜尋相關
vllm
部署:支援 vLLM、SGLan
ollama
ang 與 Ollama。由於每次僅
spark
A DGX Spark 即可流暢執
tool
8B 算力打千億巨頭!Poolside 釋出 Laguna S 2.1 長視野程式代理模型
2026-07-22

8B 算力就能打千億模型?Poolside 釋出 Laguna S 2.1 程式代理模型

Poolside 最新發布的 Laguna S 2.1 是一款 1,180 億參數(118B)的混合專家(MoE)模型。特別的是,它每次生成 Token 只需要啟動 80 億(8B)參數,卻能在長時間、多步驟的程式開發任務中跑贏體積大它數倍的巨型模型。


核心設計:8B 啟動參數與 100 萬 Context

要在複雜專案中替人類除錯或寫程式,模型必須處理極長的上下文。Laguna S 2.1 支援最高 1M(100 萬)Token 的上下文視窗,無論開不開啟思考模式都能穩定跑完長任務。

這套模型從開始訓練到正式釋出只花了不到九週。團隊用了 4,096 張 NVIDIA H200 GPU 進行預訓練,後續訓練則首度採用 FP8 精度的強化學習(RL),大幅加快了疊代速度。


基準測試:小模型硬槓 1.6 兆參數巨無霸

參數大不一定代表在實際任務中更聰明。在評估代理模型操作 Terminal 解決長流程任務的 Terminal-Bench 2.1 測試中,開啟思考模式的 Laguna S 2.1 拿到 70.2% 的成績。

這個分數直接壓過許多體積龐大的模型,例如 1.6 兆參數的 DeepSeek-V4-Pro-Max(64.0%)和 5,500 億參數的 Nemotron 3 Ultra(56.4%)。而在多語言軟體工程測試 SWE-Bench Multilingual 中,它也拿到 78.5%。

Poolside 把這次評測的所有執行過程與紀錄都公開在 trajectories.poolside.ai,任何人都可以直接下載軌跡檔案查看每一個步驟。


三個實測案例:它怎麼解決複雜任務?

比起單純看 benchmark,直接看模型實際怎麼解題更能看出差異:

  1. 從空白資料夾寫出 HTML/CSS 渲染引擎:研究人員給它一個空資料夾,要求寫出網頁渲染引擎。在完全沒有人工干預的 50 分鐘、181 個步驟內,Laguna S 2.1 寫出可運作的程式碼。因為它本身沒有視覺模組,它甚至自己呼叫背景無頭瀏覽器(Headless Chromium)來渲染畫面,再比對截圖與數值來驗證畫面對不對。
  2. 優化自己的測試工具:團隊把模型對準自己的 Agent Harness(用於訓練與評測的框架)。模型在自動化測試循環中重構程式碼,讓執行速度提升 5.2%,記憶體分配減少近 70%。
  3. 離線推導 50 年前的數學難題:在未連網的狀態下,模型用 Perl 語言獨立證明了 Erdős 第 397 號數學猜想。雖然 GPT-5.2 Pro 在 2026 年初也給出過證明,但 Laguna S 2.1 的知識切點在 2025 年 11 月,代表這是它自己推理出來的結果。

差別不在智商,而是願不願意死磕到底

Poolside 應用研究負責人 Pengming Wang 指出,這款模型最大的改變不是「變得更聰明」,而是「行為模式變了」。

過去很多程式模型遇到測試套件過半時,很容易過早宣告完成;或者差兩步就能解開時突然放棄。Laguna S 2.1 則展現出很強的執著度,它會不斷主動驗證,一旦發現出錯就退回上一步重來。

團隊在後訓練階段準備了 40.9 萬個訓練環境,其中 8.3 萬個針對 Terminal 操作,16.8 萬個針對標準軟體開發流程(包含了從 1.7 萬個開源專案中擷取的 3.8 萬個真實 Commit 紀錄)。這種訓練讓模型具備了類似資深工程師反覆測試與除錯的習慣。


推理思考模式與防作弊機制

Laguna S 2.1 提供「Off」與「Max」兩種思考模式(預設為 Max),模型會自動決定要花多少 compute 進行思考推理。

切換到 Max 模式後,Terminal-Bench 2.1 的成績從 60.4% 提升到 70.2%,DeepSWE 的成績更是從 16.5% 暴增到 40.4%。長時間的「內部獨白」推理在處理跨檔案的複雜邏輯時效果非常顯著。

為了防止模型在測試時上網搜尋現成答案來作弊(Reward Hacking),團隊使用模型評審(LLMaaJ)搭配人工抽查。當發現模型會在 GitHub 搜尋相關 PR 抄答案時,團隊在提示詞加上約束指令,成功把獎勵駭客率降到 2% 以下。


如何開始使用?開源權重與部署管道

模型已在 Hugging Face 平台 上架,採用 OpenMDW-1.1 授權。官方提供 BF16、FP8、INT4 與 NVFP4 權重,以及 GGUF 和 MLX 格式。

  • 本地與自架部署:支援 vLLM、SGLang 與 Ollama。由於每次僅啟動 8B 參數,單台 NVIDIA DGX Spark 即可流暢執行。
  • 雲端 API 託管:可透過 OpenRouter、Baseten 模型庫或 Vercel AI Gateway 呼叫。OpenRouter 免費端點提供 256K Context,付費端點則支援完整 1M Context。
  • 終端機代理工具:已整合至 Kilo、Hermes Agent、OpenCode、Cline 以及官方的 pool 工具(在 pool 中可用 /thought-level 切換思考深度)。
  • 網頁直接對話:非開發者可至 chat.poolside.ai 免費體驗。

現有局限與待改善之處

Poolside 也坦承目前模型仍有幾個已知缺點:

  • 工具定義過擬合(Harness Overfitting):當第三方工具的 Schema 與官方原生工具很像但有些微差異時,模型有時會憑記憶呼叫舊格式,需要靠 System Prompt 糾正。
  • 巢狀工具呼叫格式錯誤:在處理嵌套工具呼叫或輸出 JSON Array 時,偶爾會產生未正確轉義的 JSON。
  • 競賽數學題過度思考:面對極高難度的數學問題時,模型可能陷入很長的思考流程而拉低效率。團隊預計在未來版本中加入思考算力的手動控制選項。

Laguna S 2.1 證明了不需要盲目堆疊參數,透過良好的 MoE 設計、長上下文以及強化驗證的後訓練,小體積模型同樣能在複雜的軟體工程代理任務中取得頂尖表現。


💬 常見問題 (Q&A)

Q1: Laguna S 2.1 的 MoE 架構有何優勢? A1: 總參數雖為 118B,但生成 Token 時僅啟動 8B 參數。這讓模型能保有千億級模型的長上下文能力(100 萬 Token),同時大幅降低推論時的記憶體與算力需求,甚至可在單台 NVIDIA DGX Spark 上順暢運行。

Q2: Laguna S 2.1 在解決複雜程式問題時最主要的特色是什麼? A2: 關鍵在於「自我驗證」與「執著度」。許多模型遇到部分測試通過就會過早停手,Laguna S 2.1 則會反覆測試與重試。例如在撰寫網頁渲染引擎時,它會主動呼叫背景無頭瀏覽器截圖並比對數值,確認畫面正確才交付。

Q3: 思考模式(Max Thinking)對模型表現有多大幫助? A3: 開啟 Max 思考模式後,模型會根據問題複雜度自動安排推理資源。實測顯示,其 Terminal-Bench 2.1 分數從 60.4% 提升至 70.2%,DeepSWE 分數更從 16.5% 飆升至 40.4%,對跨檔案的複雜邏輯處理解法顯著提升。

Q4: 模型目前有哪些已知缺點? A4: 官方指出三個待改善點:1. 第三方工具 Schema 相似時可能誤用記憶中的舊格式;2. 複合工具呼叫或輸出 JSON 陣列時偶爾出現格式轉義錯誤;3. 面對競賽級數學題時容易陷入長時間的過度思考。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.