TOOL FIELD NOTE

JetBrains 開源 Mellum 2.1 程式碼代理模型:強化學習微調與本機部署實測表現

JetBrains 開源 Mellum 2.1 程式碼代理模型:強化學習微調與本機部署實測表現 JetBrains 正式發表開源模型 Mellum 2.1,維持 12B 總參數與 2.5B 啟動參數的混合專家架構,透過大規模真實環境強化學習,加強儲存庫探索、檔案編輯與代碼檢驗能力。本文整理其模型架構、官方基準測試數據、推論效能以及自建部署方式。 JetBrains 在 官方技術公告 中發布了新一代模型 Mellum 2.1。這款模型是 JetBrains 在 2026 年 6 月開源的 Mellum 2 後續版本, …

PUBLISHED 2026.10.10
READING TIME 2 MIN
UPDATED 2026.10.10
01

COMMUNEIFY
INSIGHTS

把複雜的技術趨勢,整理成值得慢慢讀完的深度內容。

JetBrains 開源 Mellum 2.1 程式碼代理模型:強化學習微調與本機部署實測表現

JetBrains 正式發表開源模型 Mellum 2.1,維持 12B 總參數與 2.5B 啟動參數的混合專家架構,透過大規模真實環境強化學習,加強儲存庫探索、檔案編輯與代碼檢驗能力。本文整理其模型架構、官方基準測試數據、推論效能以及自建部署方式。

JetBrains 在 官方技術公告 中發布了新一代模型 Mellum 2.1。這款模型是 JetBrains 在 2026 年 6 月開源的 Mellum 2 後續版本,同樣採用 Apache 2.0 授權釋出,允許開發者自由下載並部署在自有硬體環境中。開發團隊表示,雖然底層模型架構與參數量保持不變,但後訓練(post-training)流程經歷了重整,主要加強模型在實際專案專屬環境中的軟體工程處理能力。

模型架構與訓練方式:以真實環境為基礎的強化學習

延續輕量混合專家架構

Mellum 2.1 沿用了 Mellum 2 的混合專家(MoE)設計,總參數量為 12B,推論時實際啟動的參數量僅為 2.5B。根據官方在 Hugging Face 模型頁面 公布的規格,模型共包含 28 個層級,隱藏維度為 2304,並具備 64 個專家模組,推論時每次動態選取 8 個專家進行運算。

注意力機制方面,該模型採用群組查詢注意力(GQA),查詢頭(Q heads)為 32 個,鍵值頭(KV heads)為 4 個。上下文窗口長度達到 131,072 個 token,並在每 4 層中針對 3 層導入長度 1024 的滑動窗口(Sliding Window)設計,有助於降低長文本運算時的記憶體負擔。

擴大沙盒環境與資料篩選標準

Mellum 2 雖然推論速度快,但在複雜專案程式碼庫內處理多步驟任務時表現有限。JetBrains 團隊針對這個問題調整訓練重心,將強化學習(RL)從原先簡短的收尾步驟,擴展為後訓練的核心階段。

為了讓模型具備實際操作程式碼庫的能力,開發團隊搭建了內部沙盒測試基礎設施,在訓練過程中啟動數百萬次沙盒環境。模型必須在配備終端機指令(shell)與檔案編輯工具的真實程式碼庫中操作,只有在測試成功通過時才會獲得獎勵回饋。此外,團隊也在數學、競賽程式設計、科學推理與工具調用等領域導入更多經過嚴格過濾的 RL 任務,剔除測試損壞或答案不可驗證的開放資料集樣本。

基準測試數據:軟體工程代理與綜合表現

在各項標準基準測試中,JetBrains 針對 Mellum 2.1 Thinking、前代 Mellum 2 Thinking、Gemma 4(E4B)以及 Qwen3.5(9B)進行了對比評測。所有代理型評測均使用開源代理評測架構 Pi(v0.73.1),搭配終端機與檔案工具,設定上下文上限為 114K token。

代理型軟體工程測試大幅進步

官方自測數據顯示,Mellum 2.1 在軟體工程代理評測中成長最為顯著:

  • SWE-bench Verified:Mellum 2.1 的解決率達到 47.0%,相較於 Mellum 2 的 2.0% 有極大提升,同時高於 Gemma 4 的 23.0%,接近 Qwen3.5(9B)的 50.0%。
  • SWE-bench Pro:解決率為 28.0%,前代 Mellum 2 為 0.0%,Gemma 4 為 4.0%,Qwen3.5(9B)則為 38.0%。
  • Terminal-Bench 2.1:終端操作評測達到 17.4%,Mellum 2 為 0.6%,Gemma 4 為 3.4%,Qwen3.5(9B)為 21.7%。

這些數據反映出大規模沙盒強化學習確實改善了模型在命令列執行與程式碼修復上的成功率。

程式編碼與多步驟推理評測

在常規程式碼生成與推理測試中,Mellum 2.1 同樣展現穩定水準:

  • LiveCodeBench v6:得分 82.0%,高於 Mellum 2 的 69.4% 與 Qwen3.5(9B)的 75.4%。
  • HumanEval+ 與 MBPP+:分別取得 91.5% 與 79.4% 的成績。
  • AIME 25/26 數學競賽平均:得分 83.3%,大幅高於 Mellum 2 的 60.1% 與 Gemma 4 的 45.0%。
  • 工具調用(BFCL v4):平均得分 62.3%,高於前代的 49.6% 與 Qwen3.5(9B)的 58.5%。
  • 安全性評測(HarmBench):有害率降至 8.5%,相較 Mellum 2 的 21.5% 有明顯改善。

推論速度與多詞預測機制

由於 Mellum 2.1 沿用先前的模型架構,其基礎推論速度與 Mellum 2 相當。因為採用 2.5B 啟動參數的混合專家架構,模型在單一硬體上的計算資源負擔相對較輕。

根據 JetBrains 在單張 NVIDIA H200 上的實測結果,在高負載並行吞吐的情境下,Mellum 2.1 每秒產生的 token 數量接近 Qwen3.5(9B)的兩倍。另外,模型支援多詞預測(Multi-Token Prediction, MTP)技術,在單一請求的投機解碼場景下,推論速度可提升約 1.6 倍,適合需要低延遲回應的次級代理(sub-agents)或編輯器即時補全情境。

部署方式與硬體相容性

Mellum 2.1 權重已上傳至 JetBrains Hugging Face 倉庫,開發者可以直接透過多種推論框架加載執行。

使用 vLLM 啟動服務

在伺服器端,開發者可使用 vLLM 建立相容於 OpenAI API 格式的服務。若需要啟用工具調用能力,啟動指令如下:

vllm serve JetBrains/Mellum2.1-12B-A2.5B-Thinking \
  --max-model-len 131072 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser hermes

如果不需工具調用,只需移除 --enable-auto-tool-choice 與 --tool-call-parser hermes 參數即可。

本機部署與容器化支援

除了 vLLM 之外,官方頁面也提供了 SGLang 與 Docker Model Runner 的運行範例。針對想在一般個人電腦或工作站本機運行的開發者,JetBrains 指出適用於 llama.cpp、Ollama 與 LM Studio 的 GGUF 量化版本正在準備中,vLLM 的 MTP 投機解碼支援頭部也將在後續推出。

常見問題

Mellum 2.1 與前一代 Mellum 2 的主要差異在哪裡?

兩者在底層參數量與網路結構完全一致,均為 12B 總參數、2.5B 啟動參數的 MoE 架構。差別在於 Mellum 2.1 將強化學習作為後訓練核心,並在數千個實際沙盒環境中進行程式碼編輯與命令列操作訓練,解決了 Mellum 2 在專案儲存庫中難以獨立處理複雜修復任務的問題。

Mellum 2.1 的思考模式如何運作?

Mellum 2.1 屬於思考型模型(Thinking Model),在產出最終回答之前會先進行多步驟推理規劃,這使其在數學競賽題目(如 AIME)與程式除錯上具備較佳的分析能力。透過 vLLM 部署時,需指定 --reasoning-parser qwen3 參數以正確解析思考鏈區塊。

這款模型適合應用在哪些工作流程?

Mellum 2.1 特別適合擔任軟體工程代理系統中的執行單元或快速次級代理,負責定位錯誤原因、編寫修復代碼並驗證單元測試。由於模型採開源授權且參數量適中,企業亦可將其部署於內部私有伺服器,避免專有程式碼與敏感資料傳送至外部雲端服務。

結語

JetBrains 推出的 Mellum 2.1 展現了輕量混合專家架構結合真實環境強化學習的可行性。在保持 2.5B 啟動參數與推論速度的前提下,該模型在 SWE-bench Verified 達到 47.0% 的解決率,縮小了小參數模型與主流大型開源模型在代理任務上的差距。目前模型權重已開放下載,未來隨著 GGUF 量化版本與 MTP 機制正式就緒,開發者在邊緣裝置與私有硬體上運行編程代理工具時將有更多彈性選擇。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.