德國 AI 團隊 Aleph Alpha 於 2026 年 10 月發布開源權重模型 Kolibri。本文整理其採用的 78B 總參數與 3B 啟動參數 MoE 架構、德英雙語分詞設計、百萬 Token 上下文支援,以及符合歐盟法規的企業級部署需求與基準測試表現。
德國 AI 公司 Aleph Alpha 於 2026 年 10 月 3 日德國統一日,正式推出新一代開源權重大型語言模型 Kolibri。該模型採用 Apache 2.0 授權條款,完整模型權重已開放於 Hugging Face 模型庫 供開發者下載使用。
根據 Aleph Alpha 於 官方技術部落格 的說明,Kolibri 是一款結合混合專家架構(Mixture-of-Experts, MoE)的德英雙語推理模型,專注於提供歐洲公共行政、航太、汽車製造與半導體等高度監管領域的技術需求,強調資料透明度與符合歐盟法規的主權 AI 要求。
專為歐盟法規與管制產業設計的架構考量
Kolibri 的開發核心在於滿足歐洲市場對於資料主權的要求。模型在設計初期便考量了歐盟人工智慧法案(EU AI Act)、通用人工智慧行為準則(General-Purpose AI Code of Practice)以及一般資料保護法規(GDPR)的法規規範。
訓練基礎設施均設於德國與芬蘭境內,由歐盟與德國法律管轄,並無境外控制權介入。研發團隊自行掌控各項訓練環節,涵蓋資料清理、預訓練、後訓練與模型優化。對受管制的企業與公部門而言,在地化部署能避免敏感資料傳輸至境外第三方推論服務。
抑制幻覺的 Merlin-Arthur 協議與棄權機制
針對企業檢索增強生成(RAG)常遇到的模型虛構答案問題,Kolibri 在訓練過程中導入了棄權數據(Abstention Data)與 Merlin-Arthur 驗證協議。
當提供的參考文件中缺乏答案時,模型會主動回答「不知道」,而非憑空編造事實。在評測表現上,Kolibri 於 RGB 負向樣本(RGB Negative)的棄權測試中取得 85.6% 的拒答準確率,在 AA-Omniscience 的非幻覺率(Non-Hallucination Rate)測試中亦由前代 Origin 模型的 15.0% 提升至 44.0%,有助於提高檢索型應用的實用性。
78B 參數量與 3B 啟動參數:Kolibri 的 MoE 與注意力機制
Kolibri 的參數量設定著眼於模型能力與運行成本的平衡。模型總參數量為 78.1B(78,103,074,560),但在每個 Token 的計算過程中,僅啟動約 3.46B(3,457,573,120)個活躍參數。
在 50 個 Transformer 層中,全數採用 MoE 結構,包含 1 個共享專家與 384 個專屬專家,每次運算由路由演算法挑選 6 個專屬專家參與。專家路由採用了精確分位數平衡演算法(Exact Quantile Balancing),配合 Muon 優化器,改善了專家負載平衡與訓練穩定性。
4:1 滑動視窗注意力設計
為了處理長文本並維持推論效率,Kolibri 採用了 4:1 的滑動視窗注意力(Sliding Window Attention, SWA)與分組查詢注意力(Grouped-Query Attention, GQA)組合。
在全部 50 層架構中,只有 10 層負責處理完整上下文,其餘 40 層均限制在 512 個 Token 的局部視窗。這項設計限制了大部分層別的解碼運算量與快取記憶體佔用。
模型預訓練採用 16k 序列長度,並經過 64k 的中期訓練與 256k 的長文本適應訓練。雖然模型理論上支援最高 1,048,576(1M)個 Token 的上下文長度,官方建議在重視延遲與輸送量的正式生產環境中,將上下文維持在 262,144(262k)Token 以內。
原生德英雙語數據與 UniBPE 分詞技術
大部分開源模型以英語為主要語料,其他語言多半依賴翻譯文本補足。Aleph Alpha 團隊指出,機器翻譯文字容易保留來源語言的句式特徵與文化習慣,無法真實反映德語公文書與產業規格書的表達方式。
Kolibri 在 20T 的預訓練語料中,德語內容佔比達 21.3%(約 4.3T Token),英語佔約 62.5%,程式碼佔約 13.6%。
德語資料主要來自三個管道:
- 調整過濾參數的 Common Crawl 原生德語網路資料(約 1.3T Token)。
- 使用語言模型將原生德文文檔重新改寫為百科風格或問答格式的改寫語料(約 1T Token)。
- 議會紀錄、法律條文等公有領域高階文件與部分開源資料集。
在正式訓練中,翻譯語料比例壓低至整體約 6%,避免語意出現翻譯偏差。
UniBPE 分詞器提升德語壓縮效率
德語具有大量複合詞結構,傳統通用分詞器在處理德語長字詞時往往會將其拆切為過多片段,增加推論時間與成本。
團隊開發了 UniBPE 分詞技術,建立包含 128,000 個詞彙的專用詞表。測試顯示,在 FineWeb-2 德語網頁語料上,Kolibri 每 Token 可壓縮 4.90 位元組(bytes),壓縮效率高於 GPT-5(4.35 bytes/token)與 Qwen 系列等模型,使德語在相同長度下的計算負荷更少。
基準測試表現與垂直產業評測結果
在標準公開評測中,Kolibri 展現了與多款同級或更高活躍參數模型相近的水準。
根據官方公布的測試數據:
- 數學推理:AIME 2025 得分為 96.9 分(德語版 87.5 分),AIME 2026 得分為 96.0 分(德語版 90.0 分)。
- 專業知識:GPQA Diamond 英語得分為 84.3 分,德語得分為 81.3 分。
- 程式碼生成:LiveCodeBench v6 得分為 85.9 分,HumanEval+ 得分為 92.7 分。
- 工具調用與代理任務:BFCL v4 總分為 61.4 分,零售場景 Tau2-Bench 得分為 69.9 分,電信場景達 94.7 分。
除了通用基準測試,Aleph Alpha 另外針對歐洲核心產業建立內部評估環境。在未導入客戶原始隱私數據的前提下,透過合成任務進行強化學習微調。官方數據顯示,模型在汽車供應鏈模擬測試的得分達到 0.99,半導體領域達到 0.80,德國公共行政達到 0.75,工業傳動技術與航太領域分別為 0.60 與 0.59。
硬體部署需求與推論設定指南
Kolibri 的權重採用 FP8 格式儲存(float8_e4m3fn),在磁碟與記憶體中的佔用容量約為 78 GB。
硬體規格需求
由於 MoE 架構運作時仍需將完整 78B 參數載入顯示記憶體中,建議硬體配置如下:
- 最低需求:2 張 NVIDIA A100 80GB、2 張 H100 SXM5、1 張 H200 或 1 張 B200/B300。
- 推薦配置:2 張 NVIDIA H100 SXM5、2 張 H200,或單張 B200/B300。
服務部署與參數呼叫
模型需要配合 aleph-alpha-inference 套件與支援的 vLLM 外掛執行。
啟動服務指令範例如下:
vllm serve Aleph-Alpha/Kolibri-1 \
--kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
若需支援 262k 以上的長上下文,需額外加上 --max-model-len 1048576 與相關位置編碼參數。
模型支援多階段思考模式,使用者可在 API 請求中設定 reasoning_effort 為 none、low、medium 或 high,藉此在推論時間、計算成本與解答精確度之間取得平衡。
常見問題
Kolibri 與前代測試模型 Kolibri Origin 有哪些差異?
Kolibri Origin 為 Aleph Alpha 於 2026 年 6 月完成的內部驗證模型,參數為 30.6B(啟動 3.27B),上下文長度僅支援至 64k。Kolibri 則將總參數量擴充至 78.1B,訓練 Token 量自 7.5T 增加到 20T,並加入 4 級思考時間設定與擴展至 256k 原生長文本能力,但兩者每次運算啟動的活躍參數均維持在 3B 左右。
Kolibri 適合直接用於無人監管的自動決策系統嗎?
根據模型卡說明,Kolibri 被定位為人機協同工具,適合文件摘要、內部知識檢索、程式輔助以及作為需要人工確認的顧問型決策輔助系統。官方不建議在未經人工覆核的情況下,直接交由模型進行高風險場景的自主執行。
企業如何取得並運行 Kolibri?
模型權重已完整開源於 Hugging Face,開發者可直接下載權重檔,並透過 vLLM 配合官方開源的推論插件,於私有伺服器或自建資料中心中執行離線運算。
結語
Aleph Alpha 發布的 Kolibri 為歐洲開源 AI 領域提供了兼具法規合規與實際運算效率的模型選擇。透過 78B 總量與 3B 啟動的 MoE 架構,搭配針對德語結構設計的分詞器與防幻覺檢驗機制,該模型在維持在地伺服器可負擔的硬體門檻下,提供了具備實用價值的雙語推論能力。對於需要遵循 EU AI Act 與 GDPR 的機構而言,其完整的資料處理紀錄與開源權重具備明確的參考依據。

