探索 K2-Horizon-7B
K2-Horizon-7B 是由基礎模型研究所(Institute of Foundation Models, IFM)開源發布的 7B 級別密集解碼器(Dense Decoder-only)語言模型。該模型採用 Apache-2.0 自由授權,原生支援 512K(524,288 tokens) 的超長上下文視窗,並在程式編寫、科學推理與 AI 代理(Agentic)任務中展現出強大的基準表現。
模型架構與技術重點
根據官方模型卡,K2-Horizon-7B 具備以下核心技術亮點:
- 512K 原生上下文:從 Midtraining(中預訓練)階段開始引進並漸進擴充上下文長度,最高支援 524,288 個 Tokens。
- 全階段 checkpoint 與開源:官方完整釋出 Pretrain、Midtrain、RL 專家(Math、Code、Search、Tool-use)以及 SFT 等各階段的中間檢查點(Intermediate Checkpoints),並完全開源訓練數據、訓練代碼與評測資源。
- Diffusion Adapters 支援:提供可選的 Diffusion Adapters(如
IFM/K2-Horizon-7B-Uno)以進一步提升推論速度。
官方 Benchmark 評測成績(標示測試條件)
官方模型卡公布了多項基準測試結果(均在 reasoning_effort="high" 設定下評測):
- 數學與科學推理:HMMT Feb 2026 競爭數學測試得分 73.3%;HLE 專家級推理得分 18.6%。
- 程式開發與 Agent:SWE-bench Verified 軟體工程測試得分 70.6%;Terminal-Bench 2.1 終端 Agent 使用得分 39.1%;SciCode 科學程式碼得分 31.6%。
- 長上下文與工具調用:LCR 長上下文推理得分 68.0%;tau3-Banking Agent 工具調用得分 25.8%;BrowseComp 網頁瀏覽測試得分 59.0%(採用 Discard-all@95k 上下文協定)。
部署與推論設定
K2-Horizon-7B 支援主流開源推論框架,官方模型卡提供了以下驗證過的部署配置:
- vLLM 服務:
建議啟用
--trust-remote-code、--dtype bfloat16、--reasoning-parser k2_horizon與--tool-call-parser k2_horizon。 - SGLang 服務:
建議啟用 FlashAttention-3(
--attention-backend fa3)、--dtype bfloat16並指定--reasoning-parser k2_horizon。 - Transformers 整合:
官方模型卡列出的驗證環境為
transformers5.15.0、PyTorch 2.13.0 與 Safetensors 0.8.0,使用AutoModelForCausalLM(dtype="bfloat16")載入;其他版本仍需自行測試相容性。
最佳推論參數建議
- Reasoning Effort:官方強烈建議於請求額外參數中設定
reasoning_effort="high"(chat_template_kwargs)。 - 採樣參數:建議設置
temperature=1.0與top_p=0.95。 - 輸出長度上限:建議設定
max_tokens至少為 32,768,避免思考推理階段被意外截斷。 - 工具調用格式:原生支援
xml(預設)、json與xml_typed三種格式。
適合的使用情境
K2-Horizon-7B 適合用於長篇文件解析與推理、複雜軟體工程代碼生成、自動化 Agent 終端命令執行與工具調用。在實際落地部署前,建議團隊仍需針對具體業務場景進行實測驗證。

