
探索 LG AI 最新模型:K-EXAONE 2.0 功能與部署指南
在人工智慧邁向「具身智慧」與「自主代理(Agentic AI)」的時代,LG AI Research 正式推出了全新旗艦級開源多語言混合專家模型(MoE)—— K-EXAONE 2.0。
這款模型絕非單純的參數規模擴展,而是透過創新的**「向上循環(Upcycling)」**技術、多階段持續預訓練(Continual Pre-training),以及專為長文本與安全性設計的對齊微調,使其在邏輯推理、程式開發與工具調用上,具備了與頂尖開源模型一較高下的實力。
一、 核心架構與技術特性
K-EXAONE 2.0 擁有 7,500 億(750B)總參數,在推論時每個 Token 實際激活的運作參數僅為 370 億(37B)。這種「大體積、輕量推論」的 MoE 架構在多項硬體適應指標上實現了極佳的平衡,其核心技術規格與設計亮點如下:
1. 深度與寬度的雙向「向上循環」(Upcycling)
開發團隊直接對前代 K-EXAONE(236B)進行模型結構擴充,使其規模擴大至三倍以上。為了解決極深層模型在訓練與推論中常見的「梯度與激活值爆炸」難題,K-EXAONE 2.0 在雙 SwiGLU 分支後引入了數值夾緊機制(Clamping after two SwiGLU branches),顯著穩固了 78 層(2 層 Dense 頭 + 76 層 Sparse MoE)超深層網路的數值流。
2. 混合注意力機制(Hybrid Attention Matrix)
為了優化長文本處理的記憶體(VRAM)開銷,K-EXAONE 2.0 摒棄了全域自注意力的單一做法,改採高度精細化的混合結構:
- 全域注意力(Global Attention): 基於無位置編碼(NoPE)架構。
- 滑動視窗注意力(Sliding Window Attention, SWA): 包含 4096 窗口大小的局部 SWA 層,以及多個由「3層 128 窗口局部 SWA + 1層全域自注意力」組成的混合 Block,在提供高達 256K(262,144 tokens) 的超長上下文窗口之餘,極大程度壓縮了 KV 快取的硬體佔用。
3. 混合專家(MoE)與門控細節
- 總專家數: 256 個 MoE 專家 + 1 個始終激活的共享專家(Shared Expert)。
- 激活配置: 每次推論時,路由會精準激活其中的 8 個專家。
- 詞彙表規模(Vocab Size): 擴大至 153,600,且原生支援的語言從 6 種全面擴展至 10 種多國語言(韓語、英語、西班牙語、德語、日語、越南語、法語、義大利語、波蘭語與葡萄牙語)。
二、 卓越的基準測試表現 (Benchmarks)
K-EXAONE 2.0 BF16 模型在多個權威基準測試中展現出頂尖的開源競爭力,特別是在長文本檢索、代碼代理與安全性指標上表現優異:
| 評測領域 (Dimension) | 基準測試 (Benchmark) | K-EXAONE 2.0 得分 | 前代 K-EXAONE 得分 |
|---|---|---|---|
| 數學能力 (Math) | AIME 2026 | 92.3 | 92.2 |
| IMO Answer | 78.6 | 76.3 | |
| 程式與代理編碼 (Coding / Agentic) | SWE Bench Verified | 68.2 | 49.4 |
| Terminal-Bench 2.1 | 43.8 | 30.3 | |
| 長文本理解 (Long Context) | OpenAI-MRCR | 94.4 | 52.3 |
| Ko-LongBench (韓語長文本) | 89.6 | 86.8 | |
| 安全對齊 (Safety) | KGC-Safety | 99.8 | 96.1 |
| ROK-Fortress | 89.5 | 60.9 |
三、 部署與執行指南
由於 K-EXAONE 2.0 採用了自訂的 SwiGLU 夾緊與混合注意力架構,無法直接使用標準的 vLLM 或 SGLang 開源主線版本載入。開發團隊針對兩大主流推論引擎釋出了專屬的 fork 分支。
此外,該模型全面支援 MTP(Multi-Token Prediction,多 Token 預測,內置 1 個 MTP 層) 與 DSpark 兩大投機解碼(Speculative Decoding)技術,能將生成速度較傳統自回歸方法提升約 3 至 5 倍,大幅緩解了 Agent 任務在長文本輸出時的延遲瓶頸。
1. SGLang 服務化部署
SGLang 完整支援 MTP 與 DSpark,是目前追求極低延遲與高吞吐的首選。
安裝依賴:
uv venv
source .venv/bin/activate
# 安裝官方專屬相容 fork 分支
uv pip install git+https://github.com/lkm2835/sglang@add-k-exaone2
uv pip install git+https://github.com/nuxlear/transformers@add-k-exaone2
服務啟動指令(以雙節點、每節點 8 張 NVIDIA H200 GPU,即 TP=16 啟動為例):
# 啟動低延遲(Low Latency)模式
sglang serve --model-path LGAI-EXAONE/K-EXAONE-2.0-750B-A37B --served-model-name K-EXAONE-2.0-750B-A37B --tp 16 --dist-init-addr $HEAD_ADDR --nnodes 2 --node-rank $NODE_RANK --reasoning-parser qwen3 --tool-call-parser qwen3_coder --host 0.0.0.0 --port 8000 --max-running-requests 128 --speculative-algo EAGLE --speculative-num-steps 4 --speculative-eagle-topk 1 --speculative-num-draft-tokens 5 --mem-fraction-static 0.875 --swa-full-tokens-ratio 0.3
⚠️ 硬體相容性警告: 若您部署於 NVIDIA B200 GPUs 硬體環境上,啟動指令中必須加入
--disable-prefill-cuda-graph選項,否則會觸發 CUDA Graph 衝突,導致模型生成結果崩潰。
2. vLLM 服務化部署
vLLM 在顯存動態管理上更加成熟,但需要注意:目前 vLLM 分支暫不支援 DSpark 投機解碼。
安裝依賴:
uv venv
source .venv/bin/activate
# 安裝官方專屬相容 fork 分支
uv pip install git+https://github.com/lkm2835/vllm@add-k-exaone2 --torch-backend auto
uv pip install git+https://github.com/nuxlear/transformers@add-k-exaone2
服務啟動指令:
exec vllm serve LGAI-EXAONE/K-EXAONE-2.0-750B-A37B --served-model-name K-EXAONE-2.0-750B-A37B --trust-remote-code --tensor-parallel-size 16 --distributed-executor-backend mp --nnodes 2 --node-rank $NODE_RANK --master-addr $HEAD_IP --master-port 30000 --gpu-memory-utilization 0.9 --max-num-seqs 256 --reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_xml --host 0.0.0.0 --port 8000 --speculative_config '{
"method": "mtp",
"num_speculative_tokens": 4
}'
四、 常見問題與推理優化建議
Q:推薦的推論參數設定為何?
為了確保最優的輸出品質,官方強烈建議在多數情況下將 temperature 設定為 1.0,並將 top_p 設定為 0.95。
Q:什麼是推理模式(Reasoning Mode)?如何關閉?
K-EXAONE 2.0 預設開啟「思考推理機制」(enable_thinking=True)。若您的任務更看重推論回應速度(如簡單的對話或長文本單純摘要),可在呼叫時將 enable_thinking 設定為 False,切換為非推理模式。
Q:如何最佳化 Agent 代理與長任務的連貫性?
在處理深度研究、自主 Coding 或 Agent 工作流等長時任務時,強烈建議啟用 preserve_thinking=True。此參數允許模型在後續對話中,無損跨對話追蹤並傳遞之前的推理過程上下文(reasoning_content),避免代理在多輪對話後偏離最初的因果鏈。
Q:如何將它集成至 Agent 框架(如 OpenCode)中?
您可直接在 Agent 設定檔 opencode.json 中配置自訂的本地 OpenAI 相容伺服器端點,並在 extraBody 中自動注入對應的 chat_template_kwargs:
{
"$schema": "https://opencode.ai/config.json",
"provider": {
"local": {
"npm": "@ai-sdk/openai-compatible",
"name": "Local OpenAI-compatible server",
"options": {
"baseURL": "http://localhost:8000/v1",
"extraBody": {
"chat_template_kwargs": {
"enable_thinking": true,
"preserve_thinking": true
}
}
},
"models": {
"K-EXAONE-2": {
"name": "K-EXAONE 2.0",
"limit": {
"context": 262144,
"output": 32768
}
}
}
}
}
}
五、 局限性與安全性說明
雖然 LG AI Research 團隊在數據清洗階段投入了巨大心力,過濾了絕大多數有害、偏見、侵權或隱私資訊,但 K-EXAONE 2.0 在極端情況下仍可能產生幻覺(Hallucination)或輸出不一致的文本。
其知識截止日期(Knowledge Cutoff)為 2025 年第二季(2025 2Q),對於最新的時效性資訊可能無法準確掌握,在部署於高風險核心業務前,建議搭配外部 RAG 與人工審查機制。
總結
透過「向上循環(Upcycling)」重塑結構、投機解碼(MTP / DSpark)打破速度瓶頸,並輔以多語言、多模態(透過 256K 混合注意力長文本處理)的卓越設計,K-EXAONE 2.0 成為了目前企業級開源大模型中極具潛力的選擇。
欲深入研究該模型的完整科學演進與詳細架構數據,歡迎查閱 LG 團隊發布的 EXAONE 2.0 官方技術報告。

圖片來源: 相關圖片



