tool

LG AI 發表強大開源模型 K-EXAONE 2.0:750B 參數量與頂尖 Agent 能力

August 13, 2026
Updated Aug 13
3 min read
LG AI 發表強大開源模型 K-EXAONE 2.0:750B 參數量與頂尖 Agent 能力

探索 LG AI 最新模型:K-EXAONE 2.0 功能與部署指南

在人工智慧邁向「具身智慧」與「自主代理(Agentic AI)」的時代,LG AI Research 正式推出了全新旗艦級開源多語言混合專家模型(MoE)—— K-EXAONE 2.0

這款模型絕非單純的參數規模擴展,而是透過創新的**「向上循環(Upcycling)」**技術、多階段持續預訓練(Continual Pre-training),以及專為長文本與安全性設計的對齊微調,使其在邏輯推理、程式開發與工具調用上,具備了與頂尖開源模型一較高下的實力。

圖片來源: LGAI-EXAONE/K-EXAONE-2.0-750B-A37B · Hugging Face


一、 核心架構與技術特性

K-EXAONE 2.0 擁有 7,500 億(750B)總參數,在推論時每個 Token 實際激活的運作參數僅為 370 億(37B)。這種「大體積、輕量推論」的 MoE 架構在多項硬體適應指標上實現了極佳的平衡,其核心技術規格與設計亮點如下:

1. 深度與寬度的雙向「向上循環」(Upcycling)

開發團隊直接對前代 K-EXAONE(236B)進行模型結構擴充,使其規模擴大至三倍以上。為了解決極深層模型在訓練與推論中常見的「梯度與激活值爆炸」難題,K-EXAONE 2.0 在雙 SwiGLU 分支後引入了數值夾緊機制(Clamping after two SwiGLU branches),顯著穩固了 78 層(2 層 Dense 頭 + 76 層 Sparse MoE)超深層網路的數值流。

2. 混合注意力機制(Hybrid Attention Matrix)

為了優化長文本處理的記憶體(VRAM)開銷,K-EXAONE 2.0 摒棄了全域自注意力的單一做法,改採高度精細化的混合結構:

  • 全域注意力(Global Attention): 基於無位置編碼(NoPE)架構。
  • 滑動視窗注意力(Sliding Window Attention, SWA): 包含 4096 窗口大小的局部 SWA 層,以及多個由「3層 128 窗口局部 SWA + 1層全域自注意力」組成的混合 Block,在提供高達 256K(262,144 tokens) 的超長上下文窗口之餘,極大程度壓縮了 KV 快取的硬體佔用。

3. 混合專家(MoE)與門控細節

  • 總專家數: 256 個 MoE 專家 + 1 個始終激活的共享專家(Shared Expert)。
  • 激活配置: 每次推論時,路由會精準激活其中的 8 個專家
  • 詞彙表規模(Vocab Size): 擴大至 153,600,且原生支援的語言從 6 種全面擴展至 10 種多國語言(韓語、英語、西班牙語、德語、日語、越南語、法語、義大利語、波蘭語與葡萄牙語)。

二、 卓越的基準測試表現 (Benchmarks)

K-EXAONE 2.0 BF16 模型在多個權威基準測試中展現出頂尖的開源競爭力,特別是在長文本檢索、代碼代理與安全性指標上表現優異:

評測領域 (Dimension)基準測試 (Benchmark)K-EXAONE 2.0 得分前代 K-EXAONE 得分
數學能力 (Math)AIME 202692.392.2
IMO Answer78.676.3
程式與代理編碼 (Coding / Agentic)SWE Bench Verified68.249.4
Terminal-Bench 2.143.830.3
長文本理解 (Long Context)OpenAI-MRCR94.452.3
Ko-LongBench (韓語長文本)89.686.8
安全對齊 (Safety)KGC-Safety99.896.1
ROK-Fortress89.560.9

三、 部署與執行指南

由於 K-EXAONE 2.0 採用了自訂的 SwiGLU 夾緊與混合注意力架構,無法直接使用標準的 vLLM 或 SGLang 開源主線版本載入。開發團隊針對兩大主流推論引擎釋出了專屬的 fork 分支

此外,該模型全面支援 MTP(Multi-Token Prediction,多 Token 預測,內置 1 個 MTP 層)DSpark 兩大投機解碼(Speculative Decoding)技術,能將生成速度較傳統自回歸方法提升約 3 至 5 倍,大幅緩解了 Agent 任務在長文本輸出時的延遲瓶頸。

1. SGLang 服務化部署

SGLang 完整支援 MTP 與 DSpark,是目前追求極低延遲與高吞吐的首選。

安裝依賴:

uv venv
source .venv/bin/activate
# 安裝官方專屬相容 fork 分支
uv pip install git+https://github.com/lkm2835/sglang@add-k-exaone2
uv pip install git+https://github.com/nuxlear/transformers@add-k-exaone2

服務啟動指令(以雙節點、每節點 8 張 NVIDIA H200 GPU,即 TP=16 啟動為例):

# 啟動低延遲(Low Latency)模式
sglang serve     --model-path LGAI-EXAONE/K-EXAONE-2.0-750B-A37B     --served-model-name K-EXAONE-2.0-750B-A37B     --tp 16     --dist-init-addr $HEAD_ADDR     --nnodes 2     --node-rank $NODE_RANK     --reasoning-parser qwen3     --tool-call-parser qwen3_coder     --host 0.0.0.0     --port 8000     --max-running-requests 128     --speculative-algo EAGLE     --speculative-num-steps 4     --speculative-eagle-topk 1     --speculative-num-draft-tokens 5     --mem-fraction-static 0.875     --swa-full-tokens-ratio 0.3

⚠️ 硬體相容性警告: 若您部署於 NVIDIA B200 GPUs 硬體環境上,啟動指令中必須加入 --disable-prefill-cuda-graph 選項,否則會觸發 CUDA Graph 衝突,導致模型生成結果崩潰。

2. vLLM 服務化部署

vLLM 在顯存動態管理上更加成熟,但需要注意:目前 vLLM 分支暫不支援 DSpark 投機解碼

安裝依賴:

uv venv
source .venv/bin/activate
# 安裝官方專屬相容 fork 分支
uv pip install git+https://github.com/lkm2835/vllm@add-k-exaone2 --torch-backend auto
uv pip install git+https://github.com/nuxlear/transformers@add-k-exaone2

服務啟動指令:

exec vllm serve LGAI-EXAONE/K-EXAONE-2.0-750B-A37B     --served-model-name K-EXAONE-2.0-750B-A37B     --trust-remote-code     --tensor-parallel-size 16     --distributed-executor-backend mp     --nnodes 2     --node-rank $NODE_RANK     --master-addr $HEAD_IP     --master-port 30000     --gpu-memory-utilization 0.9     --max-num-seqs 256     --reasoning-parser qwen3     --enable-auto-tool-choice     --tool-call-parser qwen3_xml     --host 0.0.0.0     --port 8000     --speculative_config '{
        "method": "mtp", 
        "num_speculative_tokens": 4
    }'

四、 常見問題與推理優化建議

Q:推薦的推論參數設定為何? 為了確保最優的輸出品質,官方強烈建議在多數情況下將 temperature 設定為 1.0,並將 top_p 設定為 0.95

Q:什麼是推理模式(Reasoning Mode)?如何關閉? K-EXAONE 2.0 預設開啟「思考推理機制」(enable_thinking=True)。若您的任務更看重推論回應速度(如簡單的對話或長文本單純摘要),可在呼叫時將 enable_thinking 設定為 False,切換為非推理模式。

Q:如何最佳化 Agent 代理與長任務的連貫性? 在處理深度研究、自主 Coding 或 Agent 工作流等長時任務時,強烈建議啟用 preserve_thinking=True。此參數允許模型在後續對話中,無損跨對話追蹤並傳遞之前的推理過程上下文(reasoning_content),避免代理在多輪對話後偏離最初的因果鏈。

Q:如何將它集成至 Agent 框架(如 OpenCode)中? 您可直接在 Agent 設定檔 opencode.json 中配置自訂的本地 OpenAI 相容伺服器端點,並在 extraBody 中自動注入對應的 chat_template_kwargs

{
  "$schema": "https://opencode.ai/config.json",
  "provider": {
    "local": {
      "npm": "@ai-sdk/openai-compatible",
      "name": "Local OpenAI-compatible server",
      "options": {
        "baseURL": "http://localhost:8000/v1",
        "extraBody": {
          "chat_template_kwargs": {
            "enable_thinking": true,
            "preserve_thinking": true
          }
        }
      },
      "models": {
        "K-EXAONE-2": {
          "name": "K-EXAONE 2.0",
          "limit": {
            "context": 262144,
            "output": 32768
          }
        }
      }
    }
  }
}

五、 局限性與安全性說明

雖然 LG AI Research 團隊在數據清洗階段投入了巨大心力,過濾了絕大多數有害、偏見、侵權或隱私資訊,但 K-EXAONE 2.0 在極端情況下仍可能產生幻覺(Hallucination)或輸出不一致的文本。

其知識截止日期(Knowledge Cutoff)為 2025 年第二季(2025 2Q),對於最新的時效性資訊可能無法準確掌握,在部署於高風險核心業務前,建議搭配外部 RAG 與人工審查機制。


總結

透過「向上循環(Upcycling)」重塑結構、投機解碼(MTP / DSpark)打破速度瓶頸,並輔以多語言、多模態(透過 256K 混合注意力長文本處理)的卓越設計,K-EXAONE 2.0 成為了目前企業級開源大模型中極具潛力的選擇。

欲深入研究該模型的完整科學演進與詳細架構數據,歡迎查閱 LG 團隊發布的 EXAONE 2.0 官方技術報告


相關圖片

圖片來源: 相關圖片

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.