tool

開源最強戰力!Qwen3.8-27B 多模態模型登場,深度強化推理與 Agent 執行能力

August 17, 2026
Updated Aug 17
3 min read
開源最強戰力!Qwen3.8-27B 多模態模型登場,深度強化推理與 Agent 執行能力

Qwen3.8-27B:開源模型新選擇

Qwen 系列在開源 AI 領域始終維持領先。隨著 Qwen3.5 與 3.6 的普及,開發團隊正式發布了 Qwen3.8-27B。這不僅是數字的提升,也是目前 Qwen 開源家族中綜合能力最強的一代。

圖片來源: Qwen/Qwen3.8-27B · Hugging Face

什麼是 Qwen3.8-27B?

這是一款擁有 270 億(27B)參數的稠密模型(Dense Model)。與常見的混合專家模型(MoE)不同,Qwen3.8-27B 採用了高度優化的稠密架構,旨在部署便利性與實戰效能之間取得完美平衡,特別適合編碼開發、專業研究與長週期自動化任務。

在底層設計上,它的參數規格為:

  • 模型類型:帶有視覺編碼器的因果語言模型(Causal Language Model with Vision Encoder)
  • 層數(Layers):64 層
  • 隱藏維度(Hidden Dimension):5120
  • 前饋網路(FFN)中間維度:17,408
  • 隱藏層佈局(Hidden Layout):16 × (3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)),其中融合了線性注意力機制 Gated DeltaNet(48 個 V 頭,16 個 QK 頭,頭維度 128)與 Gated Attention 門控注意力。
  • 多代幣預測(MTP):經多步訓練,大幅提升自回歸生成與推理的效率。

此外,該模型具備原生視覺處理能力,不只能處理文字,還能直接解讀圖像與影片。不論是複雜的科學圖表、文件,或是長達一小時的影片片段,它都能提供具體的分析反饋。

思考過程的靈活控制

Qwen3.8 最主要的特性在於對「思考過程」的靈活控制與對話追蹤。模型預設啟用思考模式,會在給出最終答案前先進行邏輯推演。

本代產品在思考控制上引入了三項關鍵技術:

  1. 思考模式開關(Thinking Mode Switch):模型預設啟用思考模式,產生標記為 ` …</think>

的推導內容;使用者也可以透過配置 API 參數關閉此功能(即 Instruct / 非思考模式),以縮短回應時間。 2. **思維力度調整(Reasoning Effort)**:使用者可透過reasoning_effort` 參數調整推理深度:

  • xhigh(預設):適合邏輯複雜、需要深思熟慮的任務。
  • medium:在準確性與響應速度之間取得平衡。
  • low:高效推理,針對簡單任務優化,追求低延遲與低成本。
  1. 保留思維(Preserved Thinking):預設啟用 preserve_thinking,模型在多輪對話中會完整保留歷史消息中的思維塊(Thinking Blocks)。這能確保整段對話的因果關係和決策一致性,大幅優化了 AI 代理(Agent)在長週期任務中的 KV 快取(KV Cache)利用率。如果只想保留最後一輪的思考,可手動將其設定為 False

模型重點

  • 思維與保留控制:使用者可視需求靈活調整推理深度(reasoning_effort),或開啟/關閉思考路徑,甚至設定歷史思維保留(preserve_thinking)。
  • 原生多模態理解:支援從 STEM 圖表(如 MathVision、CharXiv)到高幀率長影片的深度語意理解。
  • 強悍的代理執行力:在需要自主規劃與應對環境回饋的長週期代碼開發或辦公自動化任務中,表現出極高的端到端任務完成度。
  • 相容生態部署:原生相容 SGLang、vLLM 與 TokenSpeed 等主流高吞吐推論框架,亦可藉由量化版本在 llama.cpp 或 Ollama 中運行。

效能表現

根據官方基準測試結果,Qwen3.8-27B 在編碼、科學推理、代理人任務與多模態領域相較前代有著顯著的提升:

  • 代碼開發:在 agentic 軟體工程基準測試 SWE-bench Pro 上取得了 61.7% 的優異成績(前代 Qwen3.6-27B 為 53.5%,Opus4.6 Max 為 53.4%);而在 QwenSWEBench 上更達到了 79.0%
  • 長週期 Agent 任務:在長週期辦公任務 CoWorkBench 上取得 70.7%,而在模擬終端編程任務 Terminal Bench 2.1 上取得 73.0%
  • 多模態與電腦使用:在操作環境測試中,其 OSWorld-Verified(電腦使用)得分達 84.3%WebArena-Verified(瀏覽器使用)達 64.8%AndroidWorld(行動裝置使用)達 81.9%
  • 一般科學推理:在 GPQA Diamond 測試上高達 89.2%,多學科推理 HLE 則為 30.8%

如何開始使用與最佳實務

Qwen3.8 系列採用與 OpenAI 相容的 Chat Completions API 規格,開發者能快速導入現有應用程式中。以下為 Python 的標準調用範例:

from openai import OpenAI

# 透過環境變數配置 API 金鑰與 Base URL
client = OpenAI()

messages = [{"role": "user", "content": "寫一個 Python 函式來合併兩個已排序的連結串列。"}]

completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-27B",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,    # 預設為 True
            "preserve_thinking": True,   # 預設為 True
        },
    },
    reasoning_effort="xhigh",  # 可選 xhigh, medium, low
    stream=True,
    stream_options={"include_usage": True},
)

reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content
    elif hasattr(delta, "reasoning") and delta.reasoning is not None:
        if not is_answering:
            print(delta.reasoning, end="", flush=True)
        reasoning_content += delta.reasoning

    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

messages.append({
    "role": "assistant",
    "content": answer_content,
    "reasoning_content": reasoning_content,
    "reasoning": reasoning_content,
})

部署與優化最佳實務

  1. 參數採樣配置
    • 思考模式下:建議將參數設為 temperature=1.0top_p=0.95top_k=20min_p=0.0presence_penalty=0.0repetition_penalty=1.0
    • 非思考(Instruct)模式下:建議設為 temperature=0.7top_p=0.80top_k=20min_p=0.0presence_penalty=1.5repetition_penalty=1.0。您可以視重複情況在 02 之間微調 presence_penalty,但過高可能會導致語言混雜與輕微效能下降。
  2. 輸出 token 長度預留
    • 在支援獨立設置思考與最終輸出長度的框架中,建議在 1M 上下文額度內進行如下配置,以避免思考或回答中斷:
      • 推理思維長度上限:262,144 tokens。
      • 最終答案長度上限:131,072 tokens。
  3. 超長文本處理(最高 1,000,000 Tokens)
    • 模型原生支援 262,144 tokens 的上下文長度。若需處理超出此長度的任務,建議使用 YaRN 外推技術。vLLM、SGLang 與 TokenSpeed 均支援靜態 YaRN。
    • 例如,典型上下文為 524,288 tokens 時,將 config 中的 factor 修改為 2.0(若是 1,000,000 tokens 則設為 4.0)即可。由於靜態 YaRN 可能對短文本效能產生輕微影響,建議僅在處理極長文本時啟用。
  4. 長影片理解效能優化
    • 為優化本機純文本和圖像的推理效率,發布版默認配置較為保守。在處理一小時以上的長影片時,建議將 video_preprocessor_config.json 中的 longest_edge 參數修改為 469,762,048(對應約 224k video tokens),以解鎖更高影格率的採樣,實現頂尖的視訊理解表現。

常見問題

Q:Qwen3.8-27B 是否可以處理長影片? 是的。它支援影片理解,且通過調校 preprocessor config 中的 longest_edge,能實現對一小時以上長影片的高影格率深度解讀。

Q:如果覺得思考過程太慢,可以關掉嗎? 可以。您可以將 enable_thinking 設定為 False,並切換至 Instruct 採樣參數。請注意,若使用 Qwen Cloud API,請直接將參數 "enable_thinking": False"preserve_thinking": False 寫入 extra_body 最外層,不需像本地或第三方推論框架那樣封裝在 chat_template_kwargs 中。

Q:這個模型適合用在生產環境嗎? 是的。建議使用 vLLM、SGLang 或 TokenSpeed 等高效能推理框架進行部署,以最大化吞吐量並完美支援 YaRN 與 MTP 加速。

Qwen3.8-27B 為開源社群提供了一個極其強大、架構先進且具備靈活思維控制的工具。不論是開發高度自主的智慧體(Agent),還是處理超長上下文的多模態任務,這款模型都是目前極佳的實用選擇。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.