tool

Thinking Machines 推出全新高效能 Inkling-Small 模型:以 276B 參數達成與大模型同級表現

August 13, 2026
Updated Aug 13
2 min read
Thinking Machines 推出全新高效能 Inkling-Small 模型:以 276B 參數達成與大模型同級表現

輕量級 AI 新選擇:Inkling-Small 的效率與效能平衡

在人工智慧領域,開發團隊往往過度追求極致算力與模型參數規模,卻忽略了實際生產環境部署中的計算效率與邊際成本。Thinking Machines 近期推出的開源混合專家模型 Inkling-Small,在大幅縮減模型體積的同時,保留了前代旗艦模型 Inkling 的強大處理能力,為開發者與研究人員提供了一個極具成本效益比的全新選擇。

圖片來源: Introducing Inkling-Small - Thinking Machines Lab

核心設計:無編碼器多模態與混合專家架構

Inkling-Small 的核心目標是極大化降低每一次推論的運算成本。它採用了以下創新的底層架構設計:

  • 自適應稀疏混合專家(Sparse MoE): 作為一款 42 層的解碼器(Decoder-only)Transformer 結構,模型擁有高達 276B 的總參數,但在推論時每個 Token 僅會路由至 6 個專屬專家(共 256 個專家組件) 加上 2 個在所有 Token 上皆保持動態激活的共享專家,使得實際活躍參數僅有 12B。相比於前代旗艦模型 Inkling(總參數 975B,活躍參數 41B),這種稀疏專家設計在不犧牲模型表達力的前提下,顯著縮減了運算開銷。
  • 原生無編碼器多模態架構(Natively Multimodal Encoder-Free Architecture): 該模型摒棄了傳統多模態模型外接獨立視覺(如 ViT)或音訊(如 Whisper)編碼器的做法。在 Inkling-Small 中:
    • 音訊輸入 被直接表示為 dMel 頻譜圖(dMel spectrograms)
    • 圖像輸入 則被拆解為 40×40 像素的圖像貼片(patches),並通過一個輕量化的 四層分層多層感知器(four-layer hMLP) 進行轉換。
    • 所有模態的信號最終都會經由輕量化的嵌入層直接投影至統一的隱存空間中,與文字 Token 進行聯合解碼處理。
  • 混合注意力幾何(Hybrid Attention): 模型的注意力機制融合了局部(Local)與全域(Global)注意力的混合設計,能更靈活地在超長上下文窗口(最大支援高達 1M Tokens)中權衡記憶吞吐量與流暢度。

卓越的推理、編程與代理能力

得益於改進的預訓練數據集配比與優化的訓練秘方,加上在 NVIDIA GB300 NVL72 叢集系統上的高效預訓練,Inkling-Small 的後訓練(Post-training)管道展現了顯著的進化。其前置版本利用了以 Inkling 為教師模型的在線策略蒸餾(On-policy distillation)技術,隨後團隊更針對代理編程場景(Agentic coding RL)進行了長達兩週的強化學習規模擴展(Scaling RL)

在多項具備高難度的前沿基準測試中,活躍參數僅有 12B 的 Inkling-Small 展現出超越或持平前代旗艦模型的驚人成績:

  • Humanity’s Last Exam (HLE): 在無工具的純文本推理測試中,Inkling-Small 取得了 31.6% 的得分,高於前代 Inkling 的 29.7%。
  • SWE-bench Verified: 在軟體工程自動化解決任務中,Inkling-Small 成功突破 80% 大關,取得了 80.2% 的解決率(採用 bash-only harness 測試),大幅超越 Qwen3.5 397B-A17B(76.4%)與前代 Inkling(77.6%)。
  • Terminal Bench 2.1: 在終端代理編程控制測試中取得了 64.7% 的最高成績(基於最佳測試架構)。

此外,Inkling-Small 原生繼承了靈活的**可控思維努力程度(Variable Thinking Effort)**機制。開發者可在推論時自由調整思維努力區間(從 minimal 到 xhigh),在回應品質與 Token 運算生成成本(Inkling-Small 官方定價為每百萬 Token 僅 $1.20 美元,比前代 Inkling 的 $4.05 美元划算三倍以上)之間找到最完美的平衡點。

原生多模態與決策預測能力

除了文本與編程優勢,Inkling-Small 在聽覺與視覺交互任務上也毫不妥協:

  • 圖表與視覺 Python 協同: 模型極大提升了結合 Python 代碼執行視覺推理的能力。面對圖表、科學文獻等複雜的圖像時,能自適應調用代碼進行精確的裁切(cropping)、縮放(zooming)與編程圖像檢驗,讓微小的關鍵數據無所遁形。
  • 原生音訊理解: 支援 WAV 格式(16kHz 採樣率) 的直接語音輸入,最佳推薦長度在 2 分鐘以內。在 Audio MC(取得 54.9%)與 VoiceBench(取得 90.1%)等聽覺基準測試中展現出高水準表現。
  • 極佳的預測校準(Forecasting & Epistemics): 模型的後訓練特別針對「預測準確度與校準能力」進行了基於合適評估規則的強化學習(RL against proper scoring rules),使其能在 ForecastBench 零檢索測試中取得 61.3% 的 Brier Index 分數,在 Prophet Arena 中取得 0.1238 的低誤差 Brier 分數,其表達合適信心與不確定性預測的能力領先眾多閉源旗艦模型。

部署建議與工程實務

開發者可前往官方專區進行多維度測試與部署:

  • 本地推論庫支援: 模型完整開放權重,除了 SGLang、vLLM 與 TokenSpeed 外,也原生支持 Unsloth 的極速微調方案與 Hugging Face Transformers
  • 安全防護架構: 官方在發布前對 everyday 交互與高危風險(包含 CBRN 與 Cyber 能力)進行了對抗性紅隊測試,其在 StrongREJECT 測試中拒絕明確有害請求的成功率高達 98.4%。然而,由於開源模型的限制,其在面對部分角色扮演(Role-play)或間接繞過提示詞時仍存在合規風險,建議在生產環境外部署 Llama Guard 作為過濾屏障。
  • 局限性與部署邊界: 與所有大型語言模型相同,Inkling-Small 在超長多輪對話中可能面臨指令遵循度下降、或產生合理但錯誤的「幻覺(Hallucinations)」。團隊強烈建議避免在未經額外特定領域微調(Domain-specific fine-tuning)、人工審查(Human-in-the-loop)與專業驗證的前提下,將其直接部署於醫療、法律或生命安全關鍵的決策場景。

快速開發指南

1. 使用 Transformers 進行極簡多模態推理

開發者可直接利用 Hugging Face transformers 庫快速載入模型進行圖像與文字的聯合推理:

from transformers import AutoProcessor, AutoModelForMultimodalLM
import torch

# 載入模型與處理器
model_id = "thinkingmachines/Inkling-Small"
processor = AutoProcessor.from_pretrained(model_id)
model = AutoModelForMultimodalLM.from_pretrained(model_id, device_map="auto", torch_dtype=torch.bfloat16)

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"},
            {"type": "text", "text": "請告訴我這張糖果包裝上畫的是什麼動物?"}
        ]
    },
]

inputs = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt"
).to(model.device)

outputs = model.generate(**inputs, max_new_tokens=100)
print(processor.decode(outputs[inputs["input_ids"].shape[-1]:]))

2. 使用 SGLang 進行高吞吐量本地部署

若要在伺服器端部署 OpenAI 相容的 API 接口,可快速執行以下命令:

# 安裝 SGLang 核心庫
pip install sglang

# 啟動本地推論服務器
python3 -m sglang.launch_server     --model-path "thinkingmachines/Inkling-Small"     --host 0.0.0.0     --port 30000

常見問題

Q:Inkling-Small 可以在一般的個人硬體上部署嗎? A:可以。得益於 12B 的超輕量級活躍參數,它對運行時的顯存開銷非常友好。若要進一步在消費級顯示卡或邊緣端(如 Mac)流暢運行,可前往 Hugging Face 下載豐富的第三方 GGUF/Ollama 量化版本(包括 BF16 與超低精度的 NVFP4 數值格式)。

Q:適合垂直領域自訂微調嗎? A:非常適合。Inkling-Small 開放了完整權重,並可直接與 Tinker 平台的雲端微調託管服務、或本地開源庫 Unsloth 進行無縫對接。


結語

Inkling-Small 證明了,精細化的資源調配(MoE)與無編碼器架構的深度優化,能在極小化硬體與代幣成本的同時,激發出不遜於千億稠密大模型的強悍推理與代理能力。若您需要一款具備強大代碼生成、多模態交互與可控思考深度的多面手開源模型,它無疑是目前市場上的最佳實踐方案。

分享至:
Featured Partners

© 2026 Communeify. All rights reserved.