Qwen3.8-Flash-Next 引起討論的原因,不是它把一個 1T 參數模型神奇地壓進家用顯卡,而是它把「模型應該學會反覆出現的多 token 模式」這件事,從一般神經網路計算裡拆出來,交給 Engram 查表處理。
Engram 到底是什麼?先把它想成更長的 n-gram 記憶
傳統語言模型會使用 Token Embedding 把單一 token 映射成向量,再透過 Attention 和 FFN 層逐步推導語意與上下文。Engram 的想法更加直接:以最近的兩到三個 token(Bigram 或 Trigram)組成 Key,直接查詢一張龐大的 n-gram embedding table,提取模型在訓練時所記憶的靜態多 token 模式。
這種查表的特點是查詢時間複雜度接近 O(1),完全不消耗 GPU 浮點運算(FLOPs)。它極度適合用來存儲拼字、固定短語、專有名詞與格式化樣板(例如「New York」或「import std」);至於該模式在當前語境下是否重要,則由主模型的門控與上下文機制負責篩選。因此,Engram 並非具備自主推理能力的外部資料庫,也無法直接將記憶體容量轉換為更高的邏輯思維深度。
Qwen3.8-Flash-Next 怎麼使用這個設計?
Qwen 官方技術報告將 Qwen3.8-Flash-Next 定位為 Qwen4 架構的早期預覽模型。其主體為 125B 參數的稀疏 MoE 模型,單次前向傳播僅激活 6B 活躍參數(512 個專家中的 10 個 Routed 專家與 1 個 Shared 專家);此外更配置了 51B 參數(約 20,000,000 個條目,位於第 2 層)的 n-gram embedding table 與 4B 的多 token 預測(MTP)模組。
這裡最容易被社群討論帶偏:6B 活躍參數代表每一次 Token 算力的負擔極低,但不代表整個模型或 51B 的 Engram 表只需要 6B 記憶體。Engram 的價值在於將「重複推導的靜態模式」轉化為低成本的記憶體讀取,讓 Transformer 主幹的計算資源集中用於處理長上下文關係、複合推理與 Agent 決策。
除了 Engram 之外,Qwen3.8-Flash-Next 還採用了多項系統性架構創新:
- 混合注意力機制(GDN + QSA):結合 Gated DeltaNet 與微塊級別(Micro-block)的 Qwen Sparse Attention,大幅降低 262K 原生長上下文(可擴展至 1M)下的注意力延遲;
- 門控殘差(Gated Residual):將殘差流擴展為 4 個分支,並透過動態門控控制讀寫,提升深層網路訓練穩定性;
- Muon + AdamW 混合優化器:針對不同權重類別分工優化,消除批次溫升階段(Warmup)。
為什麼「可以本機跑 1T」是錯誤理解?
Engram table 依然需要佔用實際的物理存儲空間。雖然這張 51B 的 n-gram 表可以透過非同步預取(Asynchronous Prefetching)下放至系統 RAM(例如啟用 VLLM_PLE_CPU_OFFLOAD=1 或 llama.cpp 的 CPU offload),在 PCIe 傳輸與 Transformer 計算重疊的情況下運算,但它依然需要足夠的系統記憶體容量與頻寬(運作通常需要 78GB 至 128GB 以上的 RAM/VRAM 組合)。
更務實的理解是:Engram 讓大模型設計能將「高計算濃度的神經網路推理」與「高記憶體濃度的靜態記憶」解耦,提升硬體配置的彈性;它並未保證使用者能僅憑單張消費級顯卡就流暢執行超大模型。實際推論速度仍受到 CPU 記憶體頻寬、PCIe 匯流排速度、KV Cache 大小以及批次(Batch Size)配置的嚴格限制。
研究和實作資料從哪裡看?
模型權重與使用說明可從 Qwen3.8-Flash-Next 的 Hugging Face 頁面開始,官方程式碼在 QwenLM/Qwen3.8-Flash-Next GitHub。想了解架構取捨,應閱讀 On the Design of Qwen3.8-Next Architecture 論文以及倉庫裡的 technical report。社群對模型發布的整理則可參考 Reddit megathread。
實驗時不要只測一個短 prompt。可以準備三組資料:重複短語與格式內容、需要長上下文整合的文件,以及必須即時讀取外部資料的問答。第一組比較能看出 Engram 對靜態模式的幫助,後兩組則能避免把查表能力誤認成完整推理能力。
它帶來的實際意義
對模型研究者而言,Engram 提供了一條不同於「繼續加深 Transformer」的路:有些知識或模式不一定需要每次都透過完整神經網路重新計算。對部署者而言,真正的問題則變成如何安排權重、embedding table、KV cache 和頻寬,而不是只看 active parameter 的數字。
對一般使用者來說,Qwen3.8-Flash-Next 值得看的不是一句「可以在本機跑超大模型」,而是它示範了下一代模型可能會把計算與記憶拆成不同層次。這種架構能否在你的硬體上得到好體驗,仍要以官方 runtime 和實際 profiling 為準。
Engram 和 RAG 不是同一件事
Engram 是模型內部的靜態模式記憶,RAG 則是在推理時取回外部文件;前者不能取代需要更新資料、引用與權限控管的檢索流程。

