<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Inference</title><link>https://www.communeify.com/tw/tag/inference/</link><description>Communeify - Your Community Platform</description><generator>Hugo</generator><atom:link href="https://www.communeify.com/tw/tag/inference/" rel="self" type="application/rss+xml"/><item><title>Qwen3.8-Flash-Next 與 Engram：不是讓 1T 模型突然塞進單張顯卡</title><link>https://www.communeify.com/tw/blog/qwen3-8-flash-next-engram-ngram-model/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/qwen3-8-flash-next-engram-ngram-model/</guid><pubDate>Fri, 25 Sep 2026 08:10:00 +0800</pubDate><description> Qwen3.8-Flash-Next 引起討論的原因，不是它把一個 1T 參數模型神奇地壓進家用顯卡，而是它把「模型應該學會反覆出現的多 token 模式」這件事，從一般神經網路計算裡拆出來，交給 Engram 查表處理。
Engram 到底是什麼？先把它想成更長的 n-gram 記憶 傳統語言模型會使用 Token Embedding 把單一 token 映射成向量，再透過 Attention 和 FFN 層逐步推導語意與上下文。Engram 的想法更加直接：以最近的兩到三個 token（Bigram 或 Trigram）組成 Key，直接查詢一張龐大的 n-gram embedding table，提取模型在訓練時所記憶的靜態多 token 模式。
這種查表的特點是查詢時間複雜度接近 O(1)，完全不消耗 GPU 浮點運算（FLOPs）。它極度適合用來存儲拼字、固定短語、專有名詞與格式化樣板（例如「New York」或「import std」）；至於該模式在當前語境下是否重要，則由主模型的門控與上下文機制負責篩選。因此，Engram 並非具備自主推理能力的外部資料庫，也無法直接將記憶體容量轉換為更高的邏輯思維深度。
Qwen3.8-Flash-Next 怎麼使用這個設計？ Qwen 官方技術報告將 Qwen3.8-Flash-Next 定位為 Qwen4 架構的早期預覽模型。其主體為 125B 參數的稀疏 MoE 模型，單次前向傳播僅激活 6B 活躍參數（512 個專家中的 10 個 Routed 專家與 1 個 Shared 專家）；此外更配置了 51B 參數（約 20,000,000 個條目，位於第 2 層）的 n-gram embedding table 與 4B 的多 token 預測（MTP）模組。</description></item></channel></rss>