AI 日報|Meta 開源 MetaRoCE 網路架構與自研 MTIA 300 晶片、阿里開源 Qwen3.8-27B 與萬相 3.0、JetBrains 推出 Junie Local 離線 Agent
模型發布/更新
Qwen3.8-27B — 阿里雲 Qwen 團隊
- 一言以蔽之:阿里雲正式開源 Qwen3.8-27B 原生多模態密集模型,在 Code Arena: WebDev 評測中殺入全球前十,成為同尺寸級別中唯一登上前十名的模型。
- 核心亮點:
- 小尺寸高戰力:以 27B 引數量在整體表現上超越 Qwen3.7-Plus,在消費級產品(#6)、品牌行銷(#7)與遊戲開發(#8)程式設計場景中表現亮眼。
- 超長上下文延伸:原生支援 262K 上下文長度,透過 YaRN 技術可輕鬆無損擴充套件至 1M Token。
- 技術規格:27B Dense 架構 / 原生多模態 / 開放權重(Apache 2.0 開源協議)
- 傳送門:
Exciting news: Qwen3.8-27B by @Alibaba_Qwen just landed in Code Arena: WebDev at #9 overall with 1595 pts. It is the only model in its size class in the top 10, and also reshapes the Pareto Frontier!
— Arena.ai (@arena) August 24, 2026
It is only 6 ranks behind the much larger Qwen3.8-Max. For scale: Gemma 4-31B… https://t.co/i5SztFn4Xh pic.twitter.com/KjJWrO08Wi
Wan 3.0(萬相 3.0)— 阿里萬相 / 多平臺同步上線
- 一言以蔽之:阿里萬相全新 3.0 視訊生成模型正式登陸 OpenRouter、Replicate、Runway 與 Pika,支援原生 30 秒一鏡到底與影音同步生成。
- 核心亮點:
- 多參考輸入與一鏡到底:支援多達 20 個影象、視訊與音訊參考輸入,可直接生成具備高電影質感與音效設計的 30 秒連續鏡頭。
- 全面接入主流 API:支援 480p、720p 與 1080p 多種解析度輸出,並在各主流平臺提供最高 35% 的限時呼叫折扣。
- 技術規格:文字/影象/音訊轉視訊 / 原生音訊同步 / 閉源 API
- 傳送門:
The wait is over. WAN 3.0 is here—20 references, enhanced visual and audio realism, and 30-second generations. In fact, this entire video was one generation.
— Pika (@pika_labs) August 24, 2026
Up to 35% less expensive than competitors on the Pika API Club. Always. pic.twitter.com/Wys4eTxTdB
GLiNER2.5 — Fastino
- 一言以蔽之:Fastino 推出全新資訊擷取架構 GLiNER2.5,以邊界預測徹底取代傳統跨度列舉,解決長文字實體識別的計算瓶頸。
- 核心亮點:
- 解除實體長度限制:移除最大實體寬度約束,原生支援 4,096 詞上下文,運算複雜度隨序列長度呈線性增長。
- 零樣本泛化升級:在 16 個零樣本基準測試中整體 Macro F1 達 56.17,多語言 XNLI 任務大幅提升 24.75 分。
- 技術規格:邊界預測架構 / 線性複雜度資訊擷取 / 開放檢查點
- 傳送門:https://www.marktechpost.com/2026/08/24/fastino-releases-gliner2-5-a-boundary-prediction-architecture-that-removes-span-enumeration-from-information-extraction
產品發布/更新
Junie Local — JetBrains
- 更新內容:JetBrains 旗下程式碼 AI Agent「Junie」正式推出 Junie Local 功能。使用者僅需在終端機輸入
/local,即可全自動下載並在本機 Apple Silicon(M5 Mac)上執行專門微調的 Qwen3.6-27B 4-bit 模型,無須設定複雜端點或消耗雲端 Token,實現程式碼 100% 離線隱私處理。 - 適用人群:注重程式碼隱私的開發者 / Mac 本地開發者 / 離線辦公族
- 體驗通道:https://blog.jetbrains.com/junie/2026/08/junie-local-launch/
Visual Studio Bring Your Own Model (BYOM) — 微軟
- 更新內容:微軟在 Visual Studio 預覽版中正式上線「自帶模型(BYOM)」功能,開放社群版、專業版與企業版使用者自由接入自選或企業內部核准的特定領域大型語言模型,打破單一模型繫結限制。
- 適用人群:.NET 與 C++ 開發者 / 企業軟體工程團隊
- 體驗通道:https://devblogs.microsoft.com/visualstudio/unlocking-the-power-of-ai-for-every-developer-in-visual-studio-with-bring-your-own-model/
Claude Code v2.1.243 — Anthropic
- 更新內容:Anthropic 發布命令列開發工具 Claude Code 最新版本,新增
/usage指令中的 Loops 迴圈細分統計資料、支援自訂modelPicker選項、開放設定promptCacheTtl與subagentPromptCacheTtl快取時效,並匯入組織層級的 modelPricing 費用管理控制。 - 適用人群:深度依賴終端機與 AI Agent 協同開發的軟體工程師
- 體驗通道:https://github.com/anthropics/claude-code/releases/tag/v2.1.243
ElevenLabs CLI v1 — ElevenLabs
- 更新內容:ElevenLabs 正式推出終端機工具 CLI v1,將其全套音訊生成、語音克隆與文字轉語音 API 完整移植至 Command Line。內建 AI Agent 技能集、結構化 JSON 輸出以及乾執行(Dry Run)預覽功能,讓開發者與自動化 Agent 能直接在指令列中編排複雜的語音工作流。
- 適用人群:音訊應用開發者 / 影音自動化內容創作者 / Agent 開發者
- 體驗通道:
Today we are releasing ElevenLabs CLI v1, which brings the entire ElevenLabs API into the terminal. https://t.co/03QqQSEK3K
— ElevenLabs (@ElevenLabs) August 24, 2026
Grok Voice Think Fast 2.0 & Starlink 規模化落地 — xAI / SpaceX
- 更新內容:xAI 旗下語音模型 Grok Voice Think Fast 2.0 在 Artificial Analysis 最新語音對語音指數中取得第一名(語音推理 97.2%、任務成功率 94.7%)。同時 SpaceX 披露,Starlink 已全面部署該模型作為客服核心,每日自主處理超過 15,000 通語音支援電話並完成數千筆硬體訂單。
- 適用人群:企業客服架構師 / 語音 AI Agent 開發者 / 一般使用者
- 體驗通道:
Grok Voice Think Fast 2.0 is now #1 on the Artificial Analysis Speech-to-Speech Index.
— SpaceXAI (@SpaceXAI) August 24, 2026
This index measures whether voice agents can reason over the speech it hears, resolve real customer issues, and correctly complete tasks using agent tools. pic.twitter.com/KnZ9udioNa
產業動態
Meta 開源 MetaRoCE 傳輸協議與 MTIA 300 自研訓練晶片 — Meta
- 事件概述:Meta 宣佈透過 OCP(Open Compute Project)全面開源 MetaRoCE 規範與參考軟體。這是一套專為通用乙太網路打造的 RDMA 傳輸協議,支援原生亂序交付與多路徑傳輸,無須依賴 PFC 即可在「百萬級 GPU 叢集」中提供高吞吐與超低尾延遲。此外,Meta 同步公開首款內建 NIC 晶片塊的自研推薦訓練晶片 MTIA 300。
- 影響分析:Meta 持續推動 AI 基礎設施走向商品化乙太網路,打破專有 InfiniBand 技術壟斷,有望大幅降低超大型資料中心建置前沿 AI 叢集的通訊與硬體成本。
- 新聞連結:https://engineering.fb.com/2026/08/24/networking-traffic/metaroce-rdma-transport-ai-ethernet/
NVIDIA Vera Rubin NVL72 展現極致能效,攜手 SpaceX 籌備太空 AI 部署 — NVIDIA / SpaceX
- 事件概述:NVIDIA 實測資料指出,次世代 Vera Rubin NVL72 在 AI Agent 工作負載下,每兆瓦吞吐量較 GB300 NVL72 最高提升達 30 倍,每百萬 Token 運算成本降幅達 35 倍。同時 SpaceX 宣佈與 NVIDIA 合作研發太空最佳化版 Vera Rubin 系統,預計於今年第四季隨 Starmind AI 衛星發射入軌。
- 影響分析:AI Agent 的高並發與長時推理正推動晶片設計重心由純算力轉向極致能耗比;太空邊緣運算的落地亦開啟了吉瓦級天基 AI 基礎設施的新想像。
- 新聞連結:https://blogs.nvidia.com/blog/vera-rubin-nvl72-efficiency-ai-agents
Mistral AI 與沙烏地 HUMAIN 簽署數億歐元戰略合作 — Mistral AI
- 事件概述:歐洲開源巨頭 Mistral AI 與沙烏地阿拉伯 HUMAIN 達成數億歐元戰略合作,雙方將結合 HUMAIN 的資料中心基礎設施,針對阿拉伯語系開發本地化的高效能前沿模型,初期聚焦於網路安全、語音辨識與受監管行業應用。
- 影響分析:主權 AI(Sovereign AI)正成為中東與歐洲非美系國家的戰略主流,大型開源實驗室與產油國算力資源的深度繫結將加速多語言模型的競爭。
- 新聞連結:https://mistral.ai/news/mistral-x-humain
2026 年全球 AI 資本支出預計達 7,650 億美元,首度超越油氣產業 — 摩根士丹利
- 事件概述:摩根士丹利最新研究報告指出,2026 年全球人工智慧資本支出(CapEx)預計將達 7,650 億美元,歷史上首次超越傳統油氣探勘開採業的 6,810 億美元,預估至 2031 年將逼近翻倍。
- 影響分析:算力正全面確立其作為全球經濟新型核心資源的地位,金融市場甚至正籌備推出全球首個算力期貨合約,實體產業資金向 AI 基礎設施轉移的趨勢不可逆轉。
- 新聞連結:
"In 2026, AI capex reached $765B, passing oil and gas capex at $681B for the first time. By 2031, it is projected to nearly double. Morgan Stanley projects that AI’s diffusion across the global economy creates a $40T opportunity. That opportunity rests on a key resource:… https://t.co/AK35aPb2bS pic.twitter.com/xwNiidUaQO
— Rohan Paul (@rohanpaul_ai) August 24, 2026
論文研究
ACES:以「Skill Lift」成對增益評估 AI Agent 技能的全新基準 — NVIDIA
- 研究動機:企業團隊日益依賴共享技能庫(Skill Libraries)擴充套件 Agent 能力,但傳統依賴靜態程式碼結構與安全掃描的審查機制,其評分與真實任務表現相關性極低(Spearman 相關係數僅 0.14)。
- 核心創新:提出 ACES 框架與「Skill Lift」評估法。在相同的模型、沙盒環境與評分器下,分別對載入技能與未載入技能的 Agent 執行相同任務,精準測量技能帶來的淨成效增益,並利用 Agent Trajectory Interchange Format 統一不同 Harness 之間的軌跡資料。
- 研究成果:在 4 種 Harness、58 項生產環境技能與 947 個配對案例中,成功驗證 Skill Lift 能準確反映 Agent 在執行效率與行為檢查上的實質進步。
- 論文地址:
Very interesting new paper from NVIDIA.
— elvis (@omarsar0) August 24, 2026
(bookmark it)
It takes a closer look at evaluating agent skills.
Enterprise teams are starting to leverage shared skill libraries, and the review gate is typically a scanner that checks structure, style, and security.
NVIDIA measured… pic.twitter.com/ySHI2NqFj5
長程規劃 Agent 的基礎瓶頸與 On-Policy 蒸餾機制研究 — 研究團隊
- 研究動機:探討大型模型在面對長程多步驟規劃(Long-horizon Planning)時,為何傳統的後訓練(Post-training)策略往往難以修復決策失誤。
- 核心創新:研究揭示長程任務中噪聲軌跡會不斷累積錯誤,且末端稀疏獎勵會導致信用分配失準。團隊提出採用 OPD(On-Policy Distillation)在整個執行軌跡中提供即時教師反饋,取代僅在任務終點結算的 GRPO 結果獎勵機制。
- 研究成果:實驗證實 OPD 在含噪聲的長程規劃場景下顯著優於純結果驅動的強化學習,能有效避免因規劃策略衝突而導致的模型遺忘現象。
- 論文地址:
No amount of post-training cleanly fixes weak long-horizon foundations: noisy trajectories compound errors, sparse rewards misassign credit, and conflicting teachers trigger forgetting.
— Rohan Paul (@rohanpaul_ai) August 24, 2026
This paper finds, ff you want agents to stay reliable over long tasks, give them clean… pic.twitter.com/d3ER4tEhCM
史丹佛研究:AI 對就業市場衝擊呈現結構分化,初階年輕從業者受創最深 — 史丹佛大學
- 研究動機:量化分析生成式 AI 在真實勞動市場中對不同年齡與資歷工作者的衝擊差異。
- 核心創新:透過跨行業追蹤高 AI 暴露度(High AI Exposure)職業與低暴露度職業中從業者的就業流動資料。
- 研究成果:研究發現 22 至 25 歲的初階年輕員工就業水準已比低暴露領域同齡人低 19%(高於去年的 13%),而資深從業者與年長員工迄今基本未受顯著負面衝擊,顯示 AI 正在重塑白領職場的進入門檻。
- 論文地址:https://arstechnica.com/ai/2026/08/ai-is-hitting-entry-level-jobs-hardest-stanford-study-finds
其他分享
Agent Playground:跨模型 Agent 同步評測與競速平臺 — AgentSky
- 內容簡介:AgentSky.dev 推出名為 Agent Playground 的開源實驗工具,被稱為「AI Agent 界的 OpenRouter」。開發者可以在同一個瀏覽器介面中,將相同的複雜任務與真實工具鏈(如 GitHub、Gmail)同時指派給 Claude Code、Codex、DeepSeek 等主流 Agent Harness,即時並排比較各 Agent 完成任務所需的時間、消耗的 Token 數量與最終花費成本。
- 傳送門:
Very cool launch from the @agentsky_dev team. Agent Playground lets you give Claude Code, Codex, and DeepSeek the identical task in one browser and compare time, cost, and tokens side by side.
— elvis (@omarsar0) August 24, 2026
I run same-task harness tests constantly, and I think this is one of the first places… https://t.co/dEUXshyAVy
Vercel 全球 Sandbox 正式可用與 Turborepo 快取智慧降級防護 — Vercel
- 內容簡介:Vercel 宣佈其雲端沙盒環境 Vercel Sandbox 現已在全球多個區域(華盛頓特區、舊金山、克里夫蘭、巴黎)正式提供服務,大幅縮短 Agent 執行雲端工具時的資料庫延遲;同時彈性建置機器匯入了 Turborepo 快取感知機制,避免因快取命中時短暫的低負載而錯誤降級硬體配置,提升持續整合建置的穩定度。
- 傳送門:https://vercel.com/changelog/vercel-sandbox-is-now-globally-available



