AI日報|Qwen 3.8 將開放 2.4 兆參數權重、Claude Fable 5 調整訂閱方案、OpenAI 提出全新 AI 價值評估法
算力不再是唯一指標?OpenAI 提出衡量價值的全新記分卡
許多企業的財務長正苦於無法衡量人工智慧的投資回報率(ROI)。傳統軟體看重的訂閱數與活躍度,在生成式 AI 時代已不再適用。OpenAI 提出,企業現在應轉而關注「每美元帶來的實用智力」(Useful Intelligence per Dollar)。
為此,OpenAI 發表了一套 全新記分卡,包含四個評估指標:
- 系統是否完成了關鍵任務?
- 單次成功任務的成本是多少?
- 產出結果是否可靠?
- 規模擴大時的效益是否隨之增加?
新指標特別強調,一味追求最低的 Token 單價可能反而更昂貴,因為後續人工檢查與反覆修改的隱形成本通常更高。這套框架旨在幫助企業釐清算力投資是否確實轉換為實際價值。
追求零風險並不切實際,資安長面對代理系統的應對策略
隨著代理型 AI(Agentic AI)系統普及,企業安全風險也隨之增加。Anthropic 副資安長 Jason Clinton 指出,將安全風險降到零並不現實,安全防護的重點在於使風險透明且可控。只要劃定好權限邊界,企業就能在安全的基礎上部署新技術。
根據這份 資安長代理型 AI 指南,資安團隊在審查代理系統時,應評估以下四個核心問題:
- 系統會接收哪些未信任的輸入?
- 系統能代表哪些角色執行何種操作?
- 若發生異常,其影響範圍(爆炸半徑)有多大?
- 系統是否具備充足的監控機制?
指南建議,權限管理應如同對待新進員工,依任務需求逐步開放,避免一開始就配置最高管理權限。
阿里將開放 2.4 兆參數 Qwen 3.8 模型權重
開源模型社群迎來新進展。阿里 Qwen 團隊在 社群平台發布預告,將開放 2.4 兆(2.4T)參數規模的 Qwen 3.8 模型權重(Open Weight)。官方表示,該模型的性能表現定位僅次於 Fable 5。
目前 Qwen3.8-Max-Preview 版本已在阿里雲 Token Plan 及 Qoder 平台上線,供開發者搶先測試。
產能提升,Claude Fable 5 導入更多訂閱方案
受限於伺服器載量,Claude Fable 5 推出後採分階段開放。根據 官方公告,Fable 5 於 7 月 20 日起正式導入所有 Max 與 Team Premium 訂閱方案中,並提供 50% 的使用額度上限。
對於 Pro 及 Team Standard 訂閱用戶,官方提供 100 美元的一次性點數回饋,用戶可透過點數扣抵方式繼續使用 Fable 5。
商湯科技推出多模態模型 SenseNova U1 Pro
商湯科技發表旗艦級多模態模型 SenseNova U1 Pro。該模型基於 NEO-Unify 架構,整合了理解、生成與行動能力,強調生成圖片的真實細節與邏輯一致性。
U1 Pro 具備原生圖文交錯推理能力,在數十輪對話互動後,仍可精準控制圖像細節,並支援 8K 原生高解析度輸出(包含超寬與超高幅面)。該模型預計於 2026 年 8 月開放 API 服務。
書生·浦語 Intern-S2-Preview-397B 登場,專攻科學領域
擁有 4,030 億參數的科學多模態模型 Intern-S2-Preview-397B 正式發表。該模型專為科學智慧(AI for Science)與長邏輯鏈代理系統設計,透過視覺語言預訓練,能直接學習並解析原始科學文獻中的圖文關聯。
除了分子設計、材料結構生成等任務外,該模型也適用於多種跨學科研究。目前官方已在 線上示範平台 開放體驗。
具身智能開源:MiniCPM-Robot 進入實體環境
為了將 AI 代理推向物理世界,MiniCPM-Robot 具身智能模型系列宣布開源,首批釋出兩個模型:
- MiniCPM-RobotManip:15 億參數的通用機器人操作模型,可透過單一權重執行多種下游任務,並支援低延遲的流式推理。
- MiniCPM-RobotTrack:首款純端側具身目標追蹤方案,在 Unitree Go2 EDU 機器狗上可實現 5+ FPS 的本機運行速度,無需依賴雲端,即可根據視覺與自然語言指令追蹤動態目標。
Google 升級 Gemma 4:強化工具調用與代理推理
Google 宣布為 Gemma 4 推出更新,聚焦於代理邏輯推理與工具調用(Tool Calling)能力。根據 官方釋出的數據,E4B 與 31B 兩個版本在各項基準測試中均有提升。
在 BFCL(Berkeley Function Calling Leaderboard)測試中,E4B 展現出更穩定的調用成功率;而 31B 版本在模擬零售、航空與電信場景的 Tau2 測試中也提升了準確度,有助於降低多步驟複雜任務的執行失誤率。
本地優先的隱私代理助理:LM Studio Bionic 發表
LM Studio Bionic 是一款專為開源模型設計的 AI 代理工具,支援撰寫程式碼與文件處理。
該工具允許用戶彈性選擇:在本地端運行輕量模型,或切換至雲端調用大型前沿模型。針對雲端運算,LM Studio 承諾「零資料保留」(Zero Data Retention),不使用用戶數據進行模型訓練。此外,Bionic 整合了由 Mistral AI 開發的 Voxtral 語音轉錄功能,可完全在本地端離線執行。
問與答 (Q&A)
Q1:OpenAI 提出的「AI 時代記分卡」核心評估標準是什麼? A1: 其核心概念是**「每美元帶來的實用智力」**。OpenAI 認為,僅評估 Token 單價會忽略重試、人工審查與糾錯所累積的隱性成本。新標準建議企業應綜合評估「單次成功任務的實際總成本」及系統的任務完成可靠度。
Q2:企業資安長該如何應對代理型 AI 系統? A2: Anthropic 副資安長指出,將風險歸零是不切實際的,核心目標應是使風險**「透明且可控」**。審查系統時需關注四個問題:未信任內容的輸入管道、系統代理的操作權限、異常發生時的影響範圍(爆炸半徑),以及監控機制是否充足。權限管理應採循序漸進原則,避免預設配置最高權限。
Q3:Qwen 3.8 的規模與目前釋出狀況? A3: Qwen 3.8 擁有 2.4 兆(2.4T)參數,阿里已預告近期將開放模型權重(Open Weight)。目前開發者可透過阿里雲 Token Plan 平台搶先體驗 Qwen3.8-Max-Preview 版本。
Q4:Claude Fable 5 的訂閱方案有哪些調整? A4: 自 7 月 20 日起,Fable 5 正式開放給所有 Max 與 Team Premium 訂閱用戶,並設有 50% 的使用額度上限。Pro 及 Team Standard 用戶則可獲得 100 美元的一次性點數,透過扣點方式繼續使用。
Q5:重視資料隱私的用戶有哪些新工具選擇? A5: 可以選擇 LM Studio Bionic。它允許在本地端運作模型,或在需要時調用雲端前沿模型。其雲端服務承諾**「零資料保留」**,不使用用戶資料進行訓練,並內建本地離線語音轉錄功能(Voxtral)。
Q6:商湯科技 SenseNova U1 Pro 的技術特色? A6: 核心在於具備原生的長週期圖文交錯推理能力,能在多輪對話中精準維持圖片與文字細節,並支援高達 8K 的原生高解析度輸出。該模型 API 預計於 2026 年 8 月上線。
Q7:是否有專用於科學研究的開源多模態模型? A7: 可以關注新發表的 Intern-S2-Preview-397B。該模型具備 4,030 億參數,專為科學智慧與長邏輯鏈代理設計,能直接解析原始科學文獻中的圖文關係,在分子設計與材料生成等領域表現出色。



