AI 日報|Qwen3.8 與 GLM-5.3 強勢發布!SpaceX 正式收購 Cursor
模型發布/更新
Qwen3.8 系列模型 (Qwen3.8-27B & Qwen3.8-2.4T-A95B) — 通義千問 (Alibaba Qwen)
- 一言以蔽之:通義千問正式開源 Qwen3.8 系列模型,27B 稠密模型表現媲美閉源旗艦,2.4T 超大 MoE 模型原生支援 1M 長上下文。
- 核心亮點:
- Qwen3.8-27B 端側突破:僅 27B 引數的原生多模態稠密模型,在實用程式設計與辦公自動化場景中超越 Qwen3.7-Plus,且可在消費級電腦與 Mac 上本地順暢執行。
- Qwen3.8-2.4T-A95B 旗艦效能:總引數 2.4T、動態啟用 95B 引數,原生支援 262K 上下文並可透過 YaRN 擴充套件至 1M Token,專為複雜 AI Agent 與深度研究任務設計。
- 技術規格:27B 稠密 / 2.4T MoE (95B 啟用) / 開源 Apache 2.0 / 1M Context Window / 多模態支援
- 傳送門:Hugging Face 模型頁面
GLM-5.3 — 智譜 AI (Z.ai)
- 一言以蔽之:智譜 AI 發布新一代旗艦模型 GLM-5.3,透過強化學習後訓練(Post-training Scaling)大幅提升程式設計與 AI Agent 能力,並湧現出頂級網路安全防禦能力。
- 核心亮點:
- 後訓練極限 Scaling:與 GLM-5.2 共享相同預訓練底座,僅靠超大規模 RL 後訓練將 Terminal Bench 3.0 表現從 4.6 驟增至 28.3, DeepSWE v1.1 達 66.9。
- 網路安全審計能力湧現:在 CyberGym 白盒程式碼審計測試中取得 84.5% 高分,超越 GPT-5.6 Sol 與 Fable 5,在 269 個開源專案中協助修復 2,436 個真實漏洞。
- 技術規格:743B 基座微調 / 兩週後開放模型權重 / 支援 ZCode 與 AutoClaw 平臺
- 傳送門:Z.ai 官方部落格
Pika Audio Models 音訊模型家族 — Pika
- 一言以蔽之:Pika 發布包含 Soundtrack、Music、SFX 與 Speech 在內的 4 款音訊基礎模型,主打高品質與極高推論效率,生成成本降幅最高達 20 倍。
- 核心亮點:
- 全場景音訊覆蓋:一次推出影片配樂 (Soundtrack)、音樂生成 (Music)、音效 (SFX) 與語音 (Speech) 四大專用模型。
- 高價效比推論:推論效率大幅提升,Soundtrack 比同類模型節省 50% 成本,SFX 與 Speech 成本更低至競品的 1/20 與 1/9。
- 技術規格:生成式音訊基礎模型 / 支援 Video-to-Audio / 即日起於 Pika API 上線
- 傳送門:Pika 技術報告與部落格
DeepSeek-V4-Pro-0813 — DeepSeek
- 一言以蔽之:DeepSeek 正式推出 DeepSeek-V4-Pro-0813 模型,原生支援 1M 超長上下文,專為複雜推理、工具呼叫與長鏈條 AI Agent 工作流打造。
- 核心亮點:
- 多檔推理強度設定:提供 Low、High、Max 三種推理強度切換,開發者可依據任務複雜度靈活調節思考 Token 支出與響應速度。
- 頂尖 Agent 與工具呼叫:在 Terminal Bench 2.1 與 Cybergym 測試中表現超越 Opus 4.8,價格僅為競品的 1/6。
- 技術規格:閉源 API 模型 / 1M Context Window / 續採 MIT 開源授權協議
- 傳送門:
This time, it’s official. DeepSeek V4 Pro just landed. 🚀@deepseek_ai DeepSeek-V4-Pro-0813 is now live on SiliconFlow with Day-0 support — with more room to think, build, and ship.
— SiliconFlow (@SiliconFlowAI) August 14, 2026
🧠 1M context
⚙️ low / high / max reasoning
🛠️ More focus on coding, tool use & agent workflows… pic.twitter.com/Snla5OTaXw
產品發布/更新
HEIR 開源同態加密 AI 編譯器 — Google
- 更新內容:Google 發布開源編譯器 HEIR,能將預訓練 AI 模型轉譯為可直接處理「同態加密(Homomorphic Encryption)」輸入的演演演算法,實現密碼學等級的隱私 AI 推理。已支援信用卡詐欺檢測、網路異常識別與熱詞喚醒等四類場景。
- 適用人群:隱私安全工程師 / 金融與醫療 AI 開發者 / 密碼學研究員
- 體驗通道:Google 官方安全部落格
Claude 文字水印機制與檢測 API — Anthropic
- 更新內容:Anthropic 宣佈在 Claude 生成的文字中加入可追蹤的統計水印(基於 DeepMind SynthID-Text 變體),並提供第三方檢測 API。此舉旨在遵守歐盟《AI 法案》,水印不影響文字可讀性、創造力與 Token 成本,且無法追溯至特定個人或對話。
- 適用人群:內容審核平臺 / 教育機構 / 企業合規與法務團隊
- 體驗通道:Anthropic 官方公告
Claude Code Auto 模式與 v2.1.233 版 — Anthropic
- 更新內容:Claude Code 預設向 Pro、Max 與 Team 使用者推出 Auto 許可權模式,透過獨立分類器預先審查 Shell 命令,危險指令攔截率高達 89%(手動審查僅 14%);最新 v2.1.233 版同步新增對 GitLab 合併請求(MR)URL 的原生支援。
- 適用人群:軟體工程師 / DevOps 團隊 / GitHub 與 GitLab 專案維護者
- 體驗通道:GitHub Release 頁面
Cloudflare One MCP 流量安全檢測 — Cloudflare
- 更新內容:Cloudflare 在 Cloudflare One 中推出 MCP(Model Context Protocol)流量識別與防護功能。系統可自動監控內部 AI Agent 呼叫 MCP 伺服器的行為與許可權,防止 AI 在高許可權環境下因非確定性決策引發無限迴圈或資安風險。
- 適用人群:企業資安主管 (CISO) / 網路管理員 / 部署 AI Agent 的企業團隊
- 體驗通道:Cloudflare 官方部落格
產業動態
SpaceX 正式完成收購 AI 程式設計平臺 Cursor — SpaceX / Anysphere
- 事件概述:開發出現象級 AI 程式碼編輯器 Cursor 的 Anysphere 公司宣佈正式完成被 SpaceX 收購的流程。Cursor 團隊將加入 SpaceXAI,結合 SpaceX 的超大型 GPU 算力叢集,共同升級 Grok 模型與下一代開發者工具生態。
- 影響分析:象徵著 AI 程式設計編輯器賽道進入算力巨頭時代。結合頂級算力資源後,預計將加速 Grok 生態在自動化程式設計與知識工作領域的市佔率擴張。
- 新聞連結:Cursor 官方公告
傳 Anthropic 洽談以 60 億美元收購晶片最佳化新創 Decart AI — Anthropic / Decart AI
- 事件概述:據彭博社報導,Anthropic 正洽談以約 60 億美元收購 AI 晶片軟體新創 Decart AI。Decart 專注於提高訓練與推論的晶片執行效率,若交易達成,將成為 Anthropic 迄今規模最大的收購案。
- 影響分析:在算力緊張與推論成本高企的背景下,前沿 AI 巨頭正全力透過軟硬體協同最佳化(Co-design)壓縮每一單位 Token 的邊際成本,維持高價效比優勢。
- 新聞連結:
Bloomberg reports, Anthropic is in talks to buy Decart AI for about $6 billion, which would be its largest known acquisition.
— Rohan Paul (@rohanpaul_ai) August 14, 2026
Decart's software makes chips run training and inference work more efficiently, which is meant to help Anthropic's existing computing infrastructure… pic.twitter.com/Xaxxsco4TL
OpenAI 年化收入(ARR)突破 400 億美元 — OpenAI
- 事件概述:彭博社報導指出 OpenAI 的年化收入(ARR)已突破 400 億美元,較數月前翻倍增長。增長動能主要來自企業級程式設計軟體、ChatGPT 高階訂閱與廣告營收,單月環比增速超過 20%。
- 影響分析:儘管生成式 AI 市場陷入價格戰,前沿商業化巨頭的營收增長依然強勁,顯示出企業與個人使用者對生產力 AI 工具的真實付費意願正在加速落地。
- 新聞連結:
Bloomberg reports OpenAI's annualized revenue has topped $40B, roughly doubling its prior run rate.
— Rohan Paul (@rohanpaul_ai) August 14, 2026
the pace rose more than 20% month over month in July, with coding software, subscriptions and ads helping drive growth.
And then Anthropic says its own run-rate revenue crossed… pic.twitter.com/B6pj9TBa6u
Hugging Face 發布 2026 夏季開源模型生態報告 — Hugging Face
- 事件概述:Hugging Face 報告指出,雖然開源模型數量增至 296 萬個(Top 1.5% 倉庫佔據 99.2% 下載量),但在真實應用場景中小型端側模型(如 Qwen 與 Gemma)佔據絕對主導地位;同時,中國團隊在 700B+ 超大規模開源模型的發布頻率上領先全球。
- 影響分析:端側邊緣推理(Small Models)與超大引數雲端託管(MoE)正加速分化,開源社群將形成「小而精」與「大而強」的兩極化生態結構。
- 新聞連結:Hugging Face 官方部落格
論文研究
Faraday 27B:以自主探索復現論文的科研 AI Agent — AI Research Group
- 研究動機:探討如何讓 AI 具備長期自主假設驅動與科學研究能力,解決過往 AI Agent 難以處理複雜科研論文復現的問題。
- 核心創新:構建 Replica 論文復現強化學習環境,讓 27B 引數 Agent 學會「指導研究方向並呼叫程式碼工具」,並引入低雜訊的自動評判裁判提供獎勵訊號。
- 研究成果:Faraday 27B 在 68 個未見過的科研論文復現任務中取得 0.791 的高分,表現超越閉源巨頭模型 Claude Opus 4.8(0.748)與 GPT-5.5(0.729)。
- 論文地址:ArXiv 論文頁面
The Wiggle Framework:LLM 裁判的立場易受脅迫與翻轉 — Meta AI
- 研究動機:目前 AI 領域廣泛使用 LLM 裁判(LLM Judges)來評測模型輸出,但缺乏對裁判本身「立場穩定度與抗說服能力」的系統性評測。
- 核心創新:提出 Wiggle 評測框架,針對 9 款前沿 LLM 裁判在 14 項評測任務中,測試其在重覆提示、單次質疑以及對抗式持續說服下的表現。
- 研究成果:研究發現所有前沿 LLM 裁判均會「動搖(Wiggle)」,在靜態質疑下裁判結果有 25% 至 71% 會翻轉,而在對抗式說服下翻轉率高達 62% 至 91%,證明當前 LLM 裁判極易受外部壓力幹擾而偏離真實標準。
- 論文地址:ArXiv 論文頁面
其他分享
GPT-5.6-Sol 協助證明留存 22 年的數學猜想 — OpenAI / 數學界
- 內容簡介:北京一位神經外科住院醫師在學習超音波研究數學時,使用 ChatGPT Work 中的 GPT-5.6-Sol 模型進行自主推理。在未連網的狀態下執行 16 小時後,模型成功推匯出法國數學家 Michel Crouzeix 於 2004 年提出的克魯澤猜想(Crouzeix’s Conjecture)證明,經多位權威數學家驗證無誤。
- 傳送門:
A Beijing neurosurgeon resident just used GPT-5.6-Sol inside ChatGPT Work to prove a 22-year-old math conjecture.
— The Rundown AI (@TheRundownAI) August 14, 2026
Shanmu Jin was teaching himself the math for brain ultrasound research.
He locked the model off the web, started it, and left.
Sixteen hours later it had the… pic.twitter.com/E1stIRJLh4



