<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>部落格</title><link>https://www.communeify.com/tw/blog/</link><description>Communeify - Your Community Platform</description><generator>Hugo</generator><atom:link href="https://www.communeify.com/tw/blog/" rel="self" type="application/rss+xml"/><item><title>Nemotron 3 Diarization：支援最多 8 位說話者的開放權重模型</title><link>https://www.communeify.com/tw/blog/nemotron-3-diarization/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/nemotron-3-diarization/</guid><pubDate>Fri, 25 Sep 2026 17:30:00 +0800</pubDate><description>Nemotron 3 Diarization：支援最多 8 位說話者的開放權重模型 語音轉文字（ASR）可以把錄音變成文字，但多人會議還有另一個問題：每一句話是誰說的？Speaker diarization 會將音訊切成不同時間區段，並為每個區段標記匿名的說話者，例如 speaker_0、speaker_1。這些時間軸再與 ASR 的逐字時間戳結合，才能產生帶有說話者標籤的逐字稿。
NVIDIA 的 Nemotron 3 Diarization 就是用來處理這項工作的開放權重模型。它支援離線與串流推論，最多處理 8 位說話者，也能表示重疊語音。模型只會輸出匿名頻道與時間資訊，不會判斷 speaker_0 實際是哪一個人。
模型輸入與輸出 模型接受 16 kHz、單聲道的 .wav、.flac、.opus 或 .mp3 音訊。輸出可以是每個時間框的說話者活動機率，也可以後處理成開始時間、結束時間與說話者標籤。
它最多提供 8 個說話者頻道，頻道順序依照說話者首次出現的時間排列。這個設計讓串流處理時可以沿用前面區塊的頻道順序，但它仍不是身分辨識系統；若需要對應到真實姓名，還要由應用程式結合會議名單、使用者資料或其他驗證方式處理。
如何處理串流音訊 Nemotron 3 Diarization 採用 31 層 Transformer 編碼器，搭配 RoPE 位置編碼。輸入的 Mel 頻譜以 10 ms 為步長，再透過特徵堆疊形成 80 ms 的編碼器幀率，最後由 Conv1D 層將預測結果轉回 10 ms 的輸出解析度。模型大小約為 99.2M 參數。
在串流模式中，模型使用 Arrival-Order Speaker Cache（AOSC）保存較早出現的說話者資訊，並以 FIFO queue 提供近期音訊上下文。兩者分工不同：前者協助跨區塊維持說話者順序，後者提供目前區塊附近的聲音資訊。這有助於降低串流過程中的頻道切換，但實際效果仍會受到噪音、混響與錄音環境影響。
延遲設定 官方提供同一個 checkpoint 的多組推論設定。輸入緩衝延遲的計算方式是：
(CHUNK_LEN + RIGHT_CONTEXT) × 80 ms 模式輸入緩衝延遲FIFO區塊長度右側上下文 離線風格30.4 秒4034040低延遲1.04 秒26494極低延遲0.64 秒26462超低延遲0.32 秒26431 這裡的延遲只代表模型開始推論前需要累積的音訊，不包含模型運算、網路傳輸、ASR 或應用程式處理時間。模型技術上可以使用更短的輸入緩衝，但官方建議的最低設定是 0.32 秒；選擇設定時仍需要在自己的資料上測試準確率與端到端延遲。</description></item><item><title>Agnes-3.0-Flash Preview：33B 多模態開放權重模型</title><link>https://www.communeify.com/tw/blog/agnes-3-0-flash/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/agnes-3-0-flash/</guid><pubDate>Fri, 25 Sep 2026 17:07:22 +0800</pubDate><description>Agnes-3.0-Flash Preview：為高效能運算打造的多模態模型新選擇 追求高階 AI 推理與多模態能力時，開發者常面臨頂級模型硬體門檻極高或完全封閉的困境。Agnes AI 發布了 Agnes-3.0-Flash Preview 開放權重多模態預覽模型，採用 Apache-2.0 開源授權，旨在讓開發者能在自有硬體上運行具備旗艦級推理、程式編碼與長上下文處理能力的模型。
該開放權重模型擁有 33B（330 億）參數與原生 262,144 tokens（262K） 上下文視窗，同時支援文字、圖像與影片的多模態輸入理解。
混合注意力機制與架構特點 Agnes-3.0-Flash Preview 採用了高效的混合注意力解碼器（Hybrid-attention Decoder）：
72 層解碼器結構：由 54 層門控增量規則（Gated Delta Rule 遞迴層）與 18 層全域注意力（Global Attention）交替組成（比例為 3 : 1）。 降低 KV Cache 壓力：每 4 層中僅有 1 層需要維護會隨上下文長度增長的 KV Cache，其餘 3 層為狀態尺寸獨立於序列長度的遞迴層，能顯著降低長文本處理時的顯存需求。 視覺處理：內建 27 層 Vision Tower（隱藏層 1152、Patch 大小 16、2×2 空間合併），投影映射至 5120 主維度。 核心功能與推論控制 多模態理解：搭配內建的 AutoProcessor，可直接輸入圖像（Image）與影片（Video）進行理解與分析。 思考強度控制（Reasoning Effort）：Chat Template 支援可調式的思考強度，可傳遞 reasoning_effort=&amp;amp;quot;high&amp;amp;quot;（預設，適合複雜推理）、medium、low，或設定 enable_thinking=False 直接關閉思維鏈以降低延遲。 原生工具調用（Tool Calling）：原生支援 Function Calling，模型會輸出 &amp;amp;lt;tool_call&amp;amp;gt; 標籤格式，便於掛載外部 API 或資料庫操作。 官方 Benchmark 評測（Preview 開放權重版本） 官方模型卡公布了 Preview 開放權重 checkpoints 的評測結果：</description></item><item><title>K2-Horizon-7B：支援 512K 上下文的開源模型</title><link>https://www.communeify.com/tw/blog/k2-horizon-7b/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/k2-horizon-7b/</guid><pubDate>Fri, 25 Sep 2026 17:06:55 +0800</pubDate><description>探索 K2-Horizon-7B K2-Horizon-7B 是由基礎模型研究所（Institute of Foundation Models, IFM）開源發布的 7B 級別密集解碼器（Dense Decoder-only）語言模型。該模型採用 Apache-2.0 自由授權，原生支援 512K（524,288 tokens） 的超長上下文視窗，並在程式編寫、科學推理與 AI 代理（Agentic）任務中展現出強大的基準表現。
模型架構與技術重點 根據官方模型卡，K2-Horizon-7B 具備以下核心技術亮點：
512K 原生上下文：從 Midtraining（中預訓練）階段開始引進並漸進擴充上下文長度，最高支援 524,288 個 Tokens。 全階段 checkpoint 與開源：官方完整釋出 Pretrain、Midtrain、RL 專家（Math、Code、Search、Tool-use）以及 SFT 等各階段的中間檢查點（Intermediate Checkpoints），並完全開源訓練數據、訓練代碼與評測資源。 Diffusion Adapters 支援：提供可選的 Diffusion Adapters（如 IFM/K2-Horizon-7B-Uno）以進一步提升推論速度。 官方 Benchmark 評測成績（標示測試條件） 官方模型卡公布了多項基準測試結果（均在 reasoning_effort=&amp;amp;quot;high&amp;amp;quot; 設定下評測）：
數學與科學推理：HMMT Feb 2026 競爭數學測試得分 73.3%；HLE 專家級推理得分 18.6%。 程式開發與 Agent：SWE-bench Verified 軟體工程測試得分 70.6%；Terminal-Bench 2.1 終端 Agent 使用得分 39.1%；SciCode 科學程式碼得分 31.6%。 長上下文與工具調用：LCR 長上下文推理得分 68.0%；tau3-Banking Agent 工具調用得分 25.8%；BrowseComp 網頁瀏覽測試得分 59.0%（採用 Discard-all@95k 上下文協定）。 部署與推論設定 K2-Horizon-7B 支援主流開源推論框架，官方模型卡提供了以下驗證過的部署配置：</description></item><item><title>網易有道開源 Confucius4-R2T2：極低延遲、高精度的實時語音轉文字模型</title><link>https://www.communeify.com/tw/blog/confucius4-r2t2/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/confucius4-r2t2/</guid><pubDate>Fri, 25 Sep 2026 17:06:33 +0800</pubDate><description>Confucius4-R2T2：為即時語音轉文字設計的穩定輸出模型 即時語音轉文字不只追求辨識率，也要處理延遲、文字反覆修正與下游系統如何接收結果。網易有道推出的 Confucius4-R2T2（全稱 Real Real-Time Transcription）是一款基於 Qwen3-ASR（基座模型 Qwen3-ASR-1.7B，2B 參數）開發的高精度串流語音辨識（ASR）模型，重點放在串流轉錄的穩定性與極低延遲，適合評估即時字幕、會議紀錄、同聲傳譯與 AI 語音代理等工作流。
R2T2 的核心技術與穩定輸出 R2T2 的核心突破在於採用 Append-Only（僅追加） 的輸出模式：已確認發出的文字會永久追加至結果中，不會像傳統偽串流（Pseudo-streaming）模型那樣不斷反覆改寫歷史內容。這種設計可減少即時字幕的畫面閃爍與抖動，也讓下游 LLM 或 Agent 更容易消費穩定的串流文字事件。
在技術實現上，R2T2 結合了多項數據與架構創新：
訓練技術：採用穩定前綴資料（Stable-prefix Data）、強制時間對齊資料（Forced Time-alignment Data）與 Token 級別音訊分段。 最長穩定前綴（LSP）：透過 Longest Stable Prefix 學習範式，模型能動態判斷何時安全發送穩定文字前綴，何時需要等待更多音訊上下文，確保發出文字不回溯。 可調解碼 Chunk：支援 80 ms 至 2 s（如常見的 160 ms）的靈活解碼區塊設定，平均延遲維持在 200 ms 至 600 ms，且幾乎不損及離線辨識準確度。 語言支援與部署方式 在語言能力方面，Confucius4-R2T2 針對中文與英文進行了深度優化，同時具備對法語、德語、義大利語、日語、韓語、葡萄牙語、俄語、西班牙語、阿拉伯語等多語言的跨語言串流辨識能力，並原生支援上下文與熱詞提示（Context &amp;amp;amp; Hotword Prompts）。
在服務化與部署選項上，官方提供了多種彈性管道：
推論後端：支援高吞吐量的 vLLM 後端，亦可使用 Hugging Face transformers 後端。 容器化部署：官方提供預建的 Docker 映像檔（qwenllm/qwen3-asr），可快速拉起 CUDA 與運行環境。 WebSocket 服務：專案內建可直接運行的 WebSocket 伺服器（ws_server.py，預設通訊埠 8272），並支援整合 Stream-VAD（FireRedVAD）模型，方便建立多用戶即時語音串流服務。 授權條款：採用雙重授權機制，原始碼採用 Apache License 2.0 開源授權，模型權重則採用 NetEase Model Use License Agreement。 適合的應用與實測建議 Confucius4-R2T2 適合即時字幕直播、會議逐字稿系統、同傳翻譯以及需要穩定事件流的 AI Agent 語音前置模組。導入前建議使用團隊內部的中文、英文、混合語音、專有名詞與多人對話資料進行測試，並分開記錄不同 Chunk 設定下的延遲、WER/CER 表現以及熱詞增強效果。</description></item><item><title>Jina OCR v1：將文件解析成結構化 Markdown</title><link>https://www.communeify.com/tw/blog/jina-ocr-v1/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/jina-ocr-v1/</guid><pubDate>Fri, 25 Sep 2026 17:06:10 +0800</pubDate><description>Jina OCR v1：把文件轉成可用的 Markdown 將 PDF、掃描檔或複雜版面交給 OCR，真正困難的往往不只是辨識文字，還包括表格、公式、段落與閱讀順序。Jina AI 開源的 Jina OCR v1 是一款端到端（Page-to-Markdown）的文件解析模型，旨在兼顧高品質輸出與高效推論，直接將文件頁面轉化為結構化的 Markdown。
模型架構與技術重點 Jina OCR v1 採用輕量化與混合專家（MoE）架構設計：
模型規模：總參數量為 3.4B，但前向傳播每個 Token 僅需激活約 570M 活躍參數，兼具小模型的推論成本與大模型的容量。 視覺與解碼器架構：繼承 DeepSeek-OCR 架構，包含約 380M 參數的 DeepEncoder（將 1024×1024 圖像壓縮為 256 個視覺 Tokens），以及 12 層的 DeepSeek-3B-MoE 解碼器（64 個 Routed Experts 與 2 個 Shared Experts，Top-6 路由）。 FastMTP 投機解碼（Speculative Decoding）：透過遞迴共享單一密集草稿模組（K=3），並結合貪婪驗證（Greedy Verification），實現無損（Lossless）的解碼加速，產出與傳統自回歸完全一致的文字。 多語言與頁面處理：預訓練語料覆蓋約 100 種語言（支援多達 108 種語言）；預設會過濾重複的頁首與頁尾（Headers/Footers），並自動將公式轉為 LaTeX（$ / $$）、表格轉為 HTML &amp;amp;lt;table&amp;amp;gt; 格式。 評測表現與速度（標示測試條件） 在官方報告的實測基準中，Jina OCR v1 展現出極高的推論吞吐量：
OmniDocBench v1.6 評測：整體得分 91.14（公式 CDM 達 93.28、表格 TEDS 達 84.68）。 olmOCR-Bench 評測：整體得分 83.4（Base 基礎文本達 99.9、表格 88.8、多欄排版 85.5；但在嚴重損毀的舊掃描檔 OldScans 僅 42.6，建議難度極高的歷史檔案仍需人工覆核）。 吞吐量與速度測試：在單張 NVIDIA A100 (SXM4 40GB, 併發 32) 條件下，達到 2.57 pages/s 的吞吐量（平均每頁產生 1,085 Token）；在單張 NVIDIA L4 (Batch Size 1) 環境下，開啟 FastMTP (K=3) 可將解碼速度從 42.7 提升至 83.1 tokens/s（約 1.95 倍加速）。 如何開始與部署選項 使用者可根據需求選擇雲端服務或地端部署：</description></item><item><title>Brood War Bench：LLM Agent 在《星海爭霸》的測試結果</title><link>https://www.communeify.com/tw/blog/bw-report/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/bw-report/</guid><pubDate>Fri, 25 Sep 2026 17:05:34 +0800</pubDate><description>AI 玩《星海爭霸》：Brood War Bench 評測了什麼？ Brood War Bench 是由 Ben Swerdlow 開發的開源 AI 評測基準與工具（採用 Freestyle 虛擬機環境運作），旨在測試大型語言模型（LLM Agent）在經典即時戰略遊戲《星海爭霸：怒火燎原》（StarCraft: Brood War）中的實時決策與對戰能力。這項基準測量的不是一般的文字問答能力，而是模型能否在持續變動的戰場時間軸中，同時處理資源採集、建築生產、地圖偵察與多單位作戰。
評測結果與排行榜 在包含 19 個模型／推理設定組合的循環賽（Round-Robin Matrix）測試中，官方公布的勝率排行榜如下：
冠軍：Codex Astra / xhigh — 取得 100.0% 勝率（18 勝 0 敗），平均每場 APM 為 12.6，單場平均成本約 $10.54 美元。 亞軍：Codex Astra / medium — 取得 88.9% 勝率（16 勝 2 敗），APM 17.2。 季軍：Claude Fable — 取得 83.3% 勝率（15 勝 3 敗），APM 12.6。 其他模型表現：Claude Opus 5 勝率為 66.7%（12 勝 6 敗）；Grok 4.6 在不同強度下勝率偏低（xhigh 為 11.1%、medium 為 5.6%、low 為 0.0%）；Claude Haiku 則為 0% 勝率。 關鍵測試發現與能力邊界 官方報告指出，在這組測試中，沒有任何 AI Agent 的表現超過遊戲「初學者（Beginner level）」水準。報告也表示，初學者採用簡單的「光子砲快攻（Photon Rush）」即可擊敗這些測試中的模型。</description></item><item><title>歸藏 Product Video Skill：以程式碼製作軟體更新宣傳片</title><link>https://www.communeify.com/tw/blog/guizang-product-video-skill/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/guizang-product-video-skill/</guid><pubDate>Fri, 25 Sep 2026 17:05:06 +0800</pubDate><description>軟體更新宣傳片也能自動化？歸藏 (Guizang) Product Video Skill 完全解析 開發軟體時，完成新功能後往往缺乏時間製作展示影片。歸藏 (Guizang) Product Video Skill 是一套可供支援 skill 的 AI 程式開發工具使用的工作流程，README 以 Claude Code 與 Codex 為例，協助整理產品程式碼庫與更新內容，製作包含分鏡文案、原產品組件、原創配樂與動作音效的宣傳影片。
什麼是歸藏 Product Video Skill？ 歸藏 Product Video Skill 的核心理念是「復用真實產品組件與設計語言」。與一般的 AI 影片生成器不同，該工具不會生成模糊的虛構畫面，而是優先直接接入產品自身的 React 組件、樣式與演示狀態，用程式碼驅動時間軸與動態效果。
完成後，使用者可獲得可直接發布的 MP4 影片，以及包含文字、佈局、時間軸與聲音原始碼的可編輯影片工程，方便隨時進行調整與重新導出。
三種視覺風格模式 製作時可選擇三種呈現風格，滿足不同的宣傳需求：
沿用產品風格 (repo)：推薦模式，直接復用產品自身的完整設計，讓宣傳片與軟體風格完全一致。 預設樣式 (default)：採用內建 CodePilot 暖白與炭黑卡片層次排版，適合尚未建立成熟視覺風格的專案。 混合模式 (hybrid)：保留軟體內部的真實界面，並將外層文案、取景與節奏包裝得更適合社群傳播。 聲音與配樂製作 影片的音訊部分同樣由程式碼控制：
原創配樂：工程內保留合成與編曲原始碼，可依影片時長、鏡頭邊界與產品氣質調整段落和音色；README 的預設起點是 45–60 秒。 動作音效：包含點擊、彈出、切換與完成提醒等獨立事件，並自帶 11 個程式碼合成的 WAV 音效，且支援關鍵音效出現時音樂自動避讓（Sidechaining）機制。 安裝與環境需求 使用者可透過 skills CLI 命令一鍵安裝至 AI 工具中：
npx skills add https://github.com/op7418/guizang-product-video-skill --skill guizang-product-video-skill 手動安裝則可 clone 至 ~/.claude/skills（Claude Code）或 ~/.agents/skills（Codex）目錄。</description></item><item><title>Qwen-Image-2.1：7B 影像生成與編輯模型</title><link>https://www.communeify.com/tw/blog/qwen-image-2-1/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/qwen-image-2-1/</guid><pubDate>Fri, 25 Sep 2026 17:04:45 +0800</pubDate><description>Qwen-Image-2.1：輕量化視覺模型 對於開發者與創作者而言，要在影像品質與運算效率之間取得平衡並不容易。Qwen 團隊推出的 Qwen-Image-2.1 是一個統一的開源影像模型，將文字生成影像（Text-to-Image）與影像編輯（Image Editing）整合在同一架構中。其視覺生成元件為 70 億參數（7B），並支援透明背景與多參考圖編輯。
輕量化架構設計 Qwen-Image-2.1 採用 32 層單流 DiT（Single-Stream Diffusion Transformer）結構，並結合 Qwen3-VL 8B 作為文字與條件圖像編碼器，搭配 64 通道的 RGBA VAE（空間壓縮比 16x）。
該模型採用混合粒度注意力機制（Mixed-granularity Attention），實現高效的 Prefix KV Cache 重複使用。在執行影像編輯時，輸入圖像與指令經計算後會作為靜態背景快取，大幅降低後續去噪步驟的記憶體需求與計算延遲。開發者亦可啟用 enable_model_cpu_offload() 進行記憶體優化。
原生透明底圖與影像編輯 過去製作透明背景影像通常需要額外的後製去背。Qwen-Image-2.1 原生整合了 RGBA 透明度支援，使用者只需在提示詞中指定格式，模型即可直接輸出帶有 Alpha 通道的透明背景影像。
這項功能不僅限於全新生成，也支援透明圖層的即時編輯與主體提取。例如，你可以調整透明圖層中角色的表情而不影響背景透明度，或是從真實照片中提取特定主體轉換為透明圖層素材，顯著簡化設計工作流程。
多樣化的編輯工具與原生 2K 解析度 Qwen-Image-2.1 提供多種編輯手段以滿足精確控制需求：
多參考影像： 最多可同時支援 10 張參考圖，適合多角色合照、虛擬試穿與室內設計合成。 局部編輯： 支援圓形標註、手繪標註及獨立遮罩（Mask），確保區域修改時不影響其餘細節。 高保真度： 針對人臉肖像特徵與產品材質細節進行優化，在多輪編輯中維持高度辨識度。 原生 2K 解析度： 預設支援 2048 × 2048（1:1）原生 2K 解析度，並提供 16:9（2752 × 1536）、9:16、4:3 等多種長寬比。 體驗模型功能可前往官方展示頁面。
應用場景與提示詞改寫 除了基礎生成與修圖，Qwen-Image-2.1 在全景圖（Panorama）、資訊圖表（Infographics）與分鏡故事板（Storyboards）的製作上也具備應用彈性。
為了達到最佳生成效果，官方提供了專門的提示詞改寫模型（PE-T2I 與 PE-I2I，基於 Qwen3.5-VL 9B 微調），能將簡短描述自動擴充為詳細的英文指令與合適的長寬比。</description></item><item><title>Ming-Image-0.1-Design：專為 UI 與視覺設計打造的 6B 文生圖模型</title><link>https://www.communeify.com/tw/blog/ming-image-0-1-design/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ming-image-0-1-design/</guid><pubDate>Fri, 25 Sep 2026 17:04:22 +0800</pubDate><description>專為設計師打造：Ming-Image-0.1-Design 模型解析 平面設計中，文字與圖像的結合常耗費大量心力。過去，生成一張包含精準文字的海報或 UI 草圖並不容易。Ming-Image-0.1-Design 是由 InclusionAI 開發的 6B 參數文字轉圖像（Text-to-Image）模型，專門解決 UI 介面、資訊圖表、海報等文字豐富型視覺設計的構圖與排版需求，並原生支援輸出帶有透明背景的 RGBA 影像。
為什麼設計師需要關注這個模型？ 許多傳統圖像生成模型在處理海報、UI 介面或資訊圖表時，常出現拼字錯誤、文字模糊或排版混亂。Ming-Image-0.1-Design 針對視覺構成與文字渲染進行了優化，能生成結構完整的視覺設計作品。
此外，該模型能直接輸出 RGBA 格式的透明背景圖像，大幅減少設計師後製去背的繁瑣流程。你可以前往官方展示頁面體驗其設計元素的處理邏輯。
如何快速上手與建議參數 你可以從 GitHub 上的 Ming-Image 專案獲取程式庫。環境建置後，透過 infer.py 即可執行文字轉圖像任務。
官方推薦的設定如下：
解析度：建議設定為 2048 x 2048 以獲得最佳視覺效果與細節；若需縮短運算時間，亦可選擇 1024 x 1024。 採樣步驟 (Sampling steps)：12 CFG Scale：1.0 精度類型 (Precision)：BF16 硬體需求：單張配置 80 GiB VRAM 的 CUDA GPU（官方驗證組態） 提示詞增強（Prompt Enhancement）可先搭配 Ling-3.0-flash-VL 或 Qwen3.8-27B 等視覺語言模型，把簡短描述整理成較完整的提示詞，再交給模型生成。
透明背景生成技巧 若需生成透明背景的 RGBA 影像，必須在提示詞（Prompt）開頭加入指定的 RGBA 短語前綴。具體格式請參考官方 透明背景生成指南。
部署與推論優化 針對大規模部署與推論服務化，官方推薦使用 vLLM-Omni 框架。詳細的 Recipes 與部署步驟可參閱 vLLM-Omni 入門指南。</description></item><item><title>GLM-5.3-Flash：320B 總參數、18B 活躍的原生多模態開放模型</title><link>https://www.communeify.com/tw/blog/glm-5-3-flash-open-weight-multimodal/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/glm-5-3-flash-open-weight-multimodal/</guid><pubDate>Fri, 25 Sep 2026 08:25:00 +0800</pubDate><description> GLM-5.3-Flash 的核心突破在於，透過混合注意力機制與稀疏 MoE 架構，在維持極高推理效率與低算力成本的同時，實現了強大的原生多模態與長上下文能力。
模型架構與設計特點 GLM-5.3-Flash 是 zai-org（Z.ai）推出的 GLM-5 系列首款原生多模態模型（Natively Multimodal Model）。其模型規模與運算架構設計如下：
參數規模：模型擁有 320B（3,200 億）總參數，前向傳播時僅激活 18B（180 億）活躍參數，採用稀疏混合專家（Sparse MoE）機制，大幅降低單次 Token 的算力開銷。 混合注意力機制（Hybrid Sparse and Linear Attention）：首度導入線性注意力（Linear Attention）與稀疏注意力（Sparse Attention）相結合的架構，前者負責區域狀態建模，後者透過輕量化索引器進行全域檢索，並搭配 IndexPool 技術壓縮向量，有效降低長上下文下的注意力計算量與 KV Cache 記憶體佔用。 超連接與預訓練：採用流形約束超連接（Manifold-Constrained Hyper-Connections, mHC）以提升模型擴展效率，並基於 30T 多模態語料進行預訓練。 輸入模態與語言：原生支援文字與圖片（Text &amp;amp;amp; Image）輸入，語言覆蓋中文（Chinese）與英文（English）。 長上下文規格：支援最高 1,000,000 tokens（1M context） 的上下文處理。 需要注意的是，18B 活躍參數（Active Parameters）僅代表單次運算時的 FLOPs 負擔，並不等於部署時所需的記憶體。在實際硬體部署時，320B 的完整權重、KV Cache 以及執行框架仍需準備充足的系統記憶體與顯存空間。
官方支援框架與推理參數設置 根據官方模型卡資料，GLM-5.3-Flash 已獲得多個 mainstream 推理框架支援，開發者可參考本機服務說明進行部署測試：
支援框架：包含 SGLang、vLLM、TokenSpeed、Transformers、KTransformers 與 Unsloth。 思考預算控制 (reasoning_effort)：模型支援透過 reasoning_effort 參數控制思考深度，可填入 low、high 或 max（未傳送時預設為 max）。若需複現官方基準測試或 Leaderboard 數據，建議維持預設的 max。 對話範本設定 (clear_thinking)：在模型的 Chat Template 中，clear_thinking 預設為 false；若應用於互動對話情境，建議顯式傳遞 clear_thinking=true。 評測實務與多模態安全邊界 官方公布的 Benchmark 數據呈現了模型在特定測試集上的基準表現，但在實際業務落地上，建議團隊仍需以自身的真實工作流進行驗證，重點測試：</description></item><item><title>Sopro V2：120M 也能做到串流與零樣本聲音複製的開源 TTS</title><link>https://www.communeify.com/tw/blog/sopro-v2-120m-voice-cloning-tts/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/sopro-v2-120m-voice-cloning-tts/</guid><pubDate>Fri, 25 Sep 2026 08:20:00 +0800</pubDate><description> 在輕量級語音合成領域，兼顧低延遲、極小模型體積與高品質聲音複製一直是個巨大挑戰。Sopro V2 Turbo 證明了僅靠 120M 參數，也能在地端 CPU 上實現高可讀性與流暢串流。
什麼是 Sopro V2 Turbo？模型規模與語言支援 Sopro V2 是由 Samuel Vitorino 與 Halo Research 開發的輕量化開源語音合成模型家族。其公開釋出的旗艦輕量模型 sopro-v2-turbo 具備以下核心特性：
模型規模：僅 120M 參數（1.2 億參數），由 0.5B 教師模型經過 DPO（直接偏好優化）與 Self-Distillation 自蒸餾，並結合 2-step Reflow 技術進行 16 倍加速優化。 授權條款：採用 Apache-2.0 自由開源授權。 多語言支援：原生支援 英語（English）、歐洲葡萄牙語（European Portuguese）、法語（French）與德語（German） 共 4 種語言。特別是它是少數原生針對歐洲葡萄牙語（而非巴西葡萄牙語）進行深度調校與對齊的開源語音模型。 零樣本聲音複製（Zero-Shot Voice Cloning）：僅需 5 至 20 秒的參考音訊，且無需提供參考音訊的文字逐字稿（ASR-free prompt），即可捕捉目標聲音的音色、麥克風環境與說話風格。 速度與本機 CPU / 裝置端適用性 Sopro V2 Turbo 的設計初衷在於讓任何人都能在地端設備上順暢執行語音生成，擺脫對雲端 API 的依賴與高昂延遲。
推論效能數據（RTF 與首音延遲） 在官方特定測試環境下，推論表現如下：
Apple M3 CPU (MacBook 筆電)： 非串流模式（Offline）：實時率（RTF）為 0.24（生成速度約為即時播放的 4.1 倍）。 串流模式（Streaming）：RTF 為 0.21，首音時間（Time-to-first-audio, TTFA）僅約 300 毫秒。 NVIDIA H100 GPU： 非串流 RTF 為 0.07，串流模式首音時間約 200 毫秒。 本機與瀏覽器端部署 由於參數規模僅 120M，Sopro V2 Turbo 適合直接於筆電或邊緣設備的 CPU 上運行。此外，官方亦提供了基於 ONNX Runtime（WebGPU / WASM）的純瀏覽器前端實現，使用者無需設定後端伺服器，即可在網頁端直接進行地端語音推理。</description></item><item><title>Ling-3.0-flash-Fin：為財務研究與試算表工作打造的 124B MoE 模型</title><link>https://www.communeify.com/tw/blog/ling-3-0-flash-fin-finance-moe/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ling-3-0-flash-fin-finance-moe/</guid><pubDate>Fri, 25 Sep 2026 08:15:00 +0800</pubDate><description> 財務模型最怕的不是回答慢，而是把沒有來源的數字寫進報告。Ling-3.0-flash-Fin 的定位，是把長文處理與工具調用能力往金融研究與試算表工作推近。
這是一個金融增強版 MoE 模型 Ling 3.0 Flash Fin（亦稱 Ling-3.0-flash-Fin）是 InclusionAI（螞蟻集團 AGI 團隊）發布的金融領域專用模型，於 2026 年 8 月底推出。該模型以 Ling 3.0 Flash 為基礎進行金融領域強化，專為真實世界投資工作流、金融資訊檢索、研究整理、估值建模、報告準備以及長篇研究資料與複雜工作簿分析所設計。
在架構規格上，模型總參數約為 124B（Hugging Face 標籤頁記為 127B），單次前向傳播每個 token 僅激活 5.1B 活躍參數，屬於高效率的稀疏混合專家（Sparse MoE）架構。它在保有邏輯推理、程式碼與數學通用能力的同時，強化了多步驟長天期規劃與 Agent 執行能力。
規模、長上下文與 API 入口 5.1B 活躍參數代表每一次運算算力負擔極低，但 124B 的總權重規模代表部署時仍需考量完整的記憶體與顯存配置（Hugging Face 亦提供 FP8 與 INT4 量化版本）。
在推理能力與服務介面方面：
超長上下文視窗：支援原生 262,144 tokens（262K）上下文長度，單次最大輸出長度可達 32,768 completion tokens。 工具調用（Tool Calling）：原生支援符合 OpenAI 格式的 tools 與 tool_choice 函數呼叫功能。 部署與 API：目前在 OpenRouter 模型頁提供免費推理端點（由 NovitaAI 代管，Slug 為 inclusionai/ling-3.0-flash-fin:free）。模型權重、數據集（如 FinFIRST、FinixDocBench）與程式碼可透過 InclusionAI 的 Hugging Face 組織頁與 Ling GitHub 官方倉庫追蹤。 免費端點適合用於雛形開發與測試，但速率受限且不保證固定 SLA；生產環境亦有付費端點可供選擇。</description></item><item><title>Qwen3.8-Flash-Next 與 Engram：不是讓 1T 模型突然塞進單張顯卡</title><link>https://www.communeify.com/tw/blog/qwen3-8-flash-next-engram-ngram-model/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/qwen3-8-flash-next-engram-ngram-model/</guid><pubDate>Fri, 25 Sep 2026 08:10:00 +0800</pubDate><description> Qwen3.8-Flash-Next 引起討論的原因，不是它把一個 1T 參數模型神奇地壓進家用顯卡，而是它把「模型應該學會反覆出現的多 token 模式」這件事，從一般神經網路計算裡拆出來，交給 Engram 查表處理。
Engram 到底是什麼？先把它想成更長的 n-gram 記憶 傳統語言模型會使用 Token Embedding 把單一 token 映射成向量，再透過 Attention 和 FFN 層逐步推導語意與上下文。Engram 的想法更加直接：以最近的兩到三個 token（Bigram 或 Trigram）組成 Key，直接查詢一張龐大的 n-gram embedding table，提取模型在訓練時所記憶的靜態多 token 模式。
這種查表的特點是查詢時間複雜度接近 O(1)，完全不消耗 GPU 浮點運算（FLOPs）。它極度適合用來存儲拼字、固定短語、專有名詞與格式化樣板（例如「New York」或「import std」）；至於該模式在當前語境下是否重要，則由主模型的門控與上下文機制負責篩選。因此，Engram 並非具備自主推理能力的外部資料庫，也無法直接將記憶體容量轉換為更高的邏輯思維深度。
Qwen3.8-Flash-Next 怎麼使用這個設計？ Qwen 官方技術報告將 Qwen3.8-Flash-Next 定位為 Qwen4 架構的早期預覽模型。其主體為 125B 參數的稀疏 MoE 模型，單次前向傳播僅激活 6B 活躍參數（512 個專家中的 10 個 Routed 專家與 1 個 Shared 專家）；此外更配置了 51B 參數（約 20,000,000 個條目，位於第 2 層）的 n-gram embedding table 與 4B 的多 token 預測（MTP）模組。</description></item><item><title>Horus Cyber Nano 1.0：面向資安分析的 16B 多模態 MoE 模型</title><link>https://www.communeify.com/tw/blog/horus-cyber-nano-1-0-multimodal-security-model/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/horus-cyber-nano-1-0-multimodal-security-model/</guid><pubDate>Fri, 25 Sep 2026 08:05:00 +0800</pubDate><description> Horus Cyber Nano 1.0 的「Nano」指的是相對小的資安專用模型，不是低到可以忽略硬體需求的桌面小模型。它有 16B 總參數、文字與視覺輸入，主要要處理的是授權範圍內的安全分析工作。
它不是一般聊天模型換一個名字 Horus Cyber Nano 1.0 由 TokenAI 研發（由 Assem Sabry 創立），定位為 TokenAI 首款採用混合專家架構（Mixture of Experts, MoE）的原生多模態資安推理模型，發表於 2026 年 9 月。其目標應用場景聚焦於四大防禦性技術工作流：安全程式碼審查（Secure Code Review）、紅隊任務推理（Red Team Task Reasoning）、終端機與工具工作流（Terminal and Tool Workflows）以及資安視覺理解（Cybersecurity Vision Understanding）。
模型的輸入支援文字、圖片與影片，輸出則為文字分析結果。這樣的定位很重要：資安工作不只是一段程式碼找漏洞，還可能需要同時看錯誤訊息、網路拓撲、螢幕截圖、錄製的操作過程，以及一串工具執行結果。多模態輸入可以縮短「先把畫面描述成文字，再交給模型」的中間步驟，但它仍然不能替代實際掃描器、沙箱或人工確認。
16B 總參數與 MoE 架構技術規格 Horus Cyber Nano 1.0 採用原生多模態視覺語言架構搭配因果語言解碼器，整體層數與 MoE 結構設計如下：
語言解碼器層數與維度：採用 27 層 Transformer，隱藏維度為 2048，配置 16 個 Attention Heads、16 個 KV Heads，激活函數為 SiLU，RoPE Theta 為 800,000。 MoE 專家配置：每一層均為 MoE 層，包含 64 個 Routed Experts 與 2 個 Shared Experts。每個 Token 運算時會選擇 6 個 Routed Experts 參與計算。這代表 16B 總容量與單次推理的活躍計算量（Active Parameters）是兩件事，不能只看「16B」估算顯存或運算速度。 視覺編碼器規格：包含 27 層 Vision Encoder、隱藏維度 1152、16 個 Vision Attention Heads、Patch Size 為 14。每張圖片最高支援約 320 萬像素（3.2M pixels）總解析度，並支援影片輸入。 高解析度圖片與影片會增加上下文與記憶體負擔，實際部署時應依工作流進行切片，而不是把整段長影片一次塞進模型。</description></item><item><title>TontaubeV1：把長篇語音生成搬回本機的 2.9B 開放權重 TTS 模型</title><link>https://www.communeify.com/tw/blog/tontaube-v1-open-tts-long-form-local-inference/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/tontaube-v1-open-tts-long-form-local-inference/</guid><pubDate>Fri, 25 Sep 2026 08:00:00 +0800</pubDate><description> 如果你想把一段文章直接念成十幾分鐘的旁白，TontaubeV1 的重點不是「聲音像不像真人」這一句宣傳，而是它試圖把長篇、串流與本機推理同時處理好。
先看結論：它解決的是長篇語音的工程問題 TontaubeV1 是 Tontaube AI（由 Fritz Cremer 與 Jonathan Cremer 開發）發布的 2.9B（約 28.7 億參數）開放權重文字轉語音模型，定位在富有表達力的長篇語音、低延遲回傳與本機部署。模型主要針對英語和德語進行調校，並支援西班牙語、法語、義大利語、荷蘭語與葡萄牙語等共 7 種語言，同時能使用 5 至 60 秒（上限約 1 分鐘）的參考音檔進行零樣本聲音複製（Zero-Shot Voice Cloning）。
這個定位和只產生一句廣告口號的 TTS 不太一樣。長篇內容會遇到更多實際問題：段落之間的語氣是否連得起來、生成時能不能一邊播放一邊繼續合成、文字很長時上下文會不會失控，以及一次處理多個請求時 GPU 是否浪費在等待上。TontaubeV1 的設計幾乎都圍繞這些問題展開。
在授權方面需特別注意：推理服務程式碼採用 Apache License 2.0 開源授權，但模型權重本身採用的是 Tontaube Community Model License 1.0，屬於允許研究與符合條件之商業用途的開放權重（Open-weight）授權，而非純粹的 OSI 開源授權。
架構重點：四個自回歸模型接力產生聲音 官方技術報告把 TontaubeV1 描述成由四個自回歸模型（CB0 至 CB3）組成的分層語音生成系統。它採用 DualCodec（12.5 Hz，總位元率約 625 bit/s）作為語音表徵，將語音拆解為 1 個語意碼本與 3 個聲學精鍊碼本：
CB0（語意與時長預測）：基於 Qwen3-1.7B 骨幹（約 18.3 億參數，28 個 Transformer 區塊），負責從文字生成語意音訊碼本並決定語音時長與韻律。 CB1（聲學精鍊一）：基於 Qwen3-0.6B 骨幹（約 4.49 億參數，16 個 Transformer 區塊），補上第一層聲學細節。 CB2（聲學精鍊二）：基於 Qwen3-0.6B 骨幹（約 3.27 億參數，8 個 Transformer 區塊），進一步擴充聲學殘差。 CB3（聲學精鍊三）：基於 Qwen3-0.6B 骨幹（約 2.69 億參數，4 個 Transformer 區塊），完成最後一層聲學修飾。 四個模型總計 56 個 Transformer 區塊、約 28.7 億參數。這種設計有兩個直接好處：</description></item><item><title>AI 日報｜Claude Opus 5.5 威力全開、Google 宣佈將 TPU 送入太空測試、OpenAI 代理商安全爭議延燒</title><link>https://www.communeify.com/tw/blog/ai-daily-latest/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-latest/</guid><pubDate>Fri, 25 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報 | 2026-09-25 💡 此文章是自動產生，於每天早上九點自動更新。
模型發布/更新 Coherent Long-Form Video Generation (AI Video Co-director) — Google Research 一言以蔽之：Google Research 推出全新的「AI video co-director」分層多 AI Agent 框架，透過多臂老虎機（MAB）演演演算法在創意策略、敘事模式與美學原型三個維度進行全域性最佳化，實現高品質的自動化長影片生成。 核心亮點： 全域性創意策略最佳化：將複雜的長影片敘事拆解並進行動態搜尋，確保長時間跨度下的內容連貫性與劇情張力。 多 AI Agent 協作架構：透過多臂老虎機機制在多維度空間中自動搜尋最優創意配置，大幅降低人工導演與剪輯的繁瑣流程。 技術規格：分層多 AI Agent 框架 / 支援長影片全域性敘事最佳化 / 多臂老虎機（MAB）搜尋 傳送門：Google Research 官方部落格 Gemini 3.8 Live with Live Avatar — Google DeepMind 一言以蔽之：Google DeepMind 正式全面推出 Gemini 3.8 Live 與 Live Avatar 數位人功能，支援近乎即時的視覺互動、口型同步以及 97 種語言無縫切換。 核心亮點： 即時互動視覺數位人：為對話式 AI 帶來逼真的視覺存在感，支援流暢的口型同步與豐富表情。 企業級安全與防護：內建 SynthID 數位浮水印與嚴格身份保護機制，全面登陸 Gemini Enterprise。 技術規格：原生語音對話與視覺數位人 / 支援 97 種語言 / 內建 SynthID 水印 傳送門：Google 官方部落格 產品發布/更新 LangSmith Engine v2 與 Managed Deep Agents 0.8 — LangChain 更新內容：LangChain 在紐約 Interrupt 大會上正式發布 LangSmith Engine v2 與 Managed Deep Agents 0.8。新版本帶來強大的 Red Teaming 紅隊測試引擎、自動化驗證修復機制，並支援使用者專屬憑證與記憶管理，讓 AI Agent 在企業級生產環境中更安全、更具可控性。 適用人群：[AI Agent 開發者 / 企業 IT 架構師 / 系統安全工程師] 體驗通道： View post on X by @LangChain 在 X 上查看 @LangChain 的貼文 ↗</description></item><item><title>AI 日報｜小米發布 MiMo-V2.6 全模態模型、OpenAI AI Agent 越權存取澳洲醫療系統引發關注</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-24/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-24/</guid><pubDate>Thu, 24 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜小米發布 MiMo-V2.6 全模態模型、OpenAI AI Agent 越權存取澳洲醫療系統引發關注 模型發布/更新 MiMo-V2.6 Pro &amp;amp;amp; Flash — 小米 一言以蔽之：小米正式發布 MiMo-V2.6 系列旗艦開源全模態模型，透過規模化強化學習訓練，其中 Pro 版本在 Artificial Analysis 智慧指數拿下開源最高分，並在多項 AI Agent 基準測試中對標國際頂尖模型。 核心亮點： 頂尖智慧表現與開源架構：Pro 版本在 Artificial Analysis 智慧指數拿下 46 分的高分，寫下開源模型新紀錄，且在多數 Agent 基準表現可媲美 Claude Opus 5 與 GPT-5.6 Sol。 全模態與端雲協同最佳化：結合高效率的 Flash 版本，全面滿足從雲端大模型呼叫到端側高效能部署的需求。 技術規格：開源全模態模型 / 支援強化的 Agent 任務執行 / 支援端雲協同架構 傳送門： View post on X by @AravSrinivas 在 X 上查看 @AravSrinivas 的貼文 ↗ Ember-1 — Fireworks Research 一言以蔽之：Fireworks Research 基於 Kimi K3 架構推出專用推理模型 Ember-1，透過精簡推理 Token 數量，在維持頂尖模型品質的同時大幅降低計算成本。 核心亮點： 高效率推理 Token 壓縮：Ember-1 能產生更短的推理鏈條，以大約少 40% 的 Token 消耗達到與 Kimi K3 相當的生成品質。 Serverless 搶先預覽：目前已正式以 Research Preview 形式在 Serverless 平臺上線，為開發者提供高價效比的推理選項。 技術規格：基於 Kimi K3 架構 / 減少約 40% 推理 Token / Serverless 隨選上線 傳送門：Fireworks Research 官方部落格 產品發布/更新 ChatGPT Voice 升級與外掛整合 — OpenAI 更新內容：OpenAI 宣佈 ChatGPT Voice 獲得重大升級，正式支援電子郵件、行事曆與 Slack 等常用外掛，並由最新 GPT-6 系列模型（Astra、Sol、Luna）強力驅動。同時，語音功能全面登陸網頁版與行動版的 ChatGPT Work，使用者僅需透過語音即可在瀏覽器中直接建立檔案、簡報、網站、試算表或處理複雜的自動化任務。 適用人群：[企業辦公族 / 專案經理 / 開發者 / 追求高效生產力的使用者] 體驗通道： View post on X by @OpenAI 在 X 上查看 @OpenAI 的貼文 ↗</description></item><item><title>AI 日報｜Claude Opus 5.5 與 GPT-6 Sol/Luna 雙雄同日登場，大模型價格戰全面開打；小米開源 MiMo-V2.6</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-23/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-23/</guid><pubDate>Wed, 23 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Claude Opus 5.5 與 GPT-6 Sol/Luna 雙雄同日登場，大模型價格戰全面開打；小米開源 MiMo-V2.6 模型發布/更新 Claude Opus 5.5 — Anthropic 一言以蔽之：Anthropic 正式推出 Claude 5.5 家族首款模型 Claude Opus 5.5，在長程 AI Agent 與程式碼修復表現追平頂級模型 Fable 5.1，典型工作負載成本大幅下降 40%。 核心亮點： 價格與快取大降價：輸入與輸出定價下調至每百萬 Token $4 與 $20（降幅 20%），快取讀取（Cache Read）更砍至 $0.20/Mtok（降幅 60%），輸出生成速度提升超過 30%。 高階程式碼與長程任務實力：在 Terminal-Bench 4.0 拿下 66.4%，VS Code 終端任務解決步數減少超過一半；在 GDPval-AA v2.1 知識工作基準取得 1846 Elo 分數。 溝通表達最佳化：主動將核心結論與關鍵資訊前置，減少冗餘術語與長篇鋪墊；強制採用自適應思考（Adaptive Thinking）機制。 技術規格：閉源旗艦模型 / 1M Context Window / 支援 Fast mode（最高 2.5 倍速度）/ Terminal-Bench 4.0 66.4% 傳送門：Anthropic 官方發布頁面 GPT-6 Sol &amp;amp;amp; GPT-6 Luna — OpenAI 一言以蔽之：OpenAI 推出 GPT-6 世代中階與輕量主力模型 GPT-6 Sol 與 GPT-6 Luna，承襲旗艦 Astra 核心架構與對齊能力，API 價格相較 GPT-5.6 促銷價直接砍半。 核心亮點： 極致價效比下放：GPT-6 Sol 定價為輸入 $2/Mtok、輸出 $10/Mtok；輕量版 GPT-6 Luna 僅需輸入 $0.10/Mtok、輸出 $0.50/Mtok。在 DeepSWE v1.1 評測中 Luna 達到 66.6% 得分，成本僅為前代的 4% 到 7%。 提示詞快取（Prompt Caching）大幅進化：快取命中可享最高 90% 折扣；新增快取斷點（Cache Breakpoints）與上下文預熱（Prewarm），在執行途中調整推理強度或工具開關時快取依然有效。 技術規格：閉源大/中/小杯體系 / 支援 ChatGPT Work、Codex 與 API / AutomationBench 達到 33.2% 傳送門：OpenAI 官方發布公告 MiMo-V2.6 (Pro &amp;amp;amp; Flash) — 小米 (Xiaomi) 一言以蔽之：小米正式開源原生多模態模型 MiMo-V2.6 系列（Pro 與 Flash），同步公開全套 7,000+ RL 任務環境與大規模強化學習訓練框架。 核心亮點： 開源頂尖智慧指數：MiMo-V2.6-Pro 在 Artificial Analysis 綜合智慧指數拿下 46 分，位列開源權重模型榜首；Flash 版本在多項 Agent 任務中逼近 Pro 表現。 MixRL 全鏈條強化學習：採用混合強化學習策略（MixRL），單次 RL 訓練跑了 30 個大步、涵蓋 75 萬條長程 Agent 軌跡，並開源基於 Qwen-9B 蒸餾的小模型。 親民 API 與寬鬆開源授權：Pro 版 API 輸入僅 $0.435/Mtok、輸出 $0.87/Mtok；全系列採 MIT 授權開源。 技術規格：MoE 架構（總引數 1.02T / 啟用引數 42B）/ 1M Context Window / 開源權重（MIT 授權） 傳送門：MiMo 官方技術檔案 Grok 4.7 — SpaceXAI / xAI 一言以蔽之：SpaceXAI 正式推出新一代主力模型 Grok 4.7，引數規模擴增至 2.1 兆，在維持原價基礎上大幅強化程式設計、模擬構建與長時程推理表現。 核心亮點： 程式碼與工程基準躍升：CursorBench 4.0 得分自 40.4% 躍升至 46.3%，EEBench 達 64%，Code Arena: WebDev 排行榜進入全球第 10 名。 長程工作與可調推理：支援動態可調推理強度，在連續複雜任務（如一次性生成完整開放世界 3D 場景）中展現更高驗證深度與穩定度。 技術規格：2.1T 引數 MoE / 500K Context Window / API 定價輸入 $2/Mtok、輸出 $6/Mtok 傳送門：xAI 官方新聞稿 Ming-Image-0.1-Design 家族 — 螞蟻集團 AntLing 一言以蔽之：螞蟻集團開源 6B 專用設計影像生成模型 Ming-Image-0.1-Design 家族，榮登 Artificial Analysis UI/UX 設計榜開源第一。 核心亮點： UI/UX 與圖層拆分專業化：包含基礎設計模型與 Layer 圖層分離模型，支援原生多圖層分離渲染。 配套開源 Agent Skills：同步釋出「Ling UI Design」與「Image-to-Editable-PPT」兩套 Agent 技能，可直接產出可編輯的投影片與介面原型。 技術規格：6B 引數 / 開源權重 / 專攻 UI 設計與分層圖稿 傳送門：Hugging Face 模型庫 產品發布/更新 JetBrains Air — JetBrains 更新內容：JetBrains 將旗下 JetBrains Central CLI、共享上下文、雲端 Agent、自動化治理與 AI 成本控制全面整合為 JetBrains Air，專為 Agentic 軟體工程打造跨 IDE 與雲端的協同系統。 適用人群：[軟體工程師 / 研發團隊主管 / DevOps 架構師] 體驗通道：JetBrains 官方發布部落格 Worker Previews — Cloudflare 更新內容：為 AI Agent 與開發者的每次程式碼變更自動生成獨立、逼近 Production 環境的預覽站點。支援專屬變數、Secret、Bindings、獨立 Traces 與穩定 URL，避免 Agent 測試變更影響線上服務。 適用人群：[全端開發者 / AI Agent 開發者 / 系統維運] 體驗通道：Cloudflare 官方部落格 全新創作平臺與 Swap Anything / Relight Media — Pika Labs 更新內容：Pika 推出專為創作者設計的全新 AI 創作平臺，上線兩大核心工具：「Swap Anything」可在保留原片時序與動作下置換角色、道具或背景；「Relight Media」則能重構照片與影片的光影與打光氛圍。 適用人群：[影音創作者 / 廣告導演 / 視覺設計師] 體驗通道： View post on X by @pika_labs 在 X 上查看 @pika_labs 的貼文 ↗</description></item><item><title>AI 日報｜阿里開源 Qwen-Image-2.1、Anthropic 建立生物實驗室與 GitHub 宣佈 AI 重構 Rust 執行時</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-22/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-22/</guid><pubDate>Tue, 22 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜阿里開源 Qwen-Image-2.1、Anthropic 建立生物實驗室與 GitHub 宣佈 AI 重構 Rust 執行時 模型發布/更新 Qwen-Image-2.1 — 阿里通義千問 一言以蔽之：阿里通義千問正式開源 7B 原生影象生成與編輯模型 Qwen-Image-2.1，支援單一檢查點統一完成文生圖與多圖編輯，並原生輸出透明 RGBA 影像。 核心亮點： 統一生成與編輯：將文字生成與影象編輯能力整合成單一模型檢查點，最多可支援 10 張參考圖進行復刻、修改與多圖合成。 開源生態免安裝：內建提示詞增強 LLM，已全面整合於 diffusers、ComfyUI 與 SGLang-Diffusion，並在 Hugging Face Spaces 提供免安裝線上 Demo。 技術規格：7B 引數 / 開源權重模型 / SGLang Day-0 支援 / 支援透明 RGBA 輸出 傳送門：Qwen 官方部落格 Step 5 Preview — 階躍星辰 (StepFun) 一言以蔽之：階躍星辰正式發布 Step 5 Preview 旗艦模型並宣佈全量開放，在代理程式編碼與長週期任務中展現極佳的價效比。 核心亮點： 帕累託前沿表現：在多項程式設計與複雜 Agent 基準測試中，展現出與業界前沿閉源模型相當的實力，且 API 成本極具競爭力。 精準收尾能力：相較於同類模型，Step 5 Preview 具備出色的任務邊界意識與「知道何時停止」的特性，大幅減少長週期多步驟任務中的徘徊與冗餘消耗。 技術規格：閉源預覽版 / 支援高頻程式碼編寫與 Agent 任務 / 平臺已全量開放 傳送門：StepFun 官方體驗 產品發布/更新 Studio 4.0 — ElevenLabs 一言以蔽之：ElevenLabs 旗下的 AI 原生影片編輯器 ElevenCreative 正式迎來 Studio 4.0 重磅升級，打造真正的一站式 AI 創作與協作流水線。 更新內容： 全端 AI 生成能力：使用者可直接在專案內生成影片、影象、語音、音樂與音效，並在同一個介面完成剪輯、加字幕與匯出。 團隊原生協作：新增精細化評論與資產管理功能，讓剪輯與審片回饋直接留在時間軸和素材上，告別零散的外部通訊軟體串接。 適用人群：[影片創作者 / 內容行銷 / 影音編輯團隊] 體驗通道：ElevenLabs Studio 官方頁面 Perplexity Computer 整合 MiniMax H3 與 Seedance 2.5 — Perplexity 一言以蔽之：Perplexity Computer 迎來重大功能擴充，正式引入 MiniMax H3 與位元組跳動 Seedance 2.5 影片生成能力。 更新內容：Pro 與 Max 訂閱使用者現在可以直接向 Computer 索取行銷短片、產品 Demo 或社群素材，系統會在同一個對話執行緒中同步生成成片、文案與創意構思，大幅簡化影音內容的落地流程。 適用人群：[行銷人員 / 創業者 / 內容運營] 體驗通道： View post on X by @perplexity_ai 在 X 上查看 @perplexity_ai 的貼文 ↗</description></item><item><title>AI 日報｜Qwen-Image-2.1 開源發布、Anthropic 建立實體濕實驗室進軍藥研、Step 5 Preview 旗艦模型登場</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-21/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-21/</guid><pubDate>Mon, 21 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Qwen-Image-2.1 開源發布、Anthropic 建立實體濕實驗室進軍藥研、Step 5 Preview 旗艦模型登場 模型發布/更新 Qwen-Image-2.1 — Alibaba Qwen 一言以蔽之：阿里通義千問團隊正式開源 Qwen-Image-2.1，將文生圖與圖生圖編輯完美整合至輕量 7B 架構中，並原生支援透明影象處理。 核心亮點： 統一生成與編輯：單一 7B Checkpoint 同時支援高畫質影象生成與區域性修改，支援最多 10 張參考圖進行指令編輯，精確保留人像與產品特徵。 原生透明通道（RGBA）：業界罕見地原生支援生成與編輯帶有 Alpha 通道的透明圖層，大幅提升前端排版與合成效率。 技術規格：7B 輕量化架構 / 開源模型（支援 ComfyUI 與 Hugging Face） 傳送門：Qwen 官方部落格 Step 5 Preview — 階躍星辰 (StepFun) 一言以蔽之：階躍星辰推出新一代旗艦基座模型 Step 5 Preview，在保持極高價效比的同時，展現出頂級的 Agentic 任務與金融專業表現。 核心亮點： 稀疏混合專家架構：總引數量達 600B、啟用引數僅 27B，原生支援 100 萬 Token 超長上下文與視覺多模態輸入。 強悍的價效比：在 Artificial Analysis Intelligence Index 中取得 44 分，位居全球開源模型前三；單任務成本僅為 Claude Opus 5 的 1 / 8。 技術規格：600B MoE（27B 啟動） / 1M 上下文 / 預計 10 月 15 日全面開源權重 傳送門：階躍星辰官方公告 Nano Banana 2.5 — Google DeepMind 一言以甄之：Google 預告即將推出代號 spicy-mayo 的 Nano Banana 2.5 模型，主打強大的多尺寸與推理深度調節能力。 核心亮點： 動態思考等級：支援 minimal、medium、high 三種思考強度切換。 靈活影象輸出：原生支援 512、1K、2K 及 4K 等多種影象尺寸生成。 技術規格：Google Vertex 平臺預先部署 / 即將全面發布 傳送門： View post on X by @mark_k 在 X 上查看 @mark_k 的貼文 ↗</description></item><item><title>AI 日報｜Google Gemini 爆發越獄事件、AI 實驗室遭集體反壟斷訴訟、川普宣佈成立 AI Force</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-20/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-20/</guid><pubDate>Sun, 20 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Google Gemini 爆發越獄事件、AI 實驗室遭集體反壟斷訴訟、川普宣佈成立 AI Force 模型發布/更新 ScientistTwo — Google DeepMind / Google 一言以蔽之：Google 發表全新 ScientistTwo 研究論文，展示大型模型在科研任務中的遞迴自我改進能力。 核心亮點： 自主遞迴自我改進：模型能夠自主提出想法、進行實驗驗證、剔除無效方案，並根據同行評審回饋開啟新一輪迴圈。 榜單與基準表現：在 107 個由人類定義的機器學習問題中成功改進了 86 個；針對 ICLR、ICML 及 NeurIPS 論文相關問題，達到 80.4% 的成功率，相較原始人類基線平均提升 25.2%。 技術規格：AI 科研自我改進框架 / 論文研究階段 傳送門： View post on X by @rohanpaul_ai 在 X 上查看 @rohanpaul_ai 的貼文 ↗ SIFT (Self-Improvement via Fast Tree-search) — MIT &amp;amp;amp; Sakana AI 一言以蔽之：MIT 與 Sakana AI 聯手推出 SIFT 框架，大幅降低自我改進編碼 AI Agent 的執行成本。 核心亮點： 快速樹搜尋排序：利用 LLM 評委（LLM Judge）先行對候選的程式碼自修改方案進行排序，僅針對有希望的節點進行深度評測。 突破性成本削減：成功將以往高昂的自我改進編碼 AI Agent 執行成本壓低至 DGM 基線的約十分之一，使大規模遞迴最佳化更具可行性。 技術規格：低成本編碼 AI Agent 樹搜尋框架 / 開源研究 傳送門： View post on X by @omarsar0 在 X 上查看 @omarsar0 的貼文 ↗</description></item><item><title>AI 日報｜Grok Voice 2.0 登頂、Anthropic 引入 Accenture 獨立評估、Figure Helix 2.5 零樣本居家任務</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-19/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-19/</guid><pubDate>Sat, 19 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Grok Voice 2.0 登頂、Anthropic 引入 Accenture 獨立評估、Figure Helix 2.5 零樣本居家任務 模型發布/更新 Grok Voice Transcribe 2.0 — xAI 一言以蔽之：xAI 正式發布 Grok Voice Transcribe 2.0，在多語言語音轉寫準確度上表現亮眼，成功登頂 Artificial Analysis 串流榜單首位。 核心亮點： 轉寫準確度翻倍：在客服通話、口述憑證與短語音指令等複雜場景下的錯誤率較前代大幅降低。 超高價效比：支援 Grok Voice API，批次處理定價為每小時 0.10 美元，串流模式為每小時 0.20 美元。 技術規格：多語言流式轉寫 / 支援批次與串流 API / 人工智慧轉寫準確度第一梯隊 傳送門： View post on X by @SpaceXAI 在 X 上查看 @SpaceXAI 的貼文 ↗ Qwen3.8-LiveTranslate — 阿里雲 Qwen 一言以蔽之：Qwen 推出全新 Qwen3.8-LiveTranslate 即時同聲傳譯模型，採用 Interleave 架構與 Hybrid-MoE 雙引擎重構，將平均滯後時間（LAAL）壓縮至 2.3 秒。 核心亮點： 架構創新：結合 Interleave 互動架構與 Hybrid-MoE Thinker-Talker 設計，兼顧翻譯準確度與極低延遲。 即時流暢：有效解決長語句同步與語意對齊問題，大幅提升跨語言語音 AI Agent 的互動體驗。 技術規格：MoE 架構 / 支援即時雙向語音 / 平均滯後 2.3 秒 傳送門：Qwen 官方部落格 jina-ocr-v1 — Jina AI 一言以蔽之：Jina AI 發布總引數 3.4B、每 token 僅啟用 570M 的緊湊型端到端檔案解析模型，主打低預算 GPU 上的高效能圖文轉換。 核心亮點： 高效前置壓縮：透過 DeepEncoder 將視覺 Patch 高效壓縮，大幅降低 Prefill 計算開銷與 KV Cache 佔用。 推測解碼加強：內建專門設計的推測解碼草稿頭，在 NVIDIA L4 等低成本顯示卡上實現近乎翻倍的生成速度且完全無損。 技術規格：3.4B MoE 架構（啟用 570M） / 吞吐量達 2.57 頁/秒 / 支援 OmniDocBench 與 olmOCR-Bench 傳送門：MarkTechPost 報導 產品發布/更新 Helix 2.5 — Figure 更新內容：人形機器人公司 Figure 發表最新神經網路模型 Helix 2.5，並公開零樣本全身自主實驗。機器人在未曾採集資料、未經微調的 30 個陌生家庭中，成功完成客廳整理、鋪床與折毛巾等長時程全身任務，將零樣本成功率從 9% 大幅推升至 56%，展現強大的跨環境實體泛化能力。 適用人群：[人形機器人開發者 / 實體 AI 研究人員 / 自動化產業從業者] 體驗通道：微信公眾號報導 AGENTS.md 專案指令支援 — Claude Code v2.1.277 / Anthropic 更新內容：Claude Code 官方發布 v2.1.277 更新，正式引入對 AGENTS.md 檔案的原生支援。當專案資料夾中沒有 CLAUDE.md 時，Claude Code 將自動檢測並讀取 AGENTS.md 作為專案執行規則。開發者也可透過 /config 指令自由切換或自訂專案指令，解決多平臺協作時規則檔案不統一的痛點。 適用人群：[軟體開發者 / Claude Code 重度使用者 / AI 輔助工程師] 體驗通道：GitHub Release 官方公告 產業動態 Anthropic 與 Accenture 達成 5 年至少 10 億美元合作，引入嵌入式獨立評估 事件概述：Anthropic 宣佈與全球專業服務巨頭 Accenture（透過旗下 AI 業務 Faculty）達成重大戰略合作，由 Accenture 派駐專家團隊擔任首個「第三方嵌入式評估方」，在 Anthropic 內部常態化進行前沿模型的紅隊測試、對齊評估與安全防護測試，雙方未來五年預計將投入至少 10 億美元擴充相關容量。 影響分析：標誌著前沿 AI 實驗室開始引入外部獨立機構進行深度合規與安全嵌入，有助於緩解公眾對封閉式模型安全透明度的疑慮。 新聞連結：Anthropic 官方新聞稿 AI 幻覺情報險些觸發美軍對華軍事行動 事件概述：據 CNN 獨家報導，今年春季美伊衝突期間，美軍特種作戰司令部一名分析員利用 AI 聊天機器人綜合開源資料與機密訊號情報，因 AI 模型產生幻覺誤判一艘中東航行的中國船隻載有核武部件。美軍一度讓軍機升空並做好武裝登船準備，所幸在行動執行的最後一刻進行人工覆核，及時叫停了一場險些引發衝突的危機。 影響分析：這起事件暴露出軍方在加速整合 AI 時，缺乏統一的人工校驗標準與安全流程。當 AI 產生的錯誤情報被直接包裝成標準官方報告並在內部流傳時，極易引發災難性後果。 新聞連結：CNN 專題報導 安全研究團隊利用 Claude 串聯漏洞，72 小時內攻破 OpenAI 內部員工賬戶 事件概述：安全公司 Hacktron 的研究員揭露，他們在 7 月 25 日利用兩個高危漏洞（包含 Discourse 圖片上傳引發的 libheif 堆溢位與 SSO 單點登入缺陷），成功在 72 小時內接管了多名 OpenAI 員工的 ChatGPT 與 Codex 帳號。攻擊程式碼主要由 Anthropic 的 Claude 編寫，研究員僅在內部程式碼庫提交了一個無害的 PR 證明許可權即停止。 影響分析：凸顯出當前 AI 輔助攻擊能力正以極高速度演進，企業級身份認證與第三方開源元件的安全性面臨嚴峻挑戰。 新聞連結： View post on X by @dotey 在 X 上查看 @dotey 的貼文 ↗</description></item><item><title>AI 日報｜Google 發布 Gemini 3.8 Live 語音模型；TypeSafe AI 推出全新 System One 模型 Jev；Shopify 攜手 OpenAI 上線 ChatGPT Ads</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-18/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-18/</guid><pubDate>Fri, 18 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Google 發布 Gemini 3.8 Live 語音模型；TypeSafe AI 推出全新 System One 模型 Jev；Shopify 攜手 OpenAI 上線 ChatGPT Ads 模型發布/更新 Gemini 3.8 Live 與 Extended Thinking — Google DeepMind 一言以蔽之：Google 推出全新 Gemini 3.8 Live 語音模型，同步帶來支援多步驟深度推理的 Extended Thinking 版本，實現「邊想邊說」的即時語音互動。 核心亮點： 即時思考與發音同步：Extended Thinking 版本在面對複雜問題時，會自然發出「讓我想一下…」等過渡語，並在背景執行多步驟任務時同步向使用者回報進度。 非同步工具呼叫：支援在背景呼叫外部 API、檢索資料或執行複雜計算的同時，前端語音互動完全不中斷。 技術規格：支援 97 種語言自動切換 / 語音對話綜合評測第一梯隊 傳送門：Google 官方部落格 Jev (System One 模型) — TypeSafe AI 一言以蔽之：由 ChatGPT 聯合創辦人 Diogo Almeida 創辦的 TypeSafe AI 推出全新類別的「System One 模型」Jev，完全放棄文字生成，專門為軟體內部的高速決策與路由設計。 核心亮點： 平行決策架構：放棄傳統大模型的逐字序列生成，改以平行取樣一次算出所有結構化答案，速度比前沿大模型快上數十甚至數百倍。 型別安全與校準機率：輸入非結構化資料，直接輸出帶有機率值的結構化選擇（Choice）、評分（Score）與布林值（Boolean），大幅降低應用程式解析成本。 技術規格：專用決策模型 / 支援 AI SDK / 延遲僅 70 至 500 毫秒 傳送門：TypeSafe AI 官方部落格 Mimo-v2.6-Pro — 小米 一言以蔽之：小米持續推進 Mimo 系列大模型訓練，其最新 2.6 Pro 版本在 Agentic RL（AI Agent 強化學習）後訓練中展現出色的多源交叉驗證與程式碼修復能力。 核心亮點： 多源交叉驗證能力：強化了複雜投研與資料核驗任務中的背景追溯，能呼叫數百個子代理進行網頁交叉比對，大幅減少幻覺。 大型專案除錯表現：在大型開源程式碼庫測試中表現亮眼，跨檔案修改與修復能力顯著提升。 技術規格：開源/閉源混合架構 / 支援大規模非同步 RL 訓練 傳送門：小米 Mimo 訓練儀表盤 產品發布/更新 ChatGPT Ads 與 Sponsored Agents — OpenAI / Shopify 更新內容：OpenAI 與 Shopify 達成重大商業合作，正式在 Shopify 後臺與 ChatGPT Ads 平臺上線「Sponsored Agents（贊助 AI Agent）」功能。商家可直接從 Shopify Catalog 拉取商品資料並免費設定廣告活動，使用者在 ChatGPT 內點選相關廣告後，可直接與標記清晰的商業贊助 AI Agent 進行互動與完成導購，開啟 AI 導向的代理式商務新浪潮。 適用人群：[電商商家 / 數位行銷人員 / AI 應用開發者] 體驗通道：OpenAI 官方公告 Grok Build 記憶功能 — xAI 更新內容：xAI 宣佈 Grok Build 平臺正式上線長期記憶功能。系統會在每輪對話結束後，自動在背景記錄專案約定、業務決策及關鍵事實，供後續所有會話讀取。使用者可透過 /memory 指令唯讀瀏覽記憶檔案，或透過 /dream 指令將雜亂筆記自動整理為主題檔案，大幅提升長期開發與協作的連貫性。 適用人群：[軟體開發者 / 專案經理 / Grok 深度使用者] 體驗通道：xAI 官方新聞稿 產業動態 Databricks 向全公司 3500 名工程師全面部署 Astra 事件概述：大資料與雲端巨頭 Databricks 宣佈，已將 OpenAI 的高階模型 Astra 部署給全公司約 3,500 名工程師使用。此前經過 200 人的小規模試點顯示，Astra 在高層系統設計等高複雜度工程任務上，明確超越此前的主流前沿模型。 影響分析：顯示頂尖企業正快速將前沿 AI 代理深度嵌入核心研發流程，儘管工程支出有所上升，但生產力與系統設計的效益已獲得大型企業的高度認可。 新聞連結： View post on X by @gdb 在 X 上查看 @gdb 的貼文 ↗</description></item><item><title>AI 日報｜Anthropic 整合 Cowork 與聊天功能並推出 Docs/Slides，OpenAI 發布模型失對齊披露框架與 6 大案例</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-17/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-17/</guid><pubDate>Thu, 17 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Anthropic 整合 Cowork 與聊天功能並推出 Docs/Slides，OpenAI 發布模型失對齊披露框架與 6 大案例 模型發布/更新 CUDA Rust (cuda-oxide 與 cutile-rs) — NVIDIA 一言以蔽之：NVIDIA 正式押注 Rust 原生 GPU 程式設計，推出支援 SIMT 與 Tile 兩條路線的 CUDA Rust 專用工具鏈。 核心亮點： 擺脫其他語言包裝：開發者現在可以用 Rust 原生編寫 GPU kernel，並直接編譯至 PTX 目標碼，提供更高效且型別安全的底層控制。 雙軌並行路線：推出 cuda-oxide（SIMT 路線，需 pinned nightly）與 cutile-rs（Tile 路線，支援 stable Rust 1.89+ 及 CUDA 13.3）兩大技術路線。 技術規格：NVIDIA 官方開發者工具 / 支援 PTX 原生編譯 傳送門：NVIDIA 開發者部落格 Confucius4-R2T2 — 網易有道 一言以蔽之：網易有道開源全新流式語音識別模型，透過創新約束機制確保已提交的文字永不被後續推理所改寫。 核心亮點： 穩定字首過濾機制：基於 Qwen3-ASR 架構，採用最長穩定字首（Longest Stable Prefix）演演演算法，精準判斷何時能安全輸出文字。 執行時動態術語注入：解碼器基於 LLM 構建，支援在不調整模型權重的情況下，於執行時動態注入專有名詞與產業術語。 技術規格：開源流式語音模型 / 支援動態上下文注入 傳送門： View post on X by @rohanpaul_ai 在 X 上查看 @rohanpaul_ai 的貼文 ↗</description></item><item><title>AI 日報｜Google 推出 Gemini 3.8 Live 語音大模型、Perplexity 發表自研 CobbleDB 資料庫、川普無預警連線黃仁勳 All-In Summit 談 AI 基建</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-16/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-16/</guid><pubDate>Wed, 16 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Google 推出 Gemini 3.8 Live 語音大模型、Perplexity 發表自研 CobbleDB 資料庫、川普無預警連線黃仁勳 All-In Summit 談 AI 基建 模型發布/更新 Gemini 3.8 Live &amp;amp;amp; 3.8 Live Extended Thinking — Google DeepMind 一言以蔽之：Google DeepMind 正式推出全新一代 Gemini 3.8 Live 系列語音對話模型，支援原生全雙工互動與背景非同步推理能力，全面提升語音 AI Agent 的流暢度。 核心亮點： 背景思考與非同步工具呼叫：Extended Thinking 版本能在語音對話持續進行的同時，在背景進行多步驟推理與工具呼叫，完美維持對話節奏而不中斷。 頂級語音評測表現：在 Artificial Analysis 語音品質與互動動態榜單中雙雙奪冠，支援自動切換 97 種語言並具備極佳的視覺與環境音接地能力。 技術規格：語音到語音原生模型 / 支援 AI Studio 與 API 呼叫 / 具備動態打斷與背景推理機制 傳送門：Google DeepMind 官方部落格 K2-Horizon-7B — IFM 一言以蔽之：IFM 團隊發布 7B 稠密型開源小模型 K2-Horizon-7B，在多項高難度推理與瀏覽檢索基準測試中展現出逼近甚至超越大尺寸模型的實力。 核心亮點： 高效能小模型：在 AA Bench 中取得高分，並在 BrowseComp 測試中超越部分前沿閉源模型，展現出色的程式碼檢索與工具呼叫潛力。 輕量落地：為開發者提供高效的開源選擇，適合搭配 GGUF 等量化工具進行本地端部署。 技術規格：7B Dense 開源模型 / 支援本地部署 / 具備強化的瀏覽與檢索能力 傳送門： View post on X by @karminski3 在 X 上查看 @karminski3 的貼文 ↗</description></item><item><title>AI 日報｜OpenAI 推出 GPT-Live-1 語音模型 API，Perplexity 發表 Windows 本地端 AI 助手 Portable Computer</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-15/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-15/</guid><pubDate>Tue, 15 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜OpenAI 推出 GPT-Live-1 語音模型 API，Perplexity 發表 Windows 本地端 AI 助手 Portable Computer 模型發布/更新 GPT-Live-1 (API) — OpenAI 一言以蔽之：OpenAI 正式推出全新語音模型 GPT-Live-1 API，支援同時聆聽與說話、隨時打斷及低延遲互動，全面解鎖自然流暢的語音 AI Agent 體驗。 核心亮點： 全雙工雙向語音互動：模型能同時進行聆聽與說話，完美消除過去語音助理尷尬的停頓期，支援隨時打斷與調整對話方向。 高抗噪與非同步推理：能精準區分人聲與背景噪聲，並在語音對話持續進行的同時，讓後端模型同步處理複雜推理與工具呼叫。 技術規格：即時語音雙向流 / 支援 API 呼叫 / 具備動態打斷機制 傳送門： View post on X by @OpenAIDevs 在 X 上查看 @OpenAIDevs 的貼文 ↗ DeepSeek-V4.1-Flash (Max) — DeepSeek 一言以蔽之：DeepSeek 推出 V4.1-Flash (Max) 模型，在 Agent Arena 綜合榜單中躍居開源模型第 3 名，以極低的單任務成本大幅重塑效能前沿。 核心亮點： 高價效比的 Agent 表現：在 Agent Arena 綜合評測中取得 +4.87% 的淨提升，中位單任務成本僅約 $0.07 美元，價效比極高。 帕累託前沿重塑：以顯著低於同級閉源模型的成本，大幅推動開源模型在複雜任務上的落地邊界。 技術規格：開源模型 / Agent Arena 綜合榜單第 3 名 / 單任務中位成本 $0.07 傳送門： View post on X by @arena 在 X 上查看 @arena 的貼文 ↗</description></item><item><title>AI 日報｜Perplexity 匯入 GPT-6 Astra 系統、騰訊開源語音模型 AuK、全球 AI 領袖熱議「放慢前沿」倡議</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-14/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-14/</guid><pubDate>Mon, 14 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Perplexity 匯入 GPT-6 Astra 系統、騰訊開源語音模型 AuK、全球 AI 領袖熱議「放慢前沿」倡議 模型發布/更新 AuK — 騰訊混元團隊 / AuK Project 一言以蔽之：騰訊混元團隊正式開源全新語音基礎模型 AuK，主打高擬真語音生成與編輯，被社群譽為語音界的「nano banana」。 核心亮點： 統一基礎架構：支援跨語言的語音合成與精細化語音編輯，具備極高的音色還原度。 跨平臺應用：滿足多語言影音翻譯與擬真口語生成的生產需求，但在部分跨語系口音自然度上仍有最佳化空間。 技術規格：開源權重 / 語音基礎模型 / 支援多語言語音編輯 傳送門：AuK 官方專案頁面 Qwen 3.8 Max (Fireworks 整合) — 阿里雲 &amp;amp;amp; Fireworks AI 一言以蔽之：阿里雲旗艦模型 Qwen 3.8 Max 正式登陸 Fireworks AI 平臺，為全球開發者提供極速且高效的企業級推理效能。 核心亮點： 極致效能：結合阿里雲旗艦模型的強大推理與多模態能力，與 Fireworks 基礎架構深度最佳化。 生產級吞吐量：大幅降低延遲，提供高達每秒數百 Token 的流暢體驗，滿足大規模生產環境需求。 技術規格：旗艦商用開源大模型 / 雲端 API 整合 傳送門：Fireworks AI 平臺 產品發布/更新 Perplexity 深度整合 GPT-6 Astra 系統 — OpenAI 一言以蔽之：OpenAI 官方宣佈 Perplexity 已全面匯入 GPT-6 Astra 執行端到端系統，用於自動化編寫通訊、修改軟體及監控生產環境。 更新內容：Perplexity 利用 Astra 處理日常通訊、程式碼調整與複雜系統監控，相較於早期模型，人工介入的頻率大幅降低，展現新一代模型在實際業務流程中的自治能力。 適用人群：[軟體開發者 / 企業營運 / AI 應用探索者] 體驗通道：OpenAI 官方部落格 GitHub Agent 應用擴充 — GitHub 之一更新：GitHub 推出全新 Agent 整合功能，開發者現可直接在 GitHub 內串接 Amplitude、Endor Labs、LaunchDarkly 與 PagerDuty 等常用服務。 更新內容：開發者無需切換平臺即可取得完整上下文與除錯支援，進一步打破開發工具與維運服務之間的壁壘。 適用人群：[軟體工程師 / DevOps 工程師 / 開發團隊] 體驗通道：GitHub 官方部落格 ColaMD 2.1 — MarsWave AI 更新內容：免費且優雅的 Markdown 編輯器 ColaMD 發布 2.1 版本，新增分頁標籤支援（支援快捷鍵 ⌘T / ⌘W）、安裝包大幅瘦身 60%（縮減至 80M），並預告將推出開放式外掛系統。 適用人群：[文書工作者 / 開發者 / Markdown 愛好者] 體驗通道：GitHub 開源專案 產業動態 全球 AI 領袖熱議 Dario Amodei「放慢前沿」倡議：Satya Nadella 與業界大咖激烈交鋒 事件概述：繼 Anthropic 執行長 Dario Amodei 發表倡議放慢前沿 AI 迭代的萬字長文後，微軟執行長 Satya Nadella 公開強調 AI 必須以人類福祉為核心且保持開源繁榮。同時，David Sacks、Yann LeCun 與 Gary Marcus 等業界領袖紛紛發聲，對該提議背後的監管意圖、第三方評估機構（如 METR）的獨立性以及地緣政治影響展開激烈辯論。 影響分析：這場論戰反映出頂尖 AI 實驗室、開源社群與投資界對於 AI 治理權、監管捕捉（Regulatory Capture）以及全球技術競爭的深刻分裂，預示著 AI 政策與開源生態將迎來新一輪的博弈。 新聞連結： View post on X by @GaryMarcus 在 X 上查看 @GaryMarcus 的貼文 ↗</description></item><item><title>AI 日報｜Dario 倡議放緩前沿 AI 研發獲巨頭響應、OpenAI 公開自研 Jalapeno 推理晶片架構、SWE-2 與 Suno v6 發布</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-13/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-13/</guid><pubDate>Sun, 13 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Dario 倡議放緩前沿 AI 研發獲巨頭響應、OpenAI 公開自研 Jalapeno 推理晶片架構、SWE-2 與 Suno v6 發布 模型發布/更新 SWE-2 — Cognition 一言以蔽之：Cognition 發布全新程式設計模型 SWE-2，以 64% 的極低成本逼近前沿模型 Fable 5.1 的程式碼解決水準。 核心亮點： 高效強化學習後訓練：基於 2.8T 引數的 Kimi K3 基座模型進行深度 RL 後訓練，大幅最佳化長鏈條軟體工程除錯能力。 極高價效比：在權威基準 FrontierCode 1.1 Main 測試中取得 50.0% 的高分，與頂級專有模型相差不到 1 分，但端到端推論成本大幅下降 64%。 技術規格：2.8T 基座強化學習後訓練 / 專用程式設計模型 / FrontierCode 1.1 Main 得分 50.0% 傳送門：MarkTechPost 深入報導 AuK-Flash — 騰訊混元 (Tencent Hunyuan) 一言以蔽之：騰訊開源 1.5B 語音生成與編輯基座模型，支援 4 步極速蒸餾推論與統一自然語言指令互動。 核心亮點： 全功能語音操作：透過統一的自然語言提示詞，原生支援零樣本（Zero-shot）TTS、細粒度聲學編輯、副語言特徵微調、語音增強與音源分離。 4-step Flash 蒸餾：官方釋出 AuK-Flash 蒸餾權重，僅需 4 步擴散去噪即可完成高品質即時音訊生成，大幅降低邊緣端部署門檻。 技術規格：1.5B 引數 / 開源權重與推論程式碼 / 支援 4-step 極速蒸餾 傳送門：GitHub 專案庫 | 專案首頁 Suno v6 家族 — Suno 一言以蔽之：新一代旗艦音樂生成模型家族上線，攜手華納音樂等唱片巨頭共同打造更具真實感的音樂質地。 核心亮點： 三大版本分級發布：提供兼顧極致品質的旗艦 v6、主打前衛實驗風格的 v6-wild（面向 Pro / Premier 訂閱者），以及極速響應的 v6-mini（全體免費開放）。 聲學架構全面升級：大幅提升人聲自然度與編曲層次感，消除了早期模型常見的合成電音雜音。 技術規格：專有音樂生成架構 / 多模態音訊生成 / 支援即時 Web 端生成 傳送門：Suno 官方部落格 Agnes-3.0-Flash (33B) — Agnes AI / 開源社群 一言以蔽之：採用 Delta-rule 混合注意力架構的 33B 多模態開源模型，具備 256K 超長上下文並在 AA 評測中取得 36 分。 核心亮點： 3:1 混合注意力機制：72 層解碼器中每 4 層有 3 層採用 Delta-rule 遞迴層（狀態與序列長度無關），僅 18 層保留全域注意力，大幅縮減超長上下文下的 KV 快取記憶體佔用。 多模態與可調推論：原生支援文字、影像與影片理解，並支援 reasoning_effort 動態調節推論深度。 技術規格：33B 密集模型 / 混合注意力架構 / 262,144 tokens 上下文 / Artificial Analysis 智慧指數 36 傳送門：Hugging Face 模型庫 產品發布/更新 GPT-Live-1 API 正式開放 — OpenAI 更新內容：OpenAI 宣佈將「1-800-ChatGPT」背後的即時雙向語音互動能力 GPT-Live-1 正式開放至 API。開發者現在可將邊說邊聽、低延遲、具備打斷與自然語氣切換的語音 AI Agent 接入自己的應用，並能靈活搭配自選的後端決策模型與 Harness 架構。 適用人群：[即時語音應用開發者 / 智慧客服架構師 / AI 伴侶產品團隊] 體驗通道： View post on X by @OpenAIDevs 在 X 上查看 @OpenAIDevs 的貼文 ↗</description></item><item><title>AuK 開源語音基礎模型：一句指令搞定語音生成、編輯與降噪</title><link>https://www.communeify.com/tw/blog/auk-audio-foundation-model/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/auk-audio-foundation-model/</guid><pubDate>Sun, 13 Sep 2026 00:53:23 +0800</pubDate><description>AuK：用編輯文字的方式處理音訊 想像一下，如果修改錄音檔能像改 Word 文件一樣簡單——調整語調、替換字詞、甚至改變說話者的情緒與聲線。過去，這些操作往往需要昂貴的器材與複雜的音效軟體。由上海交通大學、騰訊混元（Tencent Hunyuan）與上海創智學院聯合推出的開源基礎模型 AuK，成功將這些繁瑣的音訊處理流程轉化為直觀的自然語言互動。
AuK 的運作邏輯非常明確：將語音生成與多維度的音訊編輯技術統一在同一個框架中，讓使用者能直接透過文字指令與參考音訊，精確控制音訊的每一個細節。
圖片來源: Performance comparison with SOTA models across speech generation, editing, enhancement and separation.
AuK 的核心技術與架構設計 AuK 是一個擁有 15 億參數（1.5B） 的多模態語音基礎模型。為了涵蓋多樣化的語音任務，開發團隊構建了約 30.3 億條指令-音訊實例（Instruction-Audio Instances），以及高達 195 萬小時 的有效監督數據進行訓練。
在系統架構上，AuK 融合了三大核心模組：
多模態大語言模型（Multimodal LLM）： 負責理解使用者的自然語言指令與語意條件。 50 Hz 音訊 VAE： 聯合語音、通用音訊與音樂進行訓練，提供高品質的聲學表徵（Acoustic Latents）。 混合整流流（Rectified-Flow）Transformer： 結合雙流 MMDiT 區塊與單流 DiT 區塊，完成高保真的音訊擴散生成與編輯。 模型訓練經歷了「生成暖身」與「生成-編輯聯合預訓練」，並在 Post-training 階段引入人類反饋偏好最佳化與強化學習，大幅減少幻覺並強化複雜編輯邏輯。
五大核心音訊任務 AuK 完整涵蓋了五大音訊處理任務家族：
語音生成（Speech Generation）： 包含 Instruct TTS（指令控音）與 Zero-Shot TTS（零樣本語音克隆）。 內容編輯（Content Editing）： 精準進行語音字詞的插入（Add）、刪除（Delete）與替換（Replace），甚至支援演唱歌詞（Vocal Edit）的修改。 增強與分離（Enhancement and Separation）： 提供降噪、超高解析度畫質修復（Super-resolution）、人聲與伴奏分離（Extract Vocals），以及多說話者分離（Separate Speech）。 副語言編輯（Paralinguistic Editing）： 調整情緒（Emotion）、音色（Timbre）、移除/添加非語言事件（如呼吸聲、笑聲、咳嗽、嘆氣）、切換低語風格（Whisper）與方言去口音化（Deaccent）。 聲學編輯（Acoustic Editing）： 支援音速（Speed，0.5x–2.0x）、音量能量（Energy，-15dB–+15dB）與音高（Pitch，-3–+3 半音）的連續滑動調節。 常見問答 Q: AuK 能分離多人音訊嗎？ 可以。它具備強大的說話者分離功能，能依據說話者的發言內容或說話順序進行隔離拆分（如「僅保留說出『警隊規矩』的說話者」），非常適合應用於會議錄音整理與多軌剪輯。 Q: 修改字詞會破壞背景與語音連貫性嗎？ 不會。AuK 在訓練時考量了聲學背景與韻律的連貫性。在插入或替換字詞時，模型能在保留原始錄音音色、背景噪音與整體韻律的前提下完成無縫補錄。 Q: 處理速度如何？有輕量化版本嗎？ 為了大幅降低推論延遲，開發團隊推出了蒸餾版本 AuK-Flash。透過軌跡級一致性初始化與任務路由解耦 DMD（Decoupled DMD）蒸餾技術，AuK-Flash 僅需 4 步推論且無需 CFG，在同等條件下達到近乎教師模型的音質，且推論速度提高了 4.5 倍。 語音生成應用：Instruct 與 Zero-Shot AuK 的語音生成能力分為兩種模式：</description></item><item><title>Lightricks LTX-Video：開源高效能 AI 影片生成模型，打造即時動態影像新體驗</title><link>https://www.communeify.com/tw/blog/ltx-video-lightricks-ai-generator/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ltx-video-lightricks-ai-generator/</guid><pubDate>Sun, 13 Sep 2026 00:51:53 +0800</pubDate><description>LTX-Video：兼具速度與畫質的開源影片生成模型 想要把靜態照片變成影片，過去往往需要專業剪輯軟體與數小時的算圖時間。現在，Lightricks 開發的 LTX-Video 簡化了這個流程，讓文字生成影片（Text-to-Video, T2V）與圖片生成影片（Image-to-Video, I2V）變得更加直觀與高效。
圖片來源: Lightricks/LTX-Video · Hugging Face
什麼是 LTX-Video？ LTX-Video 是一款採用 Diffusion Transformer (DiT) 架構的開源即時影片生成模型。除了能將靜態影像轉換為動態影片（I2V）之外，它同時原生支援從文字直接生成影片（T2V）。
在技術層面上，LTX-Video 採用了強大的 3D 時空變分自編碼器（ST-VAE），將影片在空間（8x）與時間（8x）維度上進行高效壓縮，並搭配 T5-XXL 文本編碼器。這種設計結合了擴散模型（Diffusion Model）的畫面細膩度與 Transformer 對長序列資料的強大建模能力，能在維持動作連貫性的同時大幅降低計算延遲，甚至實現超越影片播放速率的極速算圖。
選擇適合的模型版本 創作者可根據硬體效能與應用場景選擇適合的模型版本：
13B / 2B 旗艦模型：具備高精度的運動控制與細緻的光影呈現，適合對畫質與鏡頭語言有高度要求的創作場景。 蒸餾版與輕量化模型：透過模型蒸餾技術（如 4-step / 8-step 蒸餾，或搭配 IC-LoRA 控制），可在極少的採樣步數下生成高質量影片，實現近乎即時預覽（Real-time preview）的互動創作體驗。 如何使用 本地腳本執行：技術愛好者與開發者可直接下載 GitHub 上的程式碼庫，透過設定配置文件與 YAML 檔案在本地端直接執行 T2V / I2V 任務。 ComfyUI 節點整合：習慣使用視覺化工作流的使用者，可安裝官方維護的 ComfyUI-LTXVideo，將模型靈活整合至現有的 ComfyUI 創作流程中。 提示詞與鏡頭控制建議 提示詞（Prompt）與參考圖品質直接決定了輸出的動作流暢度與畫面細節。與其輸入簡單籠統的關鍵字，不如明確描述「鏡頭運動、主體動作、光影變化與材質質感」。例如：
不推薦：「深海裡的海浪」 推薦：「深藍色的海浪撞擊崎嶇岩石，激起白色泡沫，背景有雲霧繚繞的遠山；鏡頭慢速推近，伴隨劇烈的自然光影變化與高動態範圍質感。」 若進行圖片生成影片（I2V），建議使用高清晰度、邊緣明確且無運動模糊的靜態圖片作為首幀輸入。
常見問題 Q：硬體要求高嗎？ A：硬體門檻視模型版本與量化程度而定。全精度 13B 模型對顯存（VRAM）要求較高（建議 24GB 以上 GPU）；若硬體資源有限（如 8GB~12GB VRAM 的消費級顯示卡），建議優先採用 2B 版本、FP8/INT8 量化模型或蒸餾版本。</description></item><item><title>Cohere 發布 North Small Translate：超高效能與極致成本控制的開源翻譯模型</title><link>https://www.communeify.com/tw/blog/cohere-north-small-translate/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/cohere-north-small-translate/</guid><pubDate>Sun, 13 Sep 2026 00:46:11 +0800</pubDate><description>翻譯技術的新選擇：Cohere North Small Translate 模型解析 對於需要處理多語言文件的企業與開發者而言，機器翻譯不僅是字詞轉換，更涉及資料隱私、翻譯準確度與成本控制。Cohere 近期發布的 North Small Translate 1.0 模型，採用稀疏混合專家架構（Sparse Mixture-of-Experts, MoE），旨在解決上述痛點。
圖片來源: Introducing North Small Translate: A leading sovereign open-weight machine translation model
什麼是 North Small Translate？ 這是 Cohere 北極星（North）系列中的首款翻譯專用模型。它總參數量達 2,180 億（218B），但每次運算僅啟用 250 億（25B）參數（包含 128 個專家中的 8 個動態專家以及共享專家），這種稀疏設計能在維持高輸出品質的同時顯著降低硬體負載與推論成本。模型支援 50 種語言，涵蓋繁體中文、簡體中文、日文、韓文、德文、法文及西班牙文等全球主要語言。
該模型專為「機器翻譯」進行訓練與對齊（Post-training），與通用型語言模型不同，它將資源集中於翻譯品質與上下文連貫性，支援長達 16K Tokens 輸入與 16K Tokens 輸出的上下文視窗（Context Window），在長篇文件處理上表現極為穩定。
架構特色與技術細節 混合注意力機制（Interleaved Attention）： 承襲 Command A 的架構，模型交替採用滑動視窗注意力（Sliding Window Attention，視窗大小 4,096 並搭配 RoPE 旋轉位置編碼）與全域注意力（Global Attention），比例為 3:1，有效兼顧長文本捕捉與記憶體效率。 長文本翻譯穩定度： 在長文本評測（以 xComet-XL 衡量長篇書籍翻譯）中獲得 48.9 分，表現為 Google Translate（21.3 分）與 Gemma 4 31B（19.4 分）的兩倍以上，大幅減緩傳統翻譯引擎在長文中常見的品質衰退與幻覺問題。 測試表現 根據 WMT26 基準測試（以 GPT-5.6-Sol 作為裁判），North Small Translate 在跨語言平均測試中獲得 83.60 分，超越了 DeepL NextGen（81.37 分）、Google Translate（68.20 分）以及 Qwen 3.5 397B（81.56 分）。若結合代理人（Agentic）的多輪自我糾錯與修復工作流程（North Small Translate Agentic），分數更可進一步提升至 84.36 分。</description></item><item><title>Audio8_TTS：輕量化高效能語音合成技術的全新突破</title><link>https://www.communeify.com/tw/blog/audio8-tts-lightweight-fast-tts/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/audio8-tts-lightweight-fast-tts/</guid><pubDate>Sun, 13 Sep 2026 00:40:05 +0800</pubDate><description>語音合成新紀元：Audio8_TTS 技術解析 近期開源專案 Audio8_TTS 引起開發者廣泛討論。這個文字轉語音（TTS）模型不以盲目堆疊參數為目標，而是透過精妙的架構創新與壓縮，在僅有 0.6B（6 億參數）與 0.1B（1 億參數） 的輕量極小規模下，實現了可與數十億參數工業級模型抗衡的 Zero-Shot 零樣本語音克隆（Voice Cloning） 品質與推論效率。
圖片來源: GitHub - Edge0-AI/Audio8_TTS: SOTA-Class TTS at Compact Scale · GitHub
核心技術：DualAR 架構與 Mamba 2 混合骨幹 Audio8_TTS 的核心優勢在於其靈活且高效的模型架構設計，並針對不同尺寸版本進行了專屬優化：
DualAR 雙自回歸解碼架構： 主要模型（0.6B）靈感源自 Fish Audio S2 Pro，分為負責生成語義 token 的 Slow AR（慢速自回歸，24 層），以及受 Slow hidden state 指導並生成 10 個聲學 Codebook 的 Fast AR（快速自回歸，4 層）。模型內建 44.1 kHz 神經聲碼器（Neural Codec），無需額外掛載解碼模型。 0.1B 版本的 Falcon-H1 混合骨幹： 針對極致輕量化與長序列效率設計的 0.1B 版本，將 Slow AR 骨幹替換為 Falcon-H1 混合架構（Mamba 2 SSM + 注意力機制），能顯著降低記憶體開銷並提升長文本處理效率。 多語言 Zero-Shot 語音克隆： 官方推薦支援包含中文、粵語、英文、日文、韓文、法文、德文、西班牙文、義大利文、波蘭文與荷蘭文等 11 種主要語言，只需提供一段短暫的參考音檔與文字稿，即可精準擷取目標音色。 開發者支援與環境 該專案在 GitHub 上提供了極為完整的生態系與部署工具，降低了整合難度：</description></item><item><title>sanoTTS：極致輕量化 neural TTS，能在 3 美元晶片與瀏覽器流暢運作</title><link>https://www.communeify.com/tw/blog/sanotts-ultralight-neural-tts/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/sanotts-ultralight-neural-tts/</guid><pubDate>Sun, 13 Sep 2026 00:25:41 +0800</pubDate><description>輕量級語音合成：sanoTTS 如何讓物聯網設備開口說話 隨著物聯網設備普及，許多智慧家庭產品與邊緣裝置都需要具備語音功能。然而，高品質的神經網路語音合成（TTS）通常運算量龐大、動輒需要數百 MB 的模型權重，這對記憶體與算力受限的微控制器（MCU）而言，傳統模型往往難以負荷。
sanoTTS 正是為了解決這個瓶頸而設計。「sano」（सानो）在尼泊爾語中意為「微小」。它不是為雲端伺服器運算的大型模型，而是專注於讓微型設備能在本地、無 NPU 與無網路的環境下流暢發聲。
圖片來源: GitHub - Ampixa/sanoTTS: sanoTTS (सानो = &amp;amp;lsquo;small&amp;amp;rsquo; in Nepali): a ~1.4M-param neural TTS that runs on a $3 chip or in the browser. Leads SCOREQ/UTMOS in the sub-15M class. · GitHub
什麼是 sanoTTS？ sanoTTS 是一個專為終端設備設計的極致輕量化神經語音合成框架。它捨棄了常見的數百 MB 模型，採用高度壓縮與蒸餾架構，參數規模僅介於 294k 至 2.3M 之間（例如最小的 heart-nano 模型僅 294k 參數，int8 權重檔案大小僅約 337 KB）。這項技術讓 ESP32-S3 等成本僅約 3 美元的常見開發板能在本地完成語音渲染，無需依賴雲端網路或外部 API。
在品質表現上，sanoTTS 在小於 15M 參數等級的模型類別中，於 SCOREQ 與 UTMOS 語音自然度指標上高居領先地位，甚至超越了參數量更大的 TinyTTS（1.62M）以及 15M 參數規模的 Kitten TTS。</description></item><item><title>AI 日報｜OpenAI 推出 GPT-Rosalind 生物模型與 Agents API；25 位費爾茲獎得主聯合發聲；Meta 發布 Muse Spark 1.3</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-12/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-12/</guid><pubDate>Sat, 12 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜OpenAI 推出 GPT-Rosalind 生物模型與 Agents API；25 位費爾茲獎得主聯合發聲；Meta 發布 Muse Spark 1.3 模型發布/更新 GPT-Rosalind — OpenAI 一言以蔽之：專為生命科學與生物醫學推理打造的特化前沿模型，正式結束研究預覽並全面向企業與開發者開放。 核心亮點： 深層生物邏輯推理：能跨學術論文與濕實驗（Wet-lab）資料進行關聯分析，自主評估特定藥物靶點的科學證據強度，並規劃下一階段驗證實驗流程。 深度整合工作流：全面登陸 OpenAI API、Codex 與 ChatGPT Enterprise，支援在 Codex 內掛載基因組學、蛋白質結構預測與轉譯醫學外掛，自動產出品管報告與互動式分析筆記本。 技術規格：生命科學特化前沿模型 / 支援 API、Codex 及 ChatGPT Enterprise / 企業級信任存取控制 傳送門： View post on X by @OpenAIDevs 在 X 上查看 @OpenAIDevs 的貼文 ↗ Muse Spark 1.3 (Max) — Meta AI 一言以蔽之：專注於真實世界 Agent 任務與程式碼工程的強化版本，在 Agent Arena 綜合榜單一舉躍升至第 13 名。 核心亮點： 長程多工作流協作：支援在單一執行緒中持續推進跨多個工作流的長程任務，實測成功率（Confirmed Success）大幅提升 8.4%。 主動人機協作與自校準：在遇到歧義或阻礙時會主動提問確認，大幅降低工具幻覺（Tool Hallucination），並在具備關鍵影響的操作前主動發起許可權確認。 技術規格：長程 Agent 特化模型 / Agent Arena 實測 +4.2% 淨改善度（Net Improvement） / 支援 Bash 與終端工具排程 傳送門： View post on X by @arena 在 X 上查看 @arena 的貼文 ↗</description></item><item><title>AI日報｜Cognition 發表 SWE-2、DeepSeek-V4.1-Flash 大幅壓縮快取、OpenAI 推出 Agents API</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-11/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-11/</guid><pubDate>Fri, 11 Sep 2026 10:29:00 +0800</pubDate><description>AI日報｜Cognition 發表 SWE-2、DeepSeek-V4.1-Flash 大幅壓縮快取、OpenAI 推出 Agents API 本期科技日報整理了近期的 AI 模型更新與業界動態，包含軟體工程模型、推論架構調整、多代理雲端服務，以及 Anthropic 發布的最新安全評估報告。
1. Cognition 發布 SWE-2 軟體工程模型 Cognition 官方技術報告 公開了新一代軟體工程模型 SWE-2。模型基於 2.8 兆參數的開源基座 Kimi K3 進行強化學習後訓練。
官方評測指出，SWE-2 在 FrontierCode 1.1 Main 測試中取得 50.0% 的成績，與目前領先的 Fable 5.1（50.9%）相近，但推論花費降低了約 64%。Cognition 在訓練中加入線形成本懲罰函數（$R = S - \lambda_e C$），試圖在任務成功率與運算成本之間尋找更好的平衡。
針對前代模型容易過度探索程式庫的問題，官方數據顯示 SWE-2 Medium 首次修改代碼的中位數步數從 48 步降至 18 步，調用輪次減少 58%。目前 SWE-2 已在 Devin Desktop 與 CLI 上線。
傳送門： View post on X by @FireworksAI_HQ 在 X 上查看 @FireworksAI_HQ 的貼文 ↗</description></item><item><title>AI日報｜Google 更新訂閱方案、Suno v6 發布、Anthropic 模型評估報告</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-10/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-10/</guid><pubDate>Thu, 10 Sep 2026 11:06:00 +0800</pubDate><description>AI日報｜Google 更新訂閱方案、Suno v6 發布、Anthropic 模型評估報告 這是一份最新的 AI 產業動態整理，整合了政策倡議、資安測試報告、經濟影響評估以及多項模型與產品更新。
模型發布/更新 GPT-6 Astra — OpenAI 一言以蔽之：專為複雜專業工作流打造的前沿推論模型，在 ARC-AGI-3 創下 99.9% 驚人表現，正式登陸 ChatGPT Work、Codex 與 API。 核心亮點： 突破性專業工作流適配：具備原生電腦操作（Computer Use）與高階多模態空間幾何理解能力，能自主進行長時間的多步驟研究、即時 3D 建模與精準程式碼重構。 彈性推論預算：提供多檔推理強度（Reasoning Effort）配置，API 定價設定為每百萬輸入 Token $10 美元、輸出 Token $50 美元。 技術規格：前沿多模態推論大模型 / 閉源 API / ARC-AGI-3 達 99.9% 傳送門：OpenAI 官方發布公告 Suno v6 (唱片業授權與編輯升級版) — Suno 一言以蔽之：首個獲得主流唱片業正式版權授權的旗艦 AI 音樂生成模型，支援音軌分離與自然語言段落修改。 核心亮點： 合規版權與音質躍升：與華納音樂集團（Warner Music Group）、BMG 及 Believe 等頂級唱片公司合作，大幅降低背景雜音與高頻失真，具備更細膩的樂器分軌與複雜和絃編排能力。 彈性版本與細粒度控制：提供旗艦版 v6、實驗性曲風 v6-wild，以及主打高效率並開放包含免費版全員使用的 v6-mini。使用者可透過自然語言指令修改特定歌詞、替換單句唱腔，或分離樂器音軌進行跨素材融合，同時導入嚴格審查機制攔截未授權採樣。 技術規格：商業音訊生成基礎模型 / 雲端 Web 與 API 傳送門：Suno 官方發布部落格 | The Verge 報導 騰訊開源 15 億參數語音模型 AuK — 騰訊 (Tencent) 一言以蔽之：騰訊在 Hugging Face 上正式開源 15 億參數基礎語音模型 AuK，專注於語音生成與聲音編輯。 核心亮點： 全方位語音編輯：支援零樣本文字轉語音（Zero-shot TTS）、語意內容編輯、音訊降噪增強及人聲/音樂分離，皆可透過統一的自然語言指令操作。 高效蒸餾版本：同步釋出經知識蒸餾的輕量化 AuK-Flash 版本，官方技術文件指出推論過程可縮減至僅需 4 個步驟，大幅提升運算效率。 技術規格：1.5B 參數 / 開源開放權重 / Hugging Face 部署 傳送門：Hugging Face 模型庫 LingBot-World 2.0 Small (1.3B) — Robbyant 一言以蔽之：僅 1.3B 參數的輕量級互動世界模型，可在單張消費級顯示卡上以 720p/60fps 即時生成並執行虛擬世界。 核心亮點： 消費級硬體極致執行：擺脫龐大運算叢集需求，單張消費級 GPU 即可流暢執行即時渲染與物理回饋互動。 動態世界狀態演進：支援連續數小時的虛擬世界狀態維護，可即時響應玩家施法、攻擊等複雜動作，並與 AI Agent 共同演進。 技術規格：1.3B 參數 / 開源開放權重 / 720p 60fps 即時推論 傳送門： View post on X by @omarsar0 在 X 上查看 @omarsar0 的貼文 ↗</description></item><item><title>AI日報｜OpenAI 發表數學難題證明、DeepMind 基因地圖與 Cohere 推論引擎</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-09/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-09/</guid><pubDate>Wed, 09 Sep 2026 14:21:00 +0800</pubDate><description>AI日報｜OpenAI 發表數學難題證明、DeepMind 基因地圖與 Cohere 推論引擎 今天的 AI 科技進展涵蓋數學證明、基因預測、影像生成與底層運算架構。以下是六項值得關注的技術更新。
OpenAI 內部模型提出 Navier-Stokes 奇異點證明 OpenAI 近期展示了一項數學研究成果，利用內部模型（官方表示運算量高於 GPT-6 Astra）探討流體動力學中的 Navier-Stokes 問題。官方指出，研究團隊部署了約 10,000 個具備網路檢索與程式碼執行能力的並發 AI 代理。在 88 小時的運作中，系統消耗約 1,300 億個 token，最終產出了一份分析證明，並透過 Lean 語言完成形式化驗證。
該證明確認了在特定條件下，不可壓縮流體可在有限時間內發展出速度無限增長的「奇異點」。幾乎在同一時間，紐約大學與 Anthropic 的研究人員也獨立解決了相關的「受迫歐拉問題」(forced Euler problem)。這顯示 AI 已能協助人類研究員探索部分高難度的數學分析問題。
Google DeepMind 發佈 AlphaGenome Atlas 基因變異資料庫 DeepMind 推出 AlphaGenome Atlas，將人類基因組中約 90 億種單一鹼基變異的預測影響彙整為 1 PB 的資料庫。過去科學家的研究多集中於占整體 2% 的編碼區，而這個資料庫則補足了剩餘 98% 非編碼區的預測數據。
系統透過「AlphaGenome 變異影響評分」(AVI) 來量化變異影響。根據 DeepMind 提供的應用案例，Broad 研究所利用這套評分系統，在數千個候選變異中定位出導致罕見癲癇性腦病的 DNM1 基因變異；另有研究團隊利用此工具在英國生物樣本庫 (UK Biobank) 中，標記了 19 個與 BMI 相關的基因區域。</description></item><item><title>AI 日報｜OpenAI 達成自動化研究實習生里程碑與對齊示警、黃仁勳宣佈 AGI 到來、Viggle-Animate 開源</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-07/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-07/</guid><pubDate>Mon, 07 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜OpenAI 達成自動化研究實習生里程碑與對齊示警、黃仁勳宣佈 AGI 到來、Viggle-Animate 開源 模型發布/更新 Viggle-Animate — Viggle 一言以蔽之：Viggle 正式開源影片角色替換工具 Viggle-Animate，支援使用者在本地 PC 僅需單張圖片與 3 步操作即可完成流暢的角色動態替換。 核心亮點： 極簡工作流：無需傳統複雜的 Pose、Mask、Face 或 Depth 控制管線，僅需單幀圖片輸入即可生成高一致性的人物動態影片。 本地硬體友善：大幅最佳化推論效率，開放開源權重與 Hugging Face 線上體驗入口，讓創作者能在消費級顯示卡上輕鬆執行。 技術規格：開源視覺角色動畫模型 / 支援本地 PC 部署與 Hugging Face 整合 傳送門：Viggle-Animate Hugging Face 專案頁 NeoMME (260M / 800M) — H Company 一言以蔽之：H Company 推出 NeoMME 輕量級單塔多模態編碼器系列，全面捨棄獨立視覺塔與因果解碼器設計。 核心亮點： 統一單塔架構：採用單一雙向 Transformer 架構同時處理多語言文字與 32×32 影像塊，實現真正的跨模態統一表示。 離散遮蔽擴散預訓練：透過離散遮蔽擴散（Discrete Masked Diffusion）演演演算法進行訓練，在極小引數量下大幅降低多模態特徵對齊的計算冗餘。 技術規格：260M 與 800M 引數雙向 Transformer / 遮蔽擴散多模態編碼器 傳送門：MarkTechPost 技術報導 產品發布/更新 Copilot Canvases 視覺化工作流協作介面 — GitHub 更新內容：GitHub 為 Copilot 推出全新「Canvases」介面，為多 AI Agent 的程式設計與審查提供持久、可共享的視覺化畫布。開發者不再需要於繁雜的對話紀錄中往返捲動，可直觀追蹤各 Agent 的執行進度、程式碼 Diff 變更以及待審查節點。 適用人群：[軟體工程師 / 技術主管 / 開源專案維護者] 體驗通道： View post on X by @github 在 X 上查看 @github 的貼文 ↗</description></item><item><title>AI 日報｜Google Lyria 3 音樂模型登場、GitHub Copilot 推出 HydraFusion 多模型編排、Anthropic 開源費馬最後定理 Lean 證明</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-06/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-06/</guid><pubDate>Sun, 06 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Google Lyria 3 音樂模型登場、GitHub Copilot 推出 HydraFusion 多模型編排、Anthropic 開源費馬最後定理 Lean 證明 模型發布/更新 Lyria 3 — Google DeepMind / Google 一言以蔽之：Google 正式推出新一代音樂生成模型 Lyria 3，深度整合至 Gemini 應用，帶來更高品質的多軌編曲與細膩風格掌控力。 核心亮點： 高保真音樂生成：大幅提升樂器分離度、旋律連貫性與人聲純淨度，顯著改善過去生成式音樂結構發散與混音模糊的問題。 Gemini 自然語言引導：使用者能透過多輪對話精準調整曲風、配器、節奏與情緒過渡，直接在對話方塊內完成端到端創作。 技術規格：閉源多模態音訊生成模型 / 整合於 Gemini 應用程式 傳送門：Google 官方部落格介紹 MAI-Image-2.6 &amp;amp;amp; MAI-Image-2.6-Flash — Microsoft AI 一言以蔽之：微軟發布 MAI-Image-2.6 系列影象生成與編輯模型，Flash 版本在保有頂尖質量的同時，響應速度提升逾 2 倍。 核心亮點： 多圖參考與區域性重構：支援將產品、人物、材質與場景等多個視覺參考融合至單張影象，並精準微調特定區域物件與版面排版。 極速與高價效比：Flash 版本中位響應時間僅 12.2 秒（大幅優於 GPT-Image-2 Medium 的 33.6 秒），在影像生成與編輯 Elo 榜單穩居前二。 技術規格：文字/多圖生圖與指令式影象編輯 / 支援最高 1.5K 解析度輸出 傳送門：Microsoft AI 官方新聞 LLaDA-Image — inclusionAI 一言以蔽之：inclusionAI 正式開源 LLaDA-Image，探索基於語言擴散統一架構的高品質影象生成與引導式編輯。 核心亮點： 統一架構管線：結合語言模型與擴散機制的優勢，具備出色的文字提示遵循度與精準的圖生圖修圖表現。 權重完整開源：開放全部推論程式碼與模型權重，支援開發者於本地或雲端環境進行自主微調與商業二次開發。 技術規格：開源視覺擴散模型 / 提供完整的推論與微調程式碼庫 傳送門：LLaDA-Image GitHub 倉庫 產品發布/更新 Project HydraFusion 多模型動態編排 — GitHub Copilot 更新內容：GitHub 在 Copilot CLI 中推出「Project HydraFusion」研究預覽版。系統不再依賴單一模型完成編碼，而是根據任務複雜度動態選擇執行工作流，提供 Single（單模型）、Cascade（階梯串聯遞進）以及 Critique（多模型互相審查）三種模式，靈活呼叫跨供應商的前沿模型組合以產出最優程式碼。 適用人群：[軟體工程師 / DevOps / 命令列重度使用者] 體驗通道：GitHub 官方技術部落格 自訂 MCP Agents 跨平臺串接 — Notion 更新內容：Notion 正式上線透過 MCP（Model Context Protocol）連線自訂 AI Agent 的功能。使用者可將 Notion 知識庫直接接入 ChatGPT、Claude 或 Grok Bot，在單一對話介面中跨平臺呼叫團隊打造的專屬 Agent，並全面支援 GPT-6 Astra 與 Claude Fable 5.1。 適用人群：[專案經理 / 團隊協作者 / 知識庫管理者] 體驗通道： View post on X by @NotionHQ 在 X 上查看 @NotionHQ 的貼文 ↗</description></item><item><title>AI 日報｜Claude 形式化證明費馬大定理、李飛飛團隊釋出 Atlas 空間世界模型、Google 推出 Lyria 3.5 音樂模型</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-05/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-05/</guid><pubDate>Sat, 05 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Claude 形式化證明費馬大定理、李飛飛團隊釋出 Atlas 空間世界模型、Google 推出 Lyria 3.5 音樂模型 模型發布/更新 Atlas 空間智慧世界模型 — World Labs (李飛飛團隊) 一言以蔽之：李飛飛創立的 World Labs 正式發表 Atlas 空間智慧世界模型，打破畫素生成與 3D 重建的界線，僅需 3 張照片即可構建高精度 3D 空間與極致鏡頭控制。 核心亮點： 新視角預測（New View Prediction）：將電腦視覺分離半世紀的畫素生成與 3D 幾何重建首次統一，具備對空間與時間的物理級模擬能力。 採整合本驟降 50 至 100 倍：過去重建單一房間需要 100 到 300 張密集照片，Atlas 僅需 3 張即可完成；甚至可用 3 臺 iPhone 重現《駭客任務》經典的子彈時間（Bullet Time）定格環繞特效。 技術規格：多模態空間世界模型 / 支援端到端 3D 重建與攝影機運動軌跡精準控制 / 支援極少視角輸入 傳送門： View post on X by @drfeifei 在 X 上查看 @drfeifei 的貼文 ↗</description></item><item><title>AI 日報｜OpenAI GPT-6 Astra 重磅登場！NVIDIA 敲定 129 億美元收購 Hugging Face</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-04/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-04/</guid><pubDate>Fri, 04 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜OpenAI GPT-6 Astra 重磅登場！NVIDIA 敲定 129 億美元收購 Hugging Face 模型發布/更新 GPT-6 Astra — OpenAI 一言以蔽之：OpenAI 正式推出被內部視為「跨入 AGI 時代」的全新旗艦模型 GPT-6 Astra，專精長程自主電腦操作、科學發現與深層符號推理。 核心亮點： ARC-AGI 3 接近飽和：在 ARC-AGI 3 評測中，透過 Provider Adapter 架構取得 99.9%（標準測試 62.7%~66%），在 96% 的關卡中探索步數少於人類中位數；在 OSWorld 2.0 上單一長任務耗時從 75 分鐘腰斬至 40 分鐘。 符號世界建模與科研躍升：在 FrontierMath Tier 4 達到 97.6%~98%、ExploitBench 獲 100%；支援在上下文即時生成領域速記語法（DSL）壓縮狀態，並能直接操作 KiCad、Blender 與 Unreal Engine 5 完成複雜 3D 與工程設計。 技術規格：1.05M Context Window / 128k 最大輸出 / 閉源商用（API 輸入 $10、輸出 $50 每百萬 Token，對標 Claude Fable 5.1） 傳送門：Simon Willison 深度整理 WeatherNext 3 — Google DeepMind &amp;amp;amp; Google Research 一言以蔽之：DeepMind 發表全球天氣預報模型 WeatherNext 3，解析度提升約 5 倍並實現每小時高頻動態更新。 核心亮點： 全球降水預報誤差銳減 50%：經 Brightband 獨立即時評測，降水預測誤差大幅降低達 50%，顯著改善過去極端風暴邊界誤判與模糊預估問題。 深入消費端與科研雲端：直接整合至 Google 搜尋、Gemini、Google 地圖，並透過 BigQuery 與 Earth Engine 全面開放給研究人員與企業存取。 技術規格：高解析度全球氣象模型 / 支援即時觀測同化 / 整合至 Google Cloud 與 Earth Engine 傳送門：Google DeepMind 官方部落格 K2 Horizon 模型家族 (0.9B 至 375B-A23B) — IFM 一言以蔽之：IFM 全面開源包含 6 款尺寸的 K2 Horizon 系列模型，並同步釋出完整的預訓練與微調生命週期資料。 核心亮點： 全尺寸覆蓋與同級 SOTA：包含 0.9B、3.7B、7B、32B、36B-A4B 與 375B-A23B，小引數量級在端側基準測試中均取得同級最高分。 MoVA 稀疏注意力架構：其中 36B-A4B 採用新型稀疏注意力架構（MoVA），在超長文字推理與推論吞吐量間達到極佳平衡。 技術規格：0.9B ~ 375B-A23B / Apache 2.0 開源協議 / 提供完整訓練日誌與權重 傳送門：IFM 官方技術發布頁 MAI-Transcribe 2 — Microsoft 一言以蔽之：微軟推出全新語音辨識模型 MAI-Transcribe 2，速度達到 GPT-Transcribe 的 10 倍、Gemini 3.5 的 5 倍。 核心亮點： 登頂 FLEURS 基準：支援 60 種語言自動識別、多語言程式碼混雜切換（Code Switching）、說話者分離（Speaker Diarization）與詞級時間戳標記。 極致價效比邊界：在 Artificial Analysis 的準確率-延遲性帕累託前沿名列第一，具備業界極具競爭力的 API 呼叫定價。 技術規格：多語言專用語音模型 / 登陸 Azure Foundry 與 OpenRouter / 極低延遲架構 傳送門： View post on X by @mustafasuleyman 在 X 上查看 @mustafasuleyman 的貼文 ↗</description></item><item><title>AI 日報｜Google 發布 Gemini 3.8 Flash 與 Cyber、Meta 推出 Muse Spark 1.3、Claude 支援背景電腦操作</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-03/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-03/</guid><pubDate>Thu, 03 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Google 發布 Gemini 3.8 Flash 與 Cyber、Meta 推出 Muse Spark 1.3、Claude 支援背景電腦操作 模型發布/更新 Gemini 3.8 Flash &amp;amp;amp; Gemini 3.8 Flash Cyber — Google DeepMind 一言以蔽之：Google 於 6 週內迎來第 3 次 Flash 重磅迭代，同步推出軟體工程強化版 Flash 與首款專用資安防禦模型 Flash Cyber。 核心亮點： 長程工程推理躍升：在 DeepSWE v1.1 評測中達到 73.7% 解決率，在提示詞注入（Prompt Injection）抵抗評測中被攻破率僅 5.5%（遠低於同級模型 50%+），大幅提升多步驟 Agent 自主容錯與驗證頻率。 專用資安旗艦版：同步推出的 3.8 Flash Cyber 在 CyberGym 基準測試中取得 86.2%、CWE-Bench 修復達 47.2%，並在內部 20 種程式語言的漏洞挖掘測試中展現超過 70% 的成功率。 技術規格：1M Context Window / 閉源商用（提供 Government &amp;amp;amp; Enterprise Fairwind 計畫）/ 輸入 $0.75、輸出 $3.75 每百萬 Token（2026 年底前優惠） 傳送門：Google DeepMind 官方部落格 Meta Muse Spark 1.3 — Meta 一言以蔽之：Meta 推出全新一代 Muse Spark 1.3，以極致價效比直逼第一梯隊前沿模型，並預告開源權重版本即將到來。 核心亮點： 價效比與長程任務強化：在 Artificial Analysis Intelligence Index 取得 61-62 分（逼近 Claude Fable 與 GPT-5.6），相較 1.2 版本減少 20% 工具呼叫與 25% Token 消耗。 主動協作機制：模型在長流程任務中具備自我邊界校準能力，能主動向使用者提出澄清問題，並在關鍵破壞性操作前主動請求確認。 技術規格：1M Context Window / 支援文字、圖片與 PDF 輸入 / Contributor 計費輸入 $0.10、輸出 $0.20 每百萬 Token 傳送門：Meta Developer 官方頁面 Claude Fable 5.1 &amp;amp;amp; Claude Mythos 5.1 — Anthropic 一言以蔽之：Anthropic 正式推出面向超複雜推理與長程 Agent 工作流程的全新旗艦模型 Fable 5.1 與 Mythos 5.1。 核心亮點： WebDev Code Arena 登頂：Fable 5.1（Max）以 1,765 分重新整理紀錄，以領先第二名 77 分的顯著差距重塑高階 Pareto 前沿線。 系統性快取大幅降價：快取讀取（Cache Read）價格調降達 75%，使長對話及多步驟 Agent 迴圈的整體呼叫成本降低 25% 至 31%。 技術規格：1M Context Window / 支援動態思考模式（Adaptive Thinking）/ 商用 API 與 Claude Pro/Max 傳送門：Anthropic 官方公告 Qwen3.8-Max-0902 — 阿里通義千問 一言以蔽之：通義千問升級旗艦模型 Qwen3.8-Max-0902，專門強化程式設計與協作後訓練，重新整理開源衍生架構在 Web 開發評測的高分紀錄。 核心亮點： 評測榜單新標竿：在 Code Arena: WebDev 上以 1,691 分位居綜合前列，在資料分析與消費級產品生成分類位列第一。 混合定價優勢：以每百萬 Token 輸入 $2、輸出 $6 的極具競爭力價格，提供 2.4T 引數規模與 1M 上下文處理能力。 技術規格：2.4T 總引數 / 1M Context Window / 支援 QwenCloud API 與顯式/隱式快取 傳送門： View post on X by @Alibaba_Qwen 在 X 上查看 @Alibaba_Qwen 的貼文 ↗</description></item><item><title>AI 日報｜NVIDIA 35 億美元投資聯發科、DeepSeek 開源視覺 Flash 模型、CrowdStrike 發表 SafeMind 資安系統</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-02/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-02/</guid><pubDate>Wed, 02 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜NVIDIA 35 億美元投資聯發科、DeepSeek 開源視覺 Flash 模型、CrowdStrike 發表 SafeMind 資安系統 模型發布/更新 DeepSeek-V4-Flash-Vision-Exp — DeepSeek 一言以蔽之：DeepSeek 正式開源具備原生多模態視覺能力的 Flash 實驗版模型。 核心亮點： 極致價效比與視覺賦能：維持每百萬 Token 輸入 0.22 美元、輸出 0.66 美元的極低定價水準，並賦予模型多模態影像理解與視覺推理能力。 雲端即刻支援：已同步於 Fireworks 等推理平臺以 Serverless 與 Priority 形式上線，評測表現全面超越先前純文字版本。 技術規格：開源權重 / 支援多模態視覺與文字 / 實驗版開源模型 傳送門：Hugging Face 模型頁面 TimesFM-3 基礎模型 — Google Research 一言以蔽之：Google 發表新一代時間序列基礎模型 TimesFM-3，原生支援多變數零樣本預測。 核心亮點： 原生多變數預測支援：突破以往單變數預測的架構限制，能直接處理複雜相互依賴的多維度時間序列。 零樣本泛化能力：無需在特定產業資料集上進行微調，即可在金融趨勢、氣象監測與工業感測器等場景展現 SOTA 級別的預測準確度。 技術規格：Transformer 架構 / 零樣本多變數時間序列基礎模型 / Google Research 傳送門：Google Research 官方部落格 混元 Hy4 Preview 輕量化壓縮版 (MIX-STQ1_0) — 騰訊混元 一言以蔽之：透過自研 Sherry 稀疏量化演演演算法，將原本 1.5 TB 的 Hy4 模型壓縮至 214 GB，大幅降低硬體部署門檻。 核心亮點： 1.25-bit 極限量化：採用 Sherry 稀疏三值量化演演演算法，將路由專家（MoE）層壓縮至平均 1.25 位元，落入檔案實際開銷僅約 1.31 bpw。 混合精度分層策略：根據校準集敏感度逐層設定位元精度（敏感層保留 2.06 bpw，非敏感層採 1.31 bpw），在維持推理速度與生產力任務表現的同時完整打通 llama.cpp。 技術規格：模型體積 214 GB（原 1.5 TB）/ MIX-STQ1_0 混合精度 / 支援 llama.cpp 傳送門：騰訊混元官方公告 產品發布/更新 SafeMind Agentic 資安防禦系統 — CrowdStrike × NVIDIA 更新內容：CrowdStrike 聯手 NVIDIA 於 Fal.Con 2026 大會發表 SafeMind 攻防 Agent 系統。該系統以 AI Agent 自動模擬受控的全新攻擊路徑，並將遙測資料即時轉化為偵測防禦規則，甚至能在未見過的全新攻擊中達成高達 100% 的捕獲率。 適用人群：[企業資安長 (CISO) / 資安維運工程師 / SecOps 團隊] 體驗通道：NVIDIA 官方部落格 Perplexity Computer 混合運算與 PII-Tracer — Perplexity 更新內容：Perplexity 推出 Hybrid Compute 混合運算架構，使用者在執行分析任務時可在雲端啟動，並在涉及敏感個資或機密檔案時切換至 Mac 本機模型執行；同步開源端側個資偵測工具 PII-Tracer。 適用人群：[高度重視資料隱私的專業人士 / 企業分析師 / 開發者] 體驗通道： View post on X by @perplexity_ai 在 X 上查看 @perplexity_ai 的貼文 ↗</description></item><item><title>AI 日報｜Hermes Agent v0.21.0 釋出、OpenAI Codex 活躍使用者突破 2500 萬、xAI Grok 迎來微軟生態外掛與 Linux 支援</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-09-01/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-09-01/</guid><pubDate>Tue, 01 Sep 2026 08:00:00 +0800</pubDate><description>AI 日報｜Hermes Agent v0.21.0 釋出、OpenAI Codex 活躍使用者突破 2500 萬、xAI Grok 迎來微軟生態外掛與 Linux 支援 模型發布/更新 Hermes Agent v0.21.0 (Pantheon Release) — Nous Research 一言以蔽之：Nous Research 正式釋出 Hermes Agent v0.21.0，引入突破性的「Bot Mode」與多 AI Agent 協同群組聊天架構。 核心亮點： 內建 Bot Mode：讓多個具備專屬外觀與角色的 AI Agent 組成社群，彼此透過群組聊天協同合作，如同專業團隊而非單一工具箱。 支援定時任務（Cron Jobs）記憶與連續性、即時調整子 AI Agent（Subagent Steering）及增強的瀏覽器操控能力。 技術規格：開源多 AI Agent 框架 / 支援 Agent 間通訊 (A2A) / 桌面端整合 傳送門：GitHub 官方釋出公告 產品發布/更新 Grok Build v1.0.15 與 Grok Bot 微軟生態外掛 — xAI 更新內容：xAI 針對 Grok Build 推出 v1.0.15 更新，大幅提升會話開關速度與首條回覆延遲；同時 Grok Bot 正式推出 Microsoft 整合外掛，深度打通 Outlook、Calendar 與 OneDrive，並新增 Linux (AppImage / RPM) 官方下載支援。 適用人群：[開發者 / 企業辦公族 / Linux 使用者] 體驗通道： View post on X by @cb_doge 在 X 上查看 @cb_doge 的貼文 ↗</description></item><item><title>AI 日報｜Uber 70% 程式碼 PR 透過 AI Agent 接管成本降 52%；Redwood 實現 AI 兩周自主設計晶片；MiniMax H3 Max 登陸 Vercel AI Gateway 享 50% 折扣</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-08-31/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-08-31/</guid><pubDate>Mon, 31 Aug 2026 08:00:00 +0800</pubDate><description>AI 日報｜Uber 70% 程式碼 PR 透過 AI Agent 接管成本降 52%；Redwood 實現 AI 兩周自主設計晶片；MiniMax H3 Max 登陸 Vercel AI Gateway 享 50% 折扣 模型發布/更新 MiniMax H3 Max 與即時互動影音流 — MiniMax / fal / Vercel 一言以蔽之：MiniMax 攜手 fal 在 Vercel AI Gateway 推出 H3 與 H3 Max 影音生成模型 50 % 折扣，並衍生出支援每幀即時生成的無限直播流專案。 核心亮點： H3 Max 針對速度進行極致最佳化，480p 與 768p 渲染速度超越即時播放，支援文字提示詞與起始畫面快速生成。 社群結合 fal 引擎打造出「Infinite Slop」無限互動直播，聊天室內的每一則訊息皆能即時驅動並生成下一幀故事畫面。 技術規格：H3 / H3 Max 影音生成模型 / 支援非同步 Webhook 與狀態輪詢 傳送門：Vercel 官方更新公告 產品發布/更新 ChatGPT 桌面端效能重大更新 — OpenAI 更新內容： OpenAI 團隊針對 ChatGPT 桌面應用推送重大效能更新，由工程師 Brent Traut 主導最佳化，徹底解決長對話卡頓與記憶體佔用過高問題。 長執行緒（Thread）的載入速度提升超過 90 %，同時長執行緒的記憶體佔用大幅降低超過 90 %，顯著提升日常高頻使用的流暢度。 適用人群：[軟體工程師 / 企業工作者 / ChatGPT 桌面端使用者] 體驗通道： View post on X by @thsottiaux 在 X 上查看 @thsottiaux 的貼文 ↗</description></item><item><title>AI 日報｜騰訊開源 Hy4 Preview 旗艦模型、MiniMax H3 Max 超即時影片生成與 Notion AI 推出 Custom Agents API</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-08-30/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-08-30/</guid><pubDate>Sun, 30 Aug 2026 08:00:00 +0800</pubDate><description>AI 日報｜騰訊開源 Hy4 Preview 旗艦模型、MiniMax H3 Max 超即時影片生成與 Notion AI 推出 Custom Agents API 模型發布/更新 Tencent Hy4 Preview — 騰訊 (Tencent) 一言以蔽之：騰訊正式發布並開源下一代大語言模型 Tencent Hy4 Preview，具備 770B 總引數與 1M token 上下文視窗，全面鎖定真實生產力任務。 核心亮點： 總引數達 770B（啟動引數 49B），支援高達 1M token 的超長上下文視窗，在程式碼編寫、日常辦公與前沿科研等真實場景中表現亮眼。 聊天範本（chat_template）中內建兩種推理強度層級設定：「high」（預設）與「no_think」（停用推理），提供更具彈性的運算排程能力。 技術規格：770B 總引數（49B 啟動） / 開源權重（Open Weight） / 1M token 上下文視窗 傳送門：騰訊官方公告 MiniMax H3 Max — MiniMax / fal 一言以蔽之：基於 MiniMax H3 基礎模型，由 fal 透過自研後訓練與推理技術改造的 H3 Max 正式亮相，實現超越即時（faster-than-real-time）的高品質影片生成。 核心亮點： 結合 SOTA 級別的影片畫質與突破性的生成速度，使高畫質影片生成在各類大規模真實應用中變得切實可行。 支援無限串流與長時間動態生成（如社群上已出現串接 Twitch 直播的應用），展現開放權重生態的強大想像力。 技術規格：多模態影片生成 / 開源權重改造 / 超即時推理延遲最佳化 傳送門： View post on X by @MiniMax_AI 在 X 上查看 @MiniMax_AI 的貼文 ↗</description></item><item><title>AI 日報｜GLM-5.3 與騰訊 Hy4 預覽版重磅開源，Anthropic 自主對齊研究突破，Grok Bot 支援網購與 Stripe 支付</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-08-29/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-08-29/</guid><pubDate>Sat, 29 Aug 2026 08:00:00 +0800</pubDate><description>AI 日報｜GLM-5.3 與騰訊 Hy4 預覽版重磅開源，Anthropic 自主對齊研究突破，Grok Bot 支援網購與 Stripe 支付 模型發布/更新 GLM-5.3 系列模型 — Z.ai 一言以蔽之：Z.ai 正式開源旗艦模型 GLM-5.3 及其輕量高效版 GLM-5.3-Flash，專為複雜軟體工程與網路防禦打造，全面支援 1M 超長上下文。
核心亮點：
在程式碼編譯、網安任務與長時程 AI Agent 工作負載上展現頂尖效能。
支援 OpenRouter 與各大 API 平臺，其中 GLM-5.3-Flash 以極高價效比在開源社群引發熱烈關注。
技術規格：開源權重 (Open-weight) / 1M 上下文 / 支援智慧代理與資安任務
傳送門： View post on X by @Zai_org 在 X 上查看 @Zai_org 的貼文 ↗</description></item><item><title>騰訊推出 WeMM-Embedding：全新多模態向量嵌入模型，支援影像與影片檢索</title><link>https://www.communeify.com/tw/blog/tencent-wemm-embedding-multimodal-model/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/tencent-wemm-embedding-multimodal-model/</guid><pubDate>Fri, 28 Aug 2026 11:29:41 +0800</pubDate><description>探索 WeMM-Embedding：騰訊微信團隊的通用多模態向量模型 在處理視覺資料時，將圖片、影片及複雜文件轉換為向量（Embedding）是多模態應用的核心。騰訊微信視覺團隊近期發布了 WeMM-Embedding，這是一套將文字、影像與影片統一表示的通用多模態向量模型系列，為跨模態檢索、推薦系統及代理（Agentic）工作流提供強大的基建。
這套模型簡化了跨模態檢索與理解的流程，以下是該技術的重點整理。
圖片來源: GitHub - Tencent/WeMM-Embedding: WeMM-Embedding is a family of universal multimodal embedding models by the WeChat Vision Team at Tencent, supporting multimodal understanding and retrieval. · GitHub
核心功能與基座架構 WeMM-Embedding 的核心優勢在於它能將多種輸入類型——包含文字、影像、影片、視覺文件以及任意交錯的多模態輸入（Interleaved Multimodal Inputs）——萃取並對齊至同一個統一的向量空間。
模型基座：本系列模型是基於強大的 Qwen3.5 系列模型（如 Qwen3.5-2B-Base、Qwen3.5-4B-Base、Qwen3.5-9B-Base）進行微調與開發，繼承了其優異的跨模態理解能力。 向量提取機制：開發者只需將多模態資料輸入模型，在指定的 &amp;amp;lt;embedding&amp;amp;gt; 專用 token 位置提取最後一層的隱藏狀態（Last-layer Hidden State），隨後進行 L2 正規化（L2 Normalization），即可獲得高品質的向量表示。 模型規格與 Matryoshka 維度自適應技術 WeMM-Embedding 提供了 2B、4B 及 9B 三種參數規模，以對應從輕量級邊端到高精度雲端部署的不同運算需求。
值得注意的是，該系列原生支援 Matryoshka 向量表徵技術（Matryoshka Representation Learning, MRL）。這項技術允許開發者根據實際儲存與檢索效能需求，彈性截斷向量維度，而無須重新訓練模型：
WeMM-Embedding-2B：支援維度包含 64, 128, 256, 512, 1024, 2048（預設滿維度）。以 2B 模型為例，即便將維度從 2048 大幅縮減至 256，在 MMEB-v2 基準測試上，模型仍能保留高達 98.7% 的影像與影片檢索效能。 WeMM-Embedding-4B：支援維度包含 64, 128, 256, 512, 1024, 2560（預設滿維度）。 WeMM-Embedding-9B：支援維度包含 64, 128, 256, 512, 1024, 2048, 4096（預設滿維度）。 這項技術能顯著減少大規模向量檢索系統（如 Vector DB）的儲存硬體成本，並極大地提升首字比對與推論速度。</description></item><item><title>IBM Granite 4.2 LLMs 解析：打造強大推理與代理人能力的技術核心</title><link>https://www.communeify.com/tw/blog/ibm-granite-4-2-llm-analysis/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ibm-granite-4-2-llm-analysis/</guid><pubDate>Fri, 28 Aug 2026 11:27:47 +0800</pubDate><description>深入解析 Granite 4.2：推理模型的構建之道 AI 模型若要具備真正的推理能力，光靠參數堆疊已經不夠。IBM 推出的 Granite 4.2 系列試圖解決這個問題，重點在於強化模型處理複雜任務、工具調用以及代理（Agentic）行為的表現。
圖片來源: Granite 4.2 LLMs: How They&amp;amp;rsquo;re Built
什麼是 Granite 4.2？ Granite 4.2 是該系列中首個專注於推理的稠密型（Dense）、純解碼器（Decoder-only）架構模型，提供 3B、8B 及 30B 三種尺寸。
在能力分佈上，這三種尺寸皆原生支援靈活的「思考」機制：面對簡單請求時，模型可關閉思考或採用低負擔模式（Low-effort Mode）以節省推理預算與時間；而面對複雜問題時，則會自動啟動完整的鏈式思維（Chain-of-Thought），於 &amp;amp;lt;think&amp;amp;gt;...&amp;amp;lt;/think&amp;amp;gt; 標籤內進行逐步推理後再輸出答案。
然而，不同尺寸間最核心的差異並非思考機制，而是「代理能力（Agentic Capability）」。全系列中僅有 8B 和 30B 模型 在 post-training 中經歷了專門的「代理強化學習（Agentic RL）」階段，使其能夠在真實的沙盒環境中編輯程式碼、操作終端機以及進行網頁搜尋；而 3B 模型則屬於強大的基礎推理模型，並未包含此代理 RL 模組。
架構設計 Granite 4.2 採用了高效能 Transformer 架構的先進配置，以確保訓練與推理的極致效率：
注意力機制：全系列採用分組查詢注意力（Grouped Query Attention, GQA）。3B 模型配置 40 個注意力頭與 8 個 KV 頭；而 8B 與 30B 模型則配置 32 個注意力頭與 8 個 KV 頭。此設計在維持模型表達能力的同時，顯著降低了推理時的顯存（VRAM）佔用。 位置編碼：採用旋轉位置編碼（Rotary Position Embedding, RoPE），並將 Base Theta ($\theta$) 設為極高的 10,000,000（一千萬），以穩健支援超長序列資訊。 激活函數：使用 SwiGLU 提升前饋網路（FFN）的表達能力。 歸一化：採用 RMSNorm（$\epsilon = 1\times 10^{-5}$）。 數值精度：全系列採用 bfloat16，確保萬億級 Token 訓練與部署時的數值穩定性。</description></item><item><title>AI 日報｜Google 發表 Gemini 3.5 Transcribe 與 Omni 1.1 Flash 影片控制升級；Anthropic 公布模型硬體標準 (MHS)</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-08-28/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-08-28/</guid><pubDate>Fri, 28 Aug 2026 11:17:00 +0800</pubDate><description>AI日報｜實體設備控制標準 MHS、雙盲評估機制與 Luna Reserve 備用功能解析 今天的 AI 圈有幾個有趣的基礎建設進展。相比於模型參數的堆疊，產業界開始把注意力轉向如何讓 AI 更好地與現實世界互動，以及如何更客觀地衡量它們。這期我們來看看 Anthropic 針對硬體設備制定的新標準，以及 DeepMind 試圖解決「跑分作弊」的雙盲測試計畫。
快訊 模型發布/更新 Gemini 3.5 Transcribe — Google 一言以蔽之：Google 正式推出迄今最精準的語音轉文字基礎模型 Gemini 3.5 Transcribe，全面支援即時串流傳輸與預錄音訊的高精度轉寫。
核心亮點：
專為高噪音、多語系環境最佳化，轉寫準確率較前代產品大幅提升。
原生支援透過 Live API 和 Interactions API 進行低延遲呼叫，滿足各類即時語音互動與 AI 代理語音外撥場景。
技術規格：語音轉文字基礎模型 / 支援串流與預錄音訊處理 API
傳送門：Google 官方部落格
Midjourney V8.2 圖像編輯模型 — Midjourney 一言以蔽之：Midjourney 開啟 V8.2 圖像編輯模型測試，深度融合指令式編輯、多圖混合參考與無縫擴圖能力。
核心亮點：
支援最多同時引用 4 張參考圖進行圖生圖，能夠精準理解複雜的自然語言局部修改指令。
完美相容個人化偏好、moodboards 與 srefs 風格遷移功能，網頁端與 Discord 的 --edit 指令同步上線。
技術規格：多模態圖像生成與編輯模型 / 支援網頁端與 Alpha 終端測試
傳送門：Midjourney 官方更新日誌</description></item><item><title>Breeze TTS 2 開源登場：即時互動與高擬真語音生成的強大引擎</title><link>https://www.communeify.com/tw/blog/breeze-tts-2-open-source-engine/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/breeze-tts-2-open-source-engine/</guid><pubDate>Fri, 28 Aug 2026 11:09:48 +0800</pubDate><description>Breeze TTS 2：語音合成的新選擇 當電腦學會嘆氣或清嗓子，人機對話的感覺就完全不同了。過去的語音合成技術大多語氣平淡，Breeze TTS 2 則試圖改變這一點。這款於 2026 年 8 月 25 日甫釋出的 3B（30億參數）語音合成模型，支援中英文雙語，讓文字轉語音不只是朗讀，還能帶有情緒與生命力。
圖片來源: BreezeBlue/Breeze-TTS-2 · Hugging Face
View post on X by @ArtificialAnlys 在 X 上查看 @ArtificialAnlys 的貼文 ↗ 什麼是 Breeze TTS 2？ 這是一個專為即時互動開發的語音合成模型。在權威 AI 評測機構 Artificial Analysis 的 TTS 競技場（Speech Arena）最新數據中，它成功登頂開放權重（Open-weight）模型榜首，在表現力與音質上甚至超越眾多知名的開源與商業系統。</description></item><item><title>AI 日報｜Amazon 加訂 200 萬顆 NVIDIA GPU；Meta 發表 Muse Image；Gemini Live 個人智慧升級</title><link>https://www.communeify.com/tw/blog/ai-daily-2026-08-27/</link><guid isPermaLink="true">https://www.communeify.com/tw/blog/ai-daily-2026-08-27/</guid><pubDate>Thu, 27 Aug 2026 08:00:00 +0800</pubDate><description>AI 日報｜Amazon 加訂 200 萬顆 NVIDIA GPU；Meta 發表 Muse Image；Gemini Live 個人智慧升級 模型發布/更新 Wan 3.0 Prime — 阿里永珍 (Alibaba Wan) 一言以蔽之：阿里永珍推出 Wan 3.0 Prime 影片生成加速模型，生成速度相較標準版提升 7 倍，支援單次生成 30 秒音畫同步高畫質影片。 核心亮點： 超快推論與長秒數生成：推論速度提升 7 倍，能在單次請求中直接生成長達 30 秒、具備高擬真視覺與原生音訊的 720p 影片。 多參考圖工作流：支援輸入最多 20 張參考影像，大幅改善特定人物角色、場景構圖與風格的多角度一致性，已全面上線 Replicate 與 Pika API。 技術規格：影片生成模型 / 支援文生影片、圖生影片與 20 圖參考工作流 / 單次 30 秒生成 傳送門：https://replicate.com/alibaba/wan-3-prime Muse Image — Meta Superintelligence Labs 一言以蔽之：Meta 推出首款旗艦影象基礎模型 Muse Image，將文字生成影象與基於指令的區域性影像編輯無縫整合於單一架構中。 核心亮點： 生圖與編輯一體化：使用者無需在生圖模型與修圖模型之間切換，輸入提示詞可生成全新影象；若附帶輸入影像與修改指令，模型會智慧保持主體一致並僅調整指定區域性。 風格導引與雲端生態上架：支援輸入多張參考影像以提取筆觸色彩進行風格融合，首波已登陸 Runway 平臺與 Vercel AI Gateway。 技術規格：影象生成與編輯多模態模型 / 支援單圖與多圖風格參考 / AI SDK meta/muse-image-1.0 傳送門：https://vercel.com/changelog/muse-image-now-available-on-ai-gateway Tenet — Harvey × Fireworks AI 一言以蔽之：法律科技獨角獸 Harvey 攜手 Fireworks AI 推出首款自研法律專業長程推理模型 Tenet。 核心亮點： 長程法律推理任務翻倍：以 Kimi K3 為基礎模型，透過非同步強化學習（Async RL）進行後訓練（Post-training），在複雜法律評測 LAB 上的任務解決率提升近一倍。 極致成本控制：透過獎勵塑形（Reward Shaping）最佳化 Token 效率，在效能大幅躍升的同時，單項 LAB 任務執行成本僅 5.92 美元（基準模型為 5.62 美元）。 技術規格：法律專業領域強化學習微調模型 / 基於 Kimi K3 / 非同步 RL 後訓練 傳送門：https://fireworks.ai/blog/post-training-tenet Hy-MT2-1.8B 2-bit / 1.25-bit 極致量化版 — 騰訊混元 (Tencent Hunyuan) 一言以蔽之：騰訊混元將 1.8B 端側翻譯模型壓縮至 440MB，翻譯品質幾乎無損，並已在嗶哩嗶哩直播彈幕實時翻譯中正式落地。 核心亮點： 創新極低位元量化架構：採用獲 ACL 2026 Oral 的自研 Sherry（1.25-bit 稀疏高效三值量化）與 SEQ（2-bit 拉伸彈性量化），將原本 3.3GB 模型大幅縮減至 440MB 與 574MB。 端側即時推論與無損品質：聯合 Intel 完成 x86 SIMD 運算元最佳化，單條彈幕翻譯延遲僅 500~800ms，在 FLORES-200 評測中超越主流商業翻譯 API。 技術規格：1.8B 引數量化模型（1.25-bit / 2-bit）/ 記憶體佔用 440MB~574MB / 支援 33 種語言互譯 傳送門：https://mp.weixin.qq.com/s/f1a5cf87eb06015cbe995bd5ef8b5d0a 產品發布/更新 Gemini Live「Personal Intelligence」個人智慧升級 — Google 更新內容：Gemini Live 迎來重磅生產力升級，新增「Personal Intelligence」記憶機制，能主動串聯使用者的歷史對話以及 Gmail、Google 相簿、YouTube 等生態應用，並推出「Daily Brief」與「Gemini Spark」主動任務代理，讓語音互動能直接跨 App 委派日常待辦事項。 適用人群：一般大眾、行動辦公族、Google 生態重度使用者 體驗通道：https://blog.google/innovation-and-ai/products/gemini-app/productivity-features-gemini-live/ Brain 自我改進記憶系統 — Perplexity Computer 更新內容：Perplexity 為其 Computer 平臺推出自研記憶架構「Brain」，透過背景執行的「Dream agents」將歷史工作階段、上傳檔案與網路檢索源自動編譯成結構化知識 Wiki。在評測中使回答準確率提升 9.3 分、時效性提升 8.0 分，並節省 15% 的 Token 消耗。 適用人群：深度研究人員、資料分析師、重度知識工作者 體驗通道：https://perplexity.ai/hub/blog/brain-self-improving-memory DataGrip 內建 AI Agent MCP 工具鏈 — JetBrains 更新內容：JetBrains 旗下資料庫 IDE DataGrip 全面匯入 MCP（Model Context Protocol）伺服器，開發者可直接掛載 Claude Code、Codex 等 AI Agent，透過自然語言查詢資料庫架構（Talk to Your Schema）、執行自然語言轉 SQL、自動偵測孤立資料表並進行相依性安全檢查。 適用人群：後端工程師、DBA、資料分析師 體驗通道：https://blog.jetbrains.com/datagrip/2026/08/26/ai-agents-in-datagrip/ Visual Studio Debugger 測試驅動（TDD）AI 調查工作流 — Microsoft 更新內容：微軟升級 Visual Studio 的 Debugger Agent，新增測試驅動調查模式（Test-Driven Investigation）。Agent 能根據難以重現的異常報錯或堆疊資訊自動建構最小重現測試案例，進入中斷點深入調查根因，並在修正程式碼後自動重跑測試進行閉環驗證。 適用人群：.NET / C++ / C# 開發者、軟體工程團隊 體驗通道：https://devblogs.microsoft.com/visualstudio/the-visual-studio-debugger-agentic-workflow-gets-a-test-driven-upgrade/ Vercel Security Dashboard 正式邁入 GA — Vercel 更新內容：Vercel 推出安全儀錶板（Security Dashboard）全面開放使用，並同步釋出 vercel security check CLI 指令。可自動掃描專案中因 AI 快速建立專案而遺留的未啟用 2FA、長期憑證、公開預覽部署或過期環境變數等安全漏洞，並支援與 AI Agent 聯動自動修復。 適用人群：全端開發者、DevOps 工程師、資安管理人員 體驗通道：https://vercel.com/changelog/vercel-security-dashboard-is-now-generally-available 產業動態 亞馬遜擴大合作追加 200 萬顆 NVIDIA GPU 訂單 — Amazon AWS / NVIDIA 事件概述：亞馬遜與 NVIDIA 宣佈大幅擴大戰略合作，亞馬遜 AWS 將在 2027 至 2028 年間新增採購 200 萬顆 NVIDIA 頂級 GPU，涵蓋 Blackwell Ultra、Rubin 及 Rubin Ultra 架構晶片。此項採購將原定訂單規模直接翻升至三倍，交易總額預計達數百億美元。 影響分析：凸顯出雲端超大規模運算服務商對次世代 AI 算力的龐大渴求，NVIDIA 藉由鎖定雲端巨頭未來數年的資本支出，進一步夯實其在 AI 基礎設施領域的主導地位。 新聞連結：https://techcrunch.com/2026/08/26/amazon-just-tripled-its-order-of-nvidia-chips-over-surging-demand Figure 啟動「Index」專案：投入 10 億美元全球眾包機器人物理互動資料 — Figure AI 事件概述：人形機器人新創 Figure 推出名為「Index」的全球資料採集計畫，並在 iOS 與 Android 上線同名 App。該專案已覆蓋全球 108 個國家、累積逾 1,600 萬條真實世界任務操作影片；Figure 宣佈未來 12 個月內將在資料與算力資源上投入超過 10 億美元，專為其 Helix 視覺-語言-動作（VLA）模型構建物理世界訓練集。 影響分析：具身智慧（Embodied AI）正面臨從文字走向實體物理空間的「資料之牆」，透過大規模眾包採集人類日常行為資料，有望加速通用人形機器人泛化能力的成熟。 新聞連結：https://mp.weixin.qq.com/s/0996e3ce5eb9638b5fb85ae7e587428e Anthropic 推出 Anthropic Insights，首度開放 25 萬條真實對話資料供學術界研究 — Anthropic 事件概述：Anthropic 宣佈透過隱私保護分析工具 Anthropic Insights，向史丹佛大學 SALT Lab、牛津大學人類資訊處理實驗室（HIP Lab）及評估機構 METR 開放約 25 萬段 2026 年春季的 Claude.ai 與 Claude Code 真實互動資料，供學術界獨立評估 AI 對人類決策與生產力的實際影響。 影響分析：過去前沿模型的真實互動資料均被封閉在商業實驗室內部，此次開放為學術界研究人機協同的深層心理學、社會經濟學影響樹立了透明化典範。 新聞連結：https://www.anthropic.com/research/enabling-independent-research 論文研究 Agent Handoff Tax：多模型接力協作中的隱形延遲與精度損耗 — AWS AI Labs 研究動機：當前 AI Agent 系統普遍採用「廉價小模型先行，遇到困難再動態升級（Escalate）至旗艦大模型」的路由架構，然而跨模型接力對最終任務品質與成本的真實影響尚缺乏嚴謹量化。 核心創新：AWS AI Labs 針對 Claude 與 GPT 系列多款模型進行軌跡接力（Trajectory Handoff）實驗，測量接收模型在接續其他模型生成的軌跡時所產生的效能折損。 研究成果：研究發現「向上升級（Escalation）」僅能彌補不到一半的模型能力差距，且大幅增加了 Token 成本（即 Handoff Tax）；反之「向下降級（Downshifting，大模型規劃、小模型執行）」具備極高價效比。此外，升級時適度「裁剪（Pruning）」小模型的冗長歷史軌跡反而能顯著提升大模型的接力解決率。 論文地址：https://arxiv.org/abs/2608.24358 評測基準的真相：Agent 鷹架架構（Harness）對跑分的影響遠超基礎模型 — 獨立評測團隊 研究動機：在各類 Coding 與 Agent 榜單中，得分通常被完全歸功於基礎 LLM，然而模型與外部工具/環境間的「鷹架（Harness）」層在得分中扮演的角色長期被忽視。 核心創新：在固定任務順序、執行環境與評測指令碼的嚴格對照下，針對 3 款前沿模型與 3 種主流 Harness 配置在 SWE-bench Verified 上進行網格交叉測試。 研究成果：實驗顯示，僅更換 Harness 即可使同一模型（如 GLM-5.1）的跑分產生高達 13.0 分的劇烈波動；鷹架引發的跑分方差是模型本體方差的 7.8 倍，甚至導致 66% 的模型排名出現逆轉。 論文地址： View post on X by @omarsar0 在 X 上查看 @omarsar0 的貼文 ↗</description></item></channel></rss>