
{: width=“100%” }
圖片來自OpenAI ChatGPT-4o Mini{:target="_blank"}
7月18日,OpenAI宣布推出ChatGPT-4o Mini,這是一款旨在為使用者提供更高效且經濟的新型人工智能模型。這個新模型不僅在性能上優於ChatGPT-3.5 Turbo,還將使用成本大幅降低,為開發者和企業帶來新可能。
ChatGPT-3.5的進化
- 更高智能:在MMLU測試中,ChatGPT-4o Mini獲得82%的高分,遠勝於ChatGPT-3.5 Turbo的69.8%。
- 價格優勢:ChatGPT-4o Mini的價格比ChatGPT-3.5 Turbo低60%以上,每百萬輸入token僅需0.15美元,輸出token每百萬只需0.60美元。
- 語言能力提升:該模型在非英語語言的理解和應用能力上有明顯進步。
- 上下文視窗擴展:擁有128k的上下文窗口,支援16k的輸出token,知識截止日期更新至2023年10月。
功能特點
- 多模態功能:目前支援文本和視覺,未來將增加音頻與視頻功能。
- 適用場景:
- 高容量任務:例如傳遞完整的代碼庫或對話歷史。
- 成本敏感任務:如總結大型文檔。
- 快速回應任務:如客戶支持聊天機器人。
- 批處理優惠:批處理API享受50%折扣,適用於24小時內的異步批處理作業。
- 即將推出的功能:未來幾天將推出微調功能。
結論
ChatGPT-4o Mini的推出為開發者和企業提供了高智能、經濟實惠的AI選擇,不僅在性能上優於ChatGPT-3.5 Turbo,還降低了成本。OpenAI建議使用ChatGPT-3.5 Turbo的開發者轉向ChatGPT-4o Mini,以提升智能和降低開支。無論是聊天完成API、助手API還是批處理API,ChatGPT-4o Mini都將為使用者帶來更多價值和可能性。

DMflow.chat
DMflow.chat: 您的智能AI夥伴,提升客戶互動、創造卓越體驗。
Learn More
videoweaver.app
Video Weaver: 瀏覽器內完成專業影片剪輯,無需下載、即刻創作。
Learn More
DMflow.chat
探索DMflow.chat,立即開啟AI驅動的客戶服務新時代。
Learn More
scribis.app
Scribis: 字幕編輯、語音轉錄文字、即時顯示轉錄文字。
Learn More
DMflow.chat
DMflow.chat: 您的智能AI夥伴,提升客戶互動、創造卓越體驗。
Learn More
videoweaver.app
Video Weaver: 瀏覽器內完成專業影片剪輯,無需下載、即刻創作。
Learn More
DMflow.chat
探索DMflow.chat,立即開啟AI驅動的客戶服務新時代。
Learn More
scribis.app
Scribis: 字幕編輯、語音轉錄文字、即時顯示轉錄文字。
Learn MoreRecommended for You
開源長程 AI 新標竿:dots3-note Preview 模型發布,支援 512K 上下文與多模態 AI Agent 操作
邁向服務真實生活的 AI Agent:dots3-note Preview 簡介 在人工智慧發展的進程中,我們一直希望能構建出真正能解決生活問題的 AI。這需要模型不只是感知世界或進行複雜推理,更要具備主動性與持續學習的能力,能夠隨著世界的變化和與用戶的交互而不斷進化。 為此,小紅書團隊旗下 dots studio 正式開源了 dots3-note Preview。這是 dots3 智慧體模型家族(家族規劃包括 note、jazz 與 aria,用以覆蓋不同的任務複雜度、響應速度與計算成本)中首款開源且最輕量的多模態 Mixture-of-Experts (MoE) 基礎模型。模型採用 Apache 2.0 協議發布,在多項封閉可驗證任務、長程 Agent 任務及多模態感知評測中,展現出比肩甚至超越數倍於其尺寸的大模型之卓越實力。 圖片來源: dots-studio/dots3-note-prev · Hugging Face 🛠️ 極致的輕量化與多模態架構 dots3-note Preview 擁有 280B 總參數,推論時實際僅需 16B 激活參數,這使其在保持極高計算效率與低延遲的同時,依然具備強悍的長文本與多模態理解能力。它原生支援高達 512K 字符的超長上下文視窗,可同時理解與處理文本、圖像、影片(包含影片內嵌音軌)以及語音等跨模態輸入。 其底層硬核架構規格如下: 架構屬性規格參數 骨幹類型混合專家多模態解碼器(Multimodal MoE)參數規模280B 總參數 / 16B 激活參數多代幣預測 (MTP)1 個共享層(1.13B 參數),顯著最佳化多步生成效率網路層數1 個稠密層(Dense) + 45 個稀疏專家層(MoE)專家路由機制256 個總專家 + 1 個共享專家,推論時動態路由啟用 Top-8 專家隱藏層維度 (Hidden Size)5120FFN 隱藏維度13824(稠密層) / 1536(每個專家獨立維度)注意力機制排程13 個全域雙自我注意力(DSA,Top-2048) + 33 個滑動視窗注意力(SWA)交替 (~1:3)視覺編碼器MoE ViT 架構(總參數 7B,推論激活 1.2B)語音編碼器稠密語音特徵提取器(800M 參數)支援精度與格式原生 BF16 與 FP8 極低精度推論 🧠 TEMPO 技術:自我評價與長程任務強化訓練 在開發能夠執行長程複雜任務的 AI Agent 時,傳統的強化學習面臨兩大工程瓶頸:一是 Agent 完成一次探索往往需要十餘個小時,訓練效率極其低下;二是稀疏的外部反饋(Sparse Rewards)使得模型難以進行有效的信用分配(Credit Assignment)。PPO 等 Actor-Critic 方法雖然能緩解此問題,但傳統 Critic 僅能透過固定算力的前向計算來估算價值,無法像 Actor 一樣透過多步推理、反思或調用工具來動態推導狀態好壞。
LG AI 發表強大開源模型 K-EXAONE 2.0:750B 參數量與頂尖 Agent 能力
探索 LG AI 最新模型:K-EXAONE 2.0 功能與部署指南 在人工智慧邁向「具身智慧」與「自主代理(Agentic AI)」的時代,LG AI Research 正式推出了全新旗艦級開源多語言混合專家模型(MoE)—— K-EXAONE 2.0。 這款模型絕非單純的參數規模擴展,而是透過創新的**「向上循環(Upcycling)」**技術、多階段持續預訓練(Continual Pre-training),以及專為長文本與安全性設計的對齊微調,使其在邏輯推理、程式開發與工具調用上,具備了與頂尖開源模型一較高下的實力。 圖片來源: LGAI-EXAONE/K-EXAONE-2.0-750B-A37B · Hugging Face 一、 核心架構與技術特性 K-EXAONE 2.0 擁有 7,500 億(750B)總參數,在推論時每個 Token 實際激活的運作參數僅為 370 億(37B)。這種「大體積、輕量推論」的 MoE 架構在多項硬體適應指標上實現了極佳的平衡,其核心技術規格與設計亮點如下: 1. 深度與寬度的雙向「向上循環」(Upcycling) 開發團隊直接對前代 K-EXAONE(236B)進行模型結構擴充,使其規模擴大至三倍以上。為了解決極深層模型在訓練與推論中常見的「梯度與激活值爆炸」難題,K-EXAONE 2.0 在雙 SwiGLU 分支後引入了數值夾緊機制(Clamping after two SwiGLU branches),顯著穩固了 78 層(2 層 Dense 頭 + 76 層 Sparse MoE)超深層網路的數值流。 2. 混合注意力機制(Hybrid Attention Matrix) 為了優化長文本處理的記憶體(VRAM)開銷,K-EXAONE 2.0 摒棄了全域自注意力的單一做法,改採高度精細化的混合結構: 全域注意力(Global Attention): 基於無位置編碼(NoPE)架構。 滑動視窗注意力(Sliding Window Attention, SWA): 包含 4096 窗口大小的局部 SWA 層,以及多個由「3層 128 窗口局部 SWA + 1層全域自注意力」組成的混合 Block,在提供高達 256K(262,144 tokens) 的超長上下文窗口之餘,極大程度壓縮了 KV 快取的硬體佔用。 3. 混合專家(MoE)與門控細節 總專家數: 256 個 MoE 專家 + 1 個始終激活的共享專家(Shared Expert)。 激活配置: 每次推論時,路由會精準激活其中的 8 個專家。 詞彙表規模(Vocab Size): 擴大至 153,600,且原生支援的語言從 6 種全面擴展至 10 種多國語言(韓語、英語、西班牙語、德語、日語、越南語、法語、義大利語、波蘭語與葡萄牙語)。 二、 卓越的基準測試表現 (Benchmarks) K-EXAONE 2.0 BF16 模型在多個權威基準測試中展現出頂尖的開源競爭力,特別是在長文本檢索、代碼代理與安全性指標上表現優異:
Mage-VL:微軟推出高效能 codec-native 串流多模態模型,影音處理速度提升 3.5 倍
揭開 Mage-VL 的面紗:以編解碼器思維處理多模態資料 在人工智慧領域,我們常面臨一種現代版的「莫拉維克悖論(Moravec’s paradox)」:強大的多模態模型(VLM)雖然極其擅長複雜的離線推理,但在面對需要即時、低延遲的影音串流(Streaming)處理時,往往顯得反應遲鈍且耗費極高算力。 為了打破這個瓶頸,微軟推出了 Mage-VL(arXiv: 2607.24904)。這是一款主打**編解碼器原生、主動式串流(Codec-native, Proactive-streaming)**的多模態基礎模型。其總參數規模為 5B,核心優勢在於將影片壓縮標準與影片理解深度融合,能對即時影音串流進行極致高效且具主動性的處理。 圖片來源: microsoft/Mage-VL · Hugging Face 為什麼要「編解碼器原生」? 傳統的影片多模態模型在處理影片時,通常將其拆解為均勻採樣的影格,再將海量的 16×16 影像塊(patches)送入凍結的、預訓練視覺編碼器。這種做法會產生極大的計算冗餘,因為相鄰影格間通常包含大量重複的靜態背景。 Mage-VL 則完全模仿現代影片編碼器(如 H.264/AVC、HEVC/H.265 或神經編碼器 DCVC-RT)的壓縮邏輯,將影片串流拆分為: 關鍵幀(I-frames/Anchor frames):模型會完整保留其視覺圖像。 預測幀(P-frames/Predicted frames):模型只保留編碼器實際「花費位元(spending bits)」記錄動作變化與新細節的運動顯著區域。 這種與編解碼器對齊的預測性塊保留機制(Predictive-patch mechanism),能將視覺令牌(Visual Tokens)的消耗減少 75% 以上(降至 dense 均勻採樣的 1/8 甚至更低)。在完全不丟失時空上下文與定位精度的前提下,這項設計帶來了高達 3.5 倍的牆鐘推理速度提升(Wall-clock inference speedup)。 圖片來源: Mage-VL Mage-ViT:資料高效的從零預訓練視覺大腦 Mage-VL 的視覺處理核心是 Mage-ViT(Codec-ViT)。與目前市面上依賴數十億、甚至上百億圖像-文本對初始化權重的 VLM 前端不同,Mage-ViT 展現了極高的資料效率: 無須海量標註資料:它是在僅有 約 1 億張(100M)未標記的圖像與影片影格 上,透過集群判別(Cluster-discrimination)從零開始(from scratch)預訓練而成。 強悍的零樣本表現:其在 CIFAR-10 上取得了 99.33%、在 ImageNet 上取得了 85.69%(僅使用 256 tokens)的驚人成績,實力媲美甚至超越了使用數十億大數據集訓練的 SigLIP2 (10B params) 或 MoonViT (2B params)。 原生解析度單調擴展:支援可變解析度預訓練。隨著令牌預算(Token budget)的增加(最高達 676 tokens),其表現能持續單調提升(ImageNet 達到 86.3%、Food-101 達到 96.1%),解決了傳統固定解析度編碼器在 token 增加時性能飽和或退化的通病。 解碼器相容(Codec-agnostic):Mage-ViT 具有通用的前端介面,無須修改架構或重新訓練,即可直接接收傳統編解碼器(透過運動向量與殘差能量)或神經編解碼器(透過 Rate map)。 雙處理系統:實現主動式低延遲串流 Mage-VL 引入了生物學啟發的「系統 1 與系統 2」雙處理機制,在單一權重模型內實現了主動式串流(Proactive streaming),無須維護複雜的多 Agent 管道: