この記事は自動生成されたもので、毎朝9時に自動的に更新されます。
AI 日報|Qwen3.8-Max と MiniMax H3 が登場;OpenAI が Astra の難問解決能力と GPT-Live リアルタイム音声を発表
MiniMax H3 — MiniMax (海螺 AI)
- 一言で言うと:MiniMax が次世代フルモーダル動画生成モデル「H3」を正式にオープンソース化。テキスト、画像、動画、音声を統合的に理解し、Video Arena のオープンソース動画モデル部門で第1位を獲得しました。
- 主なハイライト:
- 最大2K解像度、最長15秒、32kHzのネイティブステレオ音声付き動画の生成をサポート。
- Video Arena のテキスト・オブ・ビデオ(Text-to-Video)およびイメージ・オブ・ビデオ(Image-to-Video)の両部門でオープンソースの首位を獲得し、第2位のオープンソースモデルを280ポイント上回るスコアを記録。
- 技術仕様:オープンソースウェイト (Hugging Face) / 2K 24FPS 15秒 / Video Arena オープンソース SOTA
- リンク:Hugging Face リポジトリ
Astra (次世代主力モデルの内部版) — OpenAI
- 一言で言うと:OpenAI が次世代主力モデル「Astra」の内部バージョンを公開。わずか約2,000ドルのAPIトークンコストで、長年未解決だった数学および理論計算機科学の10の難問の解決に成功しました。
- 主なハイライト:
- 球面充填、符号理論、群論、量子複雑性、格子暗号などの最先端分野を網羅。
- すべての解答に完全な Lean 形式化証明書が付属しており、AIによる深い推論と科学的発見の大きな可能性を示しています。
- 技術仕様:クローズドソース / Lean 形式化証明書付き
- リンク:OpenAI 公式ブログ
SenseNova U1.5-Lite-Preview — 商湯科技 (SenseTime)
- 一言で言うと:商湯科技(SenseTime)が NEO-Unify アーキテクチャに基づく軽量なネイティブ統合マルチモーダルモデルを発表。わずか 8B-MoT のパラメータで、商用クローズドソースモデル並みの生成・編集品質を実現しました。
- 主なハイライト:
- ネイティブ統合マルチモーダルアーキテクチャを採用し、メモリフットプリントと推論コストを大幅に削減。
- 高品質な画像生成・編集能力を維持し、エッジデバイスや軽量サービスへのデプロイに最適。
- 技術仕様:8B-MoT パラメータ / オープンソース Preview / 統合マルチモーダルアーキテクチャ
- リンク:
𝗜𝗻𝘁𝗿𝗼𝗱𝘂𝗰𝗶𝗻𝗴 𝗦𝗲𝗻𝘀𝗲𝗡𝗼𝘃𝗮 𝗨1.5-𝗟𝗶𝘁𝗲-𝗣𝗿𝗲𝘃𝗶𝗲𝘄.
— SenseTime (@SenseTime_AI) August 3, 2026
An early open-source preview of our lightweight, natively unified multimodal model — built on the native NEO-Unify architecture to natively understand, reason, generate, and edit across modalities. 𝗪𝗶𝘁𝗵… pic.twitter.com/sq7gFcLGER
jina-reranker-v3.5 — Jina AI
- 一言で言うと:Jina AI が 0.6B の軽量リランキングモデル「v3.5」を発表。パラメータ数が 7 分の 1 にもかかわらず、BEIR ベンチマークで Qwen3-Reranker-4B を撃破しました。
- 主なハイライト:
- BEIR テストで 63.20 nDCG@10 という優れた成績を記録。
- 超高速な演算速度と卓越した企業向け検索品質を両立し、パフォーマンスとサイズのパレート最適(Pareto Front)を確立。
- 技術仕様:0.6B パラメータ / オープンソース (Hugging Face) / BEIR 63.20 nDCG@10
- リンク:Jina AI 公式ブログ
プロダクトのリリース・アップデート
ChatGPT Continuous Voice Interaction (GPT-Live) — OpenAI
- アップデート内容:OpenAI が ChatGPT Voice の音声アーキテクチャを刷新し、ユーザーがAIと「聞きながら話す」ことができる「GPT-Live」を導入。深い推論やツール呼び出しによって会話が途切れることはありません。音声対話の確立時間がネットワークの往復6回から1回に短縮され、超低遅延で自然かつスムーズな会話体験を実現します。
- 対象ユーザー:ChatGPT ユーザー / 音声 AI 開発者 / モバイルユーザー
- アクセス:OpenAI 公式ブログ
@cloudflare/computer AI エージェント実行時プレビュー版 — Cloudflare
- アップデート内容:Cloudflare がオープンソースのランタイム
@cloudflare/computerを発表。すべてのAIエージェントに独立した仮想ファイルシステムと多様な実行環境(Isolate / コンテナサンドボックス / ブラウザ)を提供します。Durable Objects と SQLite の永続化をベースに、エージェントが長期的なワークスペースを持ち、複数の環境間で動的に切り替えられるようにします。 - 対象ユーザー:AI エージェント開発者 / クラウドアーキテクト / フルスタックエンジニア
- アクセス:Cloudflare 公式ブログ
Next.js 16.3 正式版 — Vercel
- アップデート内容:Vercel が Next.js 16.3 をリリース。シングルページアプリ(SPA)並みの超高速応答を実現する「Instant Navigations」を導入し、AIエージェントの開発体験をネイティブに最適化しました。開発サーバーとビルド速度が大幅に向上し、バージョン管理されたファイルなどのエージェント向け開発ツールを内蔵しています。
- 対象ユーザー:フロントエンドエンジニア / Web 開発者 / AI 支援開発チーム
- アクセス:Next.js 公式ブログ
v0 API によるプログラマブルなアプリ構築 — Vercel
- アップデート内容:Vercel が新しい v0 API を発表。開発者はコードを通じて v0 のアプリ構築能力を直接呼び出すことができます。プロンプト、Git リポジトリ、ZIP ファイルからの対話開始、開発サーバープレビューのレンダリング、継続指示の送信、そして Vercel へのワンクリックデプロイをサポートします。
- 対象ユーザー:自動化ワークフローアーキテクト / AI ソフトウェアファクトリー開発者 / 個人開発者
- アクセス:
Introducing the new v0 API.
— v0 (@v0) August 3, 2026
Programmatic access to v0's app-building capabilities:
• Start a chat from a prompt, repo, or ZIP
• Render a dev server preview
• Send follow-up messages
• Deploy to Vercel pic.twitter.com/L7zJulyglS
ElevenAgents 企業向け音声 AI エージェントプラットフォーム — ElevenLabs
- アップデート内容:ElevenLabs がプラットフォーム「ElevenAgents」を発表。毎週 1,000 万回以上の自然音声対話を処理します。設定可能なガードレールや地域ごとのデータ保存オプションを提供し、Spotlight による本番環境の対話モニタリングと、最適化の提案を自動で行う機能を組み合わせます。
- 対象ユーザー:カスタマーサポートチーム / 音声 AI 開発者 / IT 責任者
- アクセス:
More than 10 million conversations run on ElevenAgents every week.
— ElevenLabs (@ElevenLabs) August 3, 2026
In each one, a natural-sounding voice or chat agent handles a real interaction like a refund request, appointment booking, benefits inquiry, or flight change.
See the platform that makes them possible. pic.twitter.com/COee1hqn3l
GenOffice オープンソース AI オフィススイート — Genspark
- アップデート内容:Genspark がクロスプラットフォームのオープンソース AI オフィススイート「GenOffice」を発表。完全無料で広告なし。Docs、Sheets、Slides、PDF の編集をサポートし、内蔵の Genspark Super Agent がデータリサーチ、表計算データの分析を自律的に行い、プレゼン資料やファイルを自動作成します。
- 対象ユーザー:オフィスワーカー / 学生 / 企業チーム / 個人クリエイター
- アクセス:
Open-sourcing GenOffice!! Free for everyone.
— Eric Jing (@ericjing_ai) August 3, 2026
A full-featured AI Office for PC and Mac. We invite you to build the future of a native AI office experience together! https://t.co/rcvKpLTPRp
業界動向
EU AI法(人工知能法)の合成コンテンツ透明性条項が正式発効
- 概要:EU AI法(EU AI Act)の新しい透明性規定が8月2日に正式施行され、企業に対してユーザーがAIと対話しているかどうかの開示を義務付け、AIが生成した音声、画像、テキストに機械可読なマーカーを埋め込むことが求められるようになりました。
- 影響分析:違反企業には最大1,500万ユーロ、または全世界年間売上高の3%という巨額の罰金が科される可能性があり、これが世界中の生成AIコンテンツ配信プラットフォームにおける合成透かしや境界表示の標準化を加速させることになります。
- ニュースリンク:The Verge 報道
Palantir の第2四半期売上高が 93% 急増、CEO のアレックス・カープ氏が最先端 AI ラボを「マルクス主義的」と批判
- 概要:Palantir が発表した第2四半期決算は、売上高が前年同期比 93% 増の 19 億ドル、純利益が 11 億ドルに達しました。CEOのアレックス・カープ氏は株主への書簡の中で、最先端AIラボが「パートナーの生産データを囲い込もうとしている」と警告し、Palantir はモデルに依存しない(Model-agnostic)独立したAIインフラの提供にこだわり続けると強調しました。
- 影響分析:企業顧客がモデルベンダーに対して抱く「協力しつつもデータを乗っ取られることを恐れる」という矛盾した心理が浮き彫りになり、ミドル層のオーケストレーションやプライベートデータの制御ソフトウェアの莫大な市場価値が証明されました。
- ニュースリンク:TechCrunch 報道
AWS と Superblocks が提携、Vibe-Coding を企業のプライベートクラウドに導入
- 概要:AWS と AI ソフトウェア開発プラットフォームの Superblocks が数年間にわたる提携を発表。Superblocks の Vibe-Coding プログラミングツールを AWS 顧客のプライベートクラウド環境に直接組み込み、Amazon Aurora データベースの自動構築と Amazon Bedrock との統合を実現します。
- 影響分析:従来の大手企業が AI エージェントによるプログラミング支援を導入する際に最も懸念していたデータ漏洩やセキュリティコンプライアンスの問題を解決し、企業向け生成AIソフトウェア開発のプライベート環境での実用化を前進させます。
- ニュースリンク:TechCrunch 報道
論文・研究
Orchard:オープンソース AI エージェントのクロスタスク訓練フレームワーク — Microsoft Research
- 研究動機:現在の AI エージェントの訓練および評価フレームワークは非常に断片的であり、実際のデプロイ環境(Codex、OpenClawなど)に直接接続できる統一された環境サービスが不足していました。
- 主なイノベーション:Microsoft が「Orchard」フレームワークを発表。Orchard Env を通じて再利用可能な環境サービスを構築し、小規模なオープンソースモデルであっても、実際のコードや Web ナビゲーションタスクでトレーニングを受けられるようにしました。
- 研究成果:フラグシップモデルである Orchard-SWE は、有効パラメータ数がわずか約 3B にもかかわらず、SWE-bench Verified のランキングで 69.7%(リランキング後は 73.0%)という目覚ましい成績を記録し、10倍大きなサイズを持つ最先端のクローズドソースモデルに匹敵する性能を示しました。
- 論文アドレス:Microsoft Research ブログ
Meta GEM トレーニングアーキテクチャ:LLM スケールにおける広告レコメンデーション基盤モデル — Meta
- 研究動機:LLM スケールの GPU トレーニング技術を従来のレコメンデーションシステムにそのまま適用すると、アーキテクチャやデータの特性の不適合により、ハードウェア利用効率が低下する問題に頻繁に直面していました。
- 主なイノベーション:Meta は GEM レコメンデーション基盤モデルに向けて、カーネル、精度、並列化戦略、メモリのハードウェア/ソフトウェアの協調設計(Hardware/Software Co-design)を実施しました。
- 研究成果:12ヶ月間でトレーニング FLOPs を 4 倍に拡大しつつ、エンドツーエンドのトレーニング効率(MFU)を 20〜25% へと倍増させることに成功し、大規模モデル規模のレコメンデーションシステムにおける計算コストを大幅に削減しました。
- 論文アドレス:Meta エンジニアリングチームブログ
その他のシェア
Hermes Agent v0.20.0 が NVIDIA NeMo Relay と提携し、総合的な最適化を提供
- 内容紹介:Nous Research が Hermes Agent v0.20.0 をリリース。NVIDIA NeMo Relay と連携し、小型モデルおよびエッジモデル向けにシステムレベルの最適化を実施しました。ツール呼び出しプロセスの改善、スキーマの簡素化、会話軌跡の分析を通じて、タスク完了に必要な対話ラウンド数とトークン消費量を大幅に削減しています。
- リンク:GitHub Release ページ
長いコンテキストによる会話品質低下の解決策:Markdown 要約圧縮法
- 内容紹介:著名な学者である Ethan Mollick 氏が、長コンテキストモデルで発生する「頑固さ」「指示の無視」といった会話の品質低下現象に対するアドバイスを提案。AI自身は自身の品質低下状態を正確に察知できないため、ユーザーはAIに直接状況を尋ねるべきではなく、現在の進捗とコンテキストを独立した Markdown 要約ファイルに定期的に圧縮し、新しいセッションを開いて会話を続けるべきであるとしています。
- リンク:
Nate is right (full context can lead to a degradation of chats in several different ways) but you can't ask the AI about stuff like this as they have bad self-knowledge
— Ethan Mollick (@emollick) August 3, 2026
A good approach is to compact the work so far (ask for a md file summarizing things) & use it in the new chat https://t.co/2U11vnXLDk


