AIデイリー|Gemini 3.7 Flash登場、DeepSeek Harnessがオープンソース公開、OpenAIがGPT-5.6 Sol Ultrafast発表
モデルリリース・アップデート
Gemini 3.7 Flash — Google DeepMind
- ひとことで言うと:前モデル(3.6 Flash)からわずか3週間で、Google DeepMindが処理性能を大幅に引き上げ料金を50%値下げした主力ワークホースモデル「Gemini 3.7 Flash」を一般公開しました。
- 主なポイント:
- API価格を旧バージョンの半額(入力$0.75 / 出力$3.75 per 1Mトークン)に大幅値下げ。
- 複雑なコードデバッグ、Webデザイン/UI構築、自律型エージェントワークフローでの指示追従精度と実行成功率が向上。
- 100万トークンのマルチモーダルコンテキストウィンドウをサポートし、GitHub Copilot、Antigravity、Google AI Studio等で即日利用可能。
- 技術仕様:非公開モデル / 100万トークンコンテキスト / マルチモーダル(テキスト・画像・音声・動画)対応
- リンク:Google DeepMind 公式ブログ
GPT-5.6 Sol (Ultrafast モード) — OpenAI
- ひとことで言うと:OpenAIがCerebrasとの提携により、フラッグシップモデル「GPT-5.6 Sol」を最大14倍高速化(最高750トークン/秒)で駆動する「Ultrafast モード」のAPIプレビューを開始しました。
- 主なポイント:
- Cerebrasのウエハースケールエンジン(WSE)インフラを活用し、1秒間に最高750出力トークンという異次元の生成速度を実現。
- リアルタイム音声対話、カスタマーサポート、高速コーディングなど、ミリ秒単位の応答速度が求められるプロダクション用途に最適化。
- OpenAI APIの選定企業向けに先行公開され、順次展開予定。
- 技術仕様:非公開モデル / API限定プレビュー / Cerebras WSE基盤
- リンク:OpenAI 公式発表
DeepSeek Harness v0.1 & API料金改定 — DeepSeek
- ひとことで言うと:DeepSeekが「一切がプラグイン」を設計思想に掲げる新世代AIエージェント構築基盤「DeepSeek Harness v0.1」をMITライセンスでオープンソース公開し、同時にAPIのピーク/オフピーク料金制を発表しました。
- 主なポイント:
- Cordisメタフレームワークをベースに構築され、モデル・ツール・ファイルシステム・UIからエージェントのループ構造自体まで全てをプラグインとして組み換え・拡張可能。
- API料金体系にピークタイム(高峰)とオフピークタイム(闲时)の二段階制(峰谷定价)を導入。オフピーク時はピーク時の半額となる一方、キャッシュ命中時の入力単価などが改定。
- 技術仕様:オープンソース(MITライセンス) / Cordis基盤 / プラグインアーキテクチャ
- リンク:GitHub - deepseek-ai/deepseek-harness
MiniMax Music 3.0 — MiniMax
- ひとすることで言うと:MiniMaxが作曲・編曲・演奏・歌唱からマスタリングまでを一括処理できる、商用利用可能なオープンウェイト音楽生成モデル「MiniMax Music 3.0」をリリースしました。
- 主なポイント:
- テキストのコンセプト記述や歌詞から、最長5分間の高品質な楽曲(ボーカル・楽器演奏含む)を直接生成可能。
- ComfyUIノードおよびGradioワークフローがオープンソースとして公開され、ローカル環境での自由な組み込みやカスタマイズに対応。
- 技術仕様:オープンウェイト / 最長5分間出力 / ComfyUI・Gradio統合対応
- リンク:MiniMax 公式ブログ
Qwen3.8-2.4T-A95B — Alibaba Qwen
- ひとことで言うと:アリババのQwenチームが、総パラメータ2.4T・アクティブ95Bの超大型オープンウェイトモデル「Qwen3.8-Max」の重みを公開しました。
- 主なポイント:
- 自律コーディング、ディープリサーチ、複雑なタスクのエンドツーエンド実行に特化したMoEアーキテクチャ。
- HuggingFaceでのウェイト公開に加え、SiliconFlow(硅基流动)などのクラウドAPIプラットフォームでDay-0(即日)提供が開始。
- 技術仕様:オープンウェイト(2.4T MoE / 95B Active) / HuggingFaceで入手可能
- リンク:HuggingFace モデルページ
プロダクトリリース・アップデート
Sheets canvas — Google Workspace
- アップデート内容:Google SheetsにGeminiを活用した新機能「Sheets canvas」が追加されました。ユーザーが自然言語でプロンプトを入力するだけで、スプレッドシート内のデータを解析し、インタラクティブなダッシュボードや学習トラッカー、ミニアプリケーションへと自動的に変換・構築します。
- 対象ユーザー:[ビジネスパーソン / データアナリスト / 一般ユーザー]
- 利用方法:Google Workspace 公式ブログ
Computer History (Mac版ChatGPT) — OpenAI
- アップデート内容:OpenAIがMac版ChatGPTデスクトップアプリ向けに、複数アプリやWebサイトにまたがる操作文脈を自動で記憶・理解する「Computer History」の提供を開始しました。ユーザーの日常的な作業パターンを学習し、文脈に応じたアシストや繰り返しタスクの自動化提案を行います。
- 対象ユーザー:[ChatGPT Pro / Business / Enterprise ユーザー]
- 利用方法:
ChatGPT can now remember your activity across the apps and websites on your computer.
— OpenAI (@OpenAI) August 13, 2026
With Computer History in the desktop app, future interactions feel more personalized and require less explanation. pic.twitter.com/WHZPxPp31R
Builds — Cursor
- アップデート内容:AIコードエディタCursorが、クラウドエージェントの準備時間を大幅に短縮する「builds」機能を発表しました。開発環境の事前構築済みコピーをバックグラウンドで準備・保持することで、エージェント起動時のレスポンス速度を最高3倍、環境構築速度を10倍に高速化します。
- 対象ユーザー:[ソフトウェアエンジニア / AIエージェント活用者]
- 利用方法:Cursor 公式ブログ
Claude Code v2.1.232 — Anthropic
- アップデート内容:Anthropicのターミナル型AIエージェント「Claude Code」がアップデートされ、「Subagent forking」がデフォルトで有効化されました。子エージェントが親の会話履歴やプロンプトキャッシュをそのまま引き継ぐことで、並列タスクの実行速度と精度が大幅に向上しました。GitLabトークンのマスキングや脆弱性修正も含まれています。
- 対象ユーザー:[ソフトウェアエンジニア / AIエージェント開発者]
- 利用方法:GitHub Releases
業界動向
Databricksが評価額1,900億ドルで50億ドルの資金調達を実施
- 概要:データ&AIプラットフォーム大手のDatabricksが、投資家からの強力な需要を受け、当初計画の10億ドルから枠を大幅に拡大し、評価額1,900億ドル(約29兆円)で50億ドルの資金調達を完了しました。
- 影響分析:エンタープライズ領域におけるデータ統合とAIエージェント基盤の構築に対する巨額需要を示すものであり、企業データを軸としたAI活用インフラの市場競争が一層加速すると見られます。
- ニュースリンク:TechCrunch 報道記事
Vals AI が評価額4億ドルで4,000万ドルのシリーズA調達を実施 (a16z主導)
- 概要:抽象的なベンチマークではなく、法務・金融・医療などの実世界の専門業務に基づいた自動評価プラットフォームを開発する「Vals AI」が、a16z主導による4,000万ドルのシリーズA資金調達を発表しました。
- 影響分析:既存のリーダーボードのスコアと実際の業務現場での有用性のギャップ(Eval Gap)を解決するソリューションとして注目を集めており、企業向けAI導入における信頼性評価インフラの重要性が浮き彫りになっています。
- ニュースリンク:
We're thrilled to invest in Vals.
— a16z (@a16z) August 13, 2026
A frontier model can look brilliant on a leaderboard and still struggle with the messy work that actually matters in the real world.@ValsAI takes a fundamentally different approach to evaluation: test models on the work people actually want… https://t.co/m4Dh9Yib6X pic.twitter.com/Lbzd9s2yM4
研究論文
AGENTS.md / CLAUDE.md の「規則過多」による性能低下を検証した「Harness-IF」 — DAIR AI
- 研究の背景:AIコーディングエージェントにプロジェクトルールを与える
AGENTS.mdやCLAUDE.mdが肥大化することで、エージェントの挙動にどのような副作用やコスト悪化が生じるかを定量的に評価すること。 - 主な革新点:256種類のルールと12の前沿モデルを対象に、ルール適用時と非適用時の実行プロセスの差異を分離計測し、モデルの標準傾向と指示順守率(Against-Prior Accuracy)の剥離を特定する手法を構築。
- 研究成果:ルールファイルが不必要に膨らむと、エージェントが不必要な検証ステップや過剰な実装パイプラインを強制実行し、精度低下(3.6〜7.4ポイント低下)やトークンコストの急増を引き起こすことを実証しました。
- 論文リンク:ArXiv 論文ページ
「Stolen Thoughts」:API経由での暗号化Thinking CoT(思考プロセス)の解読攻撃 — 欧州共同研究チーム
- 研究の背景:OpenAI、Anthropic、Googleなどの最新推論モデルで導入されている「非公開・暗号化された思考プロセス(CoT)」が、API応答の通信特性から不正に抽出可能か検証すること。
- 主な革新点:APIのストリーミング応答のタイミングやトークンメタデータなどのサイドチャネル情報を利用し、非公開設定のモデル内部思考ロジックを再構成する攻撃手法を提案。
- 研究成果:公開されたセッションログからAPIキーやモデル内部プロンプトの復元に成功。推論モデルの思考過程の非公開化とプライバシー保護における技術的課題を提起しました。
- 論文リンク:ArXiv 論文ページ
その他の話題
NVIDIA Skills が Cursor マーケットプレイスに公式統合
- 内容紹介:CUDA、NeMo、RAGなど、NVIDIAの30以上の製品群に対応する300以上の公式開発スキルがCursorのマーケットプレイスに登場しました。CursorのエージェントがGPU最適化や分散学習のコード構築ルールを直接読み込んで自動補完・修正を行えるようになります。
- リンク:
Attn @cursor_ai devs 👀
— NVIDIA AI (@NVIDIAAI) August 13, 2026
Your agents can now tap into 300+ NVIDIA skills across 30+ products. https://t.co/nqYRUx3pOG
LTX-2.5:Lightricksが高速オープンソースビデオモデルを公開
- 内容紹介:画像生成ツールなどを手掛けるLightricksが、10秒の映像と同期音声を僅か6.8秒で同時生成できるオープンソース動画モデル「LTX-2.5」を公開しました。テキスト・画像・動画のマルチ入力に対応し、単一の生成プロセスで複数のカメラアングルを維持したカット切り替えが可能です。
- リンク:Lightricks 公式発表


