AIデイリー|DeepSeek初の視覚モデルV4-Flash-Vision-Exp公開、Claude Mythos 5がセキュリティスキャンに統合、NVIDIA次世代機Vera RubinがAzureに到着
モデルリリース・アップデート
DeepSeek-V4-Flash-Vision-Exp — DeepSeek
- ひとことで言うと:DeepSeek V4シリーズ初となる待望の画像入力対応マルチモーダル視覚推論モデルが実験的APIとして電撃公開されました。
- 主なポイント:
- 100万(1M)トークンのコンテキストウィンドウを備え、最大出力長384K、JSON OutputやTool Calls、Responses APIをサポート。
- 従来のテキスト版V4-Flashと同等の推論・コーディング能力を維持しつつ、マルチモーダルエージェント評価(Agents’ Last Exam等)においてClaude Opus-4.8に迫る大幅な性能向上を記録。
- 先週公開された「DeepSeek Harness」と即座に統合され、エージェントが画面スクリーンショットや資料画像を直接認識して自律動作できるようになりました。
- API価格はテキスト版V4-Flashと同額据え置き(オフピーク時キャッシュヒット0.05元/Mトークン〜)。
- 技術仕様:マルチモーダル対応 / 1M Context / API提供(
deepseek-v4-flash-vision-exp) - リンク:DeepSeek API Updates /
Brace yourselves. We just entered a new era of frontier multimodal models.
— elvis (@omarsar0) August 21, 2026
DeepSeek-V4-Flash-Vision-Exp advances multimodal agent performance.
Also, pay attention to Ox Alpha 1M token contexts with text, image, and video inputs, excelling in coding and agentic tasks. https://t.co/MMLX86hhtq
Inkling & Inkling Small — Thinking Machines Lab
- ひとことで言うと:Mira Murati氏らが率いるThinking Machines Labが、テキスト・画像・音声入力をネイティブ処理する完全オープンウェイトの推論MoEモデルファミリーを公開しました。
- 主なポイント:
- フラッグシップの「Inkling」に加え、総パラメータ276B・活性化12Bの高効率版「Inkling Small」の2モデルを展開。
- 100万トークンの巨大コンテキストを持ち、思考プロセスの制御(Reasoning Controls)に対応。
- 重みはApache 2.0ライセンスでオープンソース公開され、OpenRouter上のエージェント実行環境(Claude CodeやCodex、Hermesなど)向けに無料エンドポイントが提供されています。
- 技術仕様:276B総パラメータ(活性化12B) / 1M Context / Apache 2.0
- リンク:
Inkling and Inkling Small are now served directly by @thinkymachines on OpenRouter, free to use inside agentic harnesses only.
— OpenRouter (@OpenRouter) August 21, 2026
Plug them into Claude Code, Codex, Hermes Agent and more to unlock the free access.
Open-weight MoE reasoning models with native text, image, and audio…
Pika Speech (3B) — Pika Labs
- ひとことで言うと:リアルタイムファクター(RTF)0.02を達成し、スタジオ品質の音声を瞬時に生成する超高速3B音声合成(TTS)モデルが登場しました。
- 主なポイント:
- 1分間の48kHz高品質音声をわずか約1.2秒で生成可能で、最大5分間の長尺リクエストを単一処理でサポート。
- 従来の主要TTSサービス(ElevenLabs v3等)と比較して最大9倍のコスト効率を実現。
- Pika API Clubを通じて開発者向けに即日提供が開始されています。
- 技術仕様:3Bパラメータ / 48kHz出力 / RTF 0.02 / 最大5分連続生成
- リンク:
Let’s talk about Pika Speech, a 3B text-to-speech model at RTF 0.02.
— Pika (@pika_labs) August 21, 2026
We’re excited to share that in locally run long-form tests, Pika Speech generates one minute of studio-quality 48 kHz speech in about 1.2 seconds—and supports requests up to five minutes. That efficiency makes… pic.twitter.com/prS5yXiTNl
Runway Ruby — Runway
- ひとことで言うと:SDR動画を最大16-bitのHDR(ProRes/EXRシーケンス)へと変換・生成できるプロ映像制作者向け新モデルがリリースされました。
- 主なポイント:
- 最大30秒の動画入力に対応し、BT.2020色空間(PQ / HLG)へのアップスケールと階調復元を実行。
- ポストプロダクションでの合成やカラーグレーディングに耐えうる広ダイナミックレンジの映像を出力可能。
- RunwayのMaxプランおよびEnterpriseユーザー向けに提供開始。
- 対象ユーザー:[映像クリエイター / ポストプロダクションエンジニア / VFXアーティスト]
- 利用方法:Runway より利用可能です。
- リンク:
Introducing Runway Ruby.
— Runway (@runwayml) August 21, 2026
A new model that converts SDR video up to 16-bit HDR in ProRes and EXR sequences. Compatible with any existing uploaded video or generated output up to 30s. pic.twitter.com/UME7flY2vb
プロダクトリリース・アップデート
Claude Security × Claude Mythos 5 & 3,500万ドルのOSS防御基金 — Anthropic
- アップデート内容:Anthropicの最上位セキュリティ特化モデル「Claude Mythos 5」がClaude Securityに統合され、Enterprise顧客向けにパブリックベータとして提供開始されました。顧客はモデルへの直接アクセス権を必要とせず、バックエンドでMythos 5が高精度なコードベースの脆弱性診断とパッチ生成を実行します。さらに、オープンソースソフトウェアの脆弱性修復を支援する3,500万ドル規模の基金「Defender Advantage Fund(0xDAF)」の設立も発表されました。
- 対象ユーザー:[セキュリティエンジニア / DevSecOps担当者 / エンタープライズ開発チーム]
- 利用方法:Anthropic Blog より詳細を確認し、Claude Enterpriseダッシュボードから有効化します。
- リンク:
Claude Security scans now run on Claude Mythos 5, available today in public beta for all Claude Enterprise customers.
— Claude (@claudeai) August 21, 2026
Put our most capable security model to work on your codebase, no separate model access needed. pic.twitter.com/zJSUgGjtZF
GPT-5.6 Sol API価格20%超値下げ & APIキー別コスト追跡ダッシュボード — OpenAI
- アップデート内容:OpenAIが「GPT-5.6 Sol」のAPI利用料およびCodexクレジット価格を今後3ヶ月間にわたり20%以上値下げしました。同時に開発者向け管理画面(Usage & Spend Dashboard)が刷新され、APIキー単位での利用量・支出のリアルタイム追跡と、予算上限超過時にリクエストを遮断するハードキャップ設定が可能になりました。
- 対象ユーザー:[AIアプリ開発者 / インフラ運用エンジニア / 企業内API管理者]
- 利用方法:OpenAI API Platform より新しい価格体系と管理機能が適用されます。
- リンク:/
As we continue to push the frontier of capabilities while improving efficiency, we're dropping API and credit pricing of GPT-5.6 Sol by over 20% for the next 3 months. pic.twitter.com/UoTb3hcB2t
— OpenAI (@OpenAI) August 21, 2026You can now track usage and spend by API key in the Usage and Spend dashboards to see which apps and workloads drive your spend.
— OpenAI Developers (@OpenAIDevs) August 21, 2026
Set monthly organization or project spend limits, including hard limits that stop traffic when reached. pic.twitter.com/OA6p0ygisG
X Ads MCP (Model Context Protocol) サーバー — X (旧Twitter)
- アップデート内容:Xが広告運用プラットフォーム向けの公式MCPサーバーを公開しました。GrokやClaude CodeなどのAIエージェントと連携し、自然言語のプロンプトから広告キャンペーンの立案、オーディエンスターゲティング、投稿プロモーション、予算監視まで全23種類のツールを自律的に操作可能。安全対策として、AIが作成したキャンペーンはデフォルトで一時停止状態となり、人間の承認後に配信が開始されます。
- 対象ユーザー:[マーケター / 広告運用担当者 / グロースハッカー]
- 利用方法:MCP対応クライアントにX Ads MCPサーバーを接続して利用します。
- リンク:
Use your AI to manage 𝕏 ads! https://t.co/XZ98oW48sM
— Elon Musk (@elonmusk) August 21, 2026
v0 × Vercel Connect(100+ SaaS連携) — Vercel
- アップデート内容:UI生成・プロトタイピング環境「v0」で構築したアプリケーションやエージェントが、Slack、GitHub、Salesforce、Google Workspaceなど100以上の外部サービスと安全に連携できる「Vercel Connect」機能が導入されました。OAuthアプリの個別登録を自動化し、短命トークン(Short-lived tokens)で認証を処理することで、機密情報を安全に保ったまま実データを用いた動的ツールの構築が可能です。
- 対象ユーザー:[フロントエンド開発者 / 社内ツール開発者 / プロダクトデザイナー]
- 利用方法:Vercel Connect Changelog より確認可能です。
- リンク:
Apps and agents you build in v0 can now securely connect to Slack, GitHub, Salesforce, and 100+ other services using Vercel Connect, handling authentication with reusable team connectors and short-lived tokens. pic.twitter.com/YJGYrAMT1K
— v0 (@v0) August 21, 2026
Firecrawl Developer Index — Firecrawl
- アップデート内容:コーディングエージェント向けに特化した最新ナレッジ検索インデックス「Developer Index」がローンチされました。主要なオープンソースリポジトリ、公式ドキュメント、Issueなど7,000万件以上の一次情報をインデックス化。エージェントが時代遅れのAPIや誤った文法を出力するのを防ぎ、高精度なコード生成を支援します。
- 対象ユーザー:[コーディングエージェント開発者 / AIエンジニア]
- 利用方法:
npx -y firecrawl-cli@latest setup developer-indexによりCLIやMCPツールとしてセットアップ可能です。 - リンク:
Introducing Firecrawl Developer Index, an index for supercharging coding agents.
— Firecrawl (@firecrawl) August 21, 2026
Search 70M+ primary sources including repos, docs, & issues with the highest recall of any coding-specific index.
Ensure agents ship correct, up-to-date code every time!https://t.co/i3rH3PiKFu pic.twitter.com/vF35VR8ZAZ
業界動向
Microsoft Azure、NVIDIAの次世代AI基盤「Vera Rubin」量産システムをデータセンターへ初受領
- 概要:マイクロソフトのサティア・ナデラCEOは、Azureデータセンターにおいて業界初となるNVIDIAの次世代アーキテクチャ「Vera Rubin」量産システムの受け入れを完了したと発表しました。
- 影響分析:Blackwellクラスタの大規模配備が続く中、すでに次世代の超巨大クラスタの物理配備と電力・冷却インフラの統合が前倒しで進んでいます。フロンティアモデルの学習・推論スケーリング競争がインフラレイヤーでさらに激化している実態を示しています。
- ニュースリンク:
Delivery day at our Microsoft DCs as the first production Vera Rubins arrive. A huge thank you to our partners at @nvidia and our Azure hardware and datacenter teams for all the incredible work that brought us to this milestone! pic.twitter.com/pBqKArGO1N
— Satya Nadella (@satyanadella) August 21, 2026
StripeがAIモデルマーケットプレイス「OpenRouter」を買収
- 概要:決済大手のStripeが、AIモデルのアグリゲーションおよびルーティングサービスを提供する「OpenRouter」を買収したことが、投資家向けのリーク書簡等から明らかになりました。OpenRouterは創業約3年でのエグジットとなります。
- 影響分析:AIエージェントによるモデルAPI消費やトークン課金が爆発的に増加する中、決済インフラとモデルルーティング層の垂直統合が加速します。開発者にとっては、単一の請求・決済パイプラインで世界中のあらゆるフロンティアモデルをシームレスに利用できる環境が整うことになります。
- ニュースリンク:
1/一家被反复质疑“没有护城河”的公司,成立约3年后就被 Stripe 收购。
— AI Will (@FinanceYF5) August 21, 2026
OpenRouter 的收购价格尚未公布,但这可能是同等规模公司中速度最快的收购之一。
它到底做对了什么?👇 pic.twitter.com/uH0yQb9neL
NVIDIAの自律エージェント「AVO」、推論ベンチマーク「ARC-AGI-3」で100%を達成
- 概要:NVIDIAが開発した汎用自律エージェント「AVO(Autonomous Visual Operative)」が、インタラクティブ推論評価ベンチマーク「ARC-AGI-3」の全25環境・183レベルすべてを100%クリアしました。
- 影響分析:事前のルール説明や明示的な目標指示が一切与えられない環境下で、エージェントが画面探索、仮説検証、メモリ蓄積、自己修正をループさせて解法を導き出しました。静的なプロンプト応答を超えた「長期計画と試行錯誤が可能な自律システム」の実現に向けた画期的なマイルストーンです。
- ニュースリンク:
Our general-purpose coding agent just scored 100% on the ARC-AGI-3 interactive reasoning benchmark.
— NVIDIA AI (@NVIDIAAI) August 21, 2026
NVIDIA AVO completed all 183 levels across all 25 public environments, figuring out what to do with no instructions, explicit rules, or stated goals. pic.twitter.com/UgROuDrMtn
研究論文
微小Transformerにおける「干渉重み(Interference Weights)」の解明 — Anthropic
- 研究の背景:ニューラルネットワーク内部で複数の異なる特徴量が限られたパラメータ空間を奪い合う「重ね合わせ(Superposition)」現象において、重み同士の干渉が学習効率にどう影響するかは理論的な謎でした。
- 主な革新点:単層Transformerをトークン・位置・特徴量・ロジット間の仮想重みに分解し、学習済みモデル内部での重み干渉とそれが訓練損失に与える悪影響を直接定量化・可視化しました。
- 研究成果:Transformer内部で特定の計算が他の計算を阻害する干渉メカニズムを世界で初めて実験的に証明し、より干渉の少ない効率的なアーキテクチャ設計に向けた理論的基盤を提示しました。
- 論文リンク:Anthropic Transformer Circuits
T-Rex: 触覚フィードバックを備えたロボットの反応型器用マニピュレーション — UC Berkeley / Dr. Jim Fanら
- 研究の背景:従来のロボットVLA(Vision-Language-Action)モデルは視覚に偏重しており、USBの挿入や紙コップの取り出しのような「微細な接触力」を伴う作業で失敗しやすい課題がありました。
- 主な革新点:視覚による大局的な動作計画(低速)と、触覚によるリアルタイム微修正(高速・視覚の4倍頻度)を非同期で統合するMoT(Mixture-of-Transformers)アーキテクチャを考案しました。
- 研究成果:50時間・約5,500エピソードに及ぶ世界最大級の高精度触覚ロボットデータセットをHugging Faceでオープンソース公開し、接触を伴う高難度操作タスクの成功率を飛躍的に向上させました。
- 論文リンク:T-Rex Project Page /
The sense of touch is the most criminally under-explored modality in robotics. Imagine doing sleight of hand wearing thick oven mitts. That's exactly how a robot feels today if it were alive. A magnetic piece snapping into place, a paper cup peeling out of a stack, a USB… pic.twitter.com/3iR43fxF24
— Jim Fan (@DrJimFan) August 21, 2026
SGLang Weight Cache Daemon: ゼロコピーによる亜秒級高速リカバリ — LMSYS
- 研究の背景:大規模LLMサービング基盤において、プロセスの再起動や障害リカバリ時の重み再読み込み(通常数百秒)がサービスの可用性低下やコールドスタートのボトルネックとなっていました。
- 主な革新点:CUDA IPC(プロセス間通信)のゼロコピー共有メモリマッピングを活用し、GPUメモリ上に量子化済みモデル重みを常駐・共有させるバックグラウンドデーモンを開発しました。
- 研究成果:モデルの重みロード時間を約495秒から0.63秒(約785倍高速化)へと短縮し、マルチインスタンス間での重み共有と亜秒級でのフェイルオーバーを実現しました。
- 論文リンク:LMSYS Org Blog
その他の話題
Memmy: 複数Coding Agent間で文脈と記憶を共有するLocal-First共通メモリ層
- 内容紹介:Claude Code、Codex、Cursor、OpenCodeなど、複数のコーディングエージェントを行き来する際に発生する「文脈の断絶」を解決するオープンソースツールが登場しました。各エージェントの作業履歴やエラー知見、設計方針を共通の個人コンテキストとして集約。Hooks経由で必要な記憶だけを適切なエージェントへ自動注入し、ツールを切り替えてもシームレスに開発を継続できます。
- リンク:GitHub MemTensor/memmy /
深度用了两天 Memmy,挺不错https://t.co/62LR9ggzP8
— Viking (@vikingmute) August 21, 2026
尤其适合现在 Codex 额度用的这么快的情况,用它提供的 hook 接入所有的 agent,用完了我直接用 Cursor 继续干活,可以无感的继续完成任务,以后如果换 Agent 很方便。 https://t.co/ruGjiHxvmD pic.twitter.com/JFeuFwGt4W
is-agentic: Webサイトの「自律エージェント親和性」を100項目で監査するツール
- 内容紹介:VercelとOraが共同公開した「is-agentic.com」は、WebサイトがAIエージェントにとってどれだけ操作しやすいかを100以上のチェック項目で自動診断する監査ツールです。サインアップや決済フローにおけるエージェントの脱落原因を可視化し、サイトを「エージェント対応(Agent-ready)」にするための修正プロンプトをワンクリックで生成します。
- リンク:is-agentic.com /
This was wild to watch unfold. We ran 𝚒𝚜-𝚊𝚐𝚎𝚗𝚝𝚒𝚌 in a loop against https://t.co/bnjggVrBDj until it got to 100/100.
— Guillermo Rauch (@rauchg) August 21, 2026
It made us close quite a few gaps. We worked hard to make sure the criteria is high quality and worth your time & tokens. https://t.co/cpZMKv6XVN


