AIデイリー|AnthropicがClaude PlatformのAgent機能を正式公開、MetaがMuse Spark 1.2を発表
モデルリリース・アップデート
Muse Spark 1.2 — Meta AI
- ひとことで言うと:空間知能と実世界での複雑なマルチモーダル推論に特化した最新モデル「Muse Spark 1.2」と評価指標「WildArtifactBench」が公開されました。
- 主なポイント:
- 画像・動画の理解から物理的なロボット操作、コード生成まで幅広く対応。デモでは両腕ロボットがデスク上の小物を識別・整理する高度な計画能力を実証しました。
- エージェント評価基盤「Agent Arena」において前世代(1.1)からスコアを2倍以上に更新。特にCLIエラーからの復旧(Bash Recovery)能力が大幅に向上しています。
- 実世界のマルチモーダルな課題に対するエージェントのパフォーマンスを測定する新たな評価フレームワーク「WildArtifactBench」も同時に公開されました。
- 技術仕様:マルチモーダル(テキスト/画像/動画/音声) / 非公開(研究プレビュー) / WildArtifactBench・Agent Arena準拠
- リンク:Meta AI Research Page /
Muse Spark 1.2 supports a broad range of multimodal tasks, from turning visuals into working code to translating perception into physical action. It also brings robust audio-visual understanding to enable video-heavy workflows common in real-world enterprise use.
— AI at Meta (@AIatMeta) August 20, 2026
Today, we’re… pic.twitter.com/ryDgr78s2p
Qwen-Image-3.0-Pro — 阿里巴巴 (Alibaba Qwen)
- ひとことで言うと:ピクセルレベルの精密な文字描画と長文プロンプト理解を備えた第3世代の画像生成・編集フラッグシップモデル「Qwen-Image-3.0-Pro」が登場しました。
- 主なポイント:
- Artificial Analysisの画像編集ベンチマークで第6位、文生図(Text-to-Image)で第9位を記録し、前世代からEloスコアを大幅に伸ばしました。
- 最大4,500トークンの非常に長い指示プロンプトに対応し、10ピクセル単位の極小テキストを12言語で歪みなく描画可能です。
- 阿里云(Alibaba Cloud Model Studio)にて1K解像度あたり0.04ドルの価格で提供開始されました。
- 技術仕様:画像生成・編集モデル / API提供 (阿里云) / 4.5k context / 12言語文字描画対応
- リンク:
Alibaba's Qwen-Image-3.0-Pro lands at #6 on the Artificial Analysis Image Editing Leaderboard and #9 on the Text to Image Leaderboard, up 83 and 48 Elo points on the previous Qwen Pro generation
— Artificial Analysis (@ArtificialAnlys) August 20, 2026
Qwen-Image-3.0 is the third generation of Alibaba's Qwen image family, spanning two… pic.twitter.com/aPltHwpZ20
Tenet — Harvey & Fireworks AI
- ひとすることで言うと:リーガルテックのHarveyがFireworks AIと共同開発した、契約書レビューや長時間におよぶ法務作業に最適化された法律特化型AIモデル「Tenet」が発表されました。
- 主なポイント:
- Moonshot AIの「Kimi K3」をベースモデルとし、公開法務データ、合成データ、法律エキスパートによる高品質な注釈データを組み合わせて事後学習(Post-training)を実施。
- 法律エージェント用ベンチマーク「LAB Contracts」で正解率を大幅に向上させ、SOTA(最高精度)を記録しました。
- 法律事務所や企業法務部における契約書精査、リスクアセスメント、デューデリジェンスの精度を飛躍的に高めます。
- 技術仕様:Kimi K3ベース / 商用API提供 / LAB Contracts 1位
- リンク:Harvey Tech Blog
Pika Music — Pika Labs
- ひとことで言うと:テキスト、歌詞、音声参照、音楽スタイルの4つのモダリティを同時に組み合わせて楽曲を生成できるマルチモーダル音楽モデル「Pika Music」が公開されました。
- 主なポイント:
- 従来のように別々のモデルをパイプラインで繋ぐのではなく、単一の潜在拡散(Latent Diffusion)デコーダー内でテキスト・音声を統合処理。
- 既存の音楽生成モデルと比較して最大10倍のコスト効率を誇り、短時間のトラック生成をわずかな費用で実現します。
- 開発者向け「Pika API Club」を通じてAPIアクセスが即座に可能です。
- 技術仕様:Latent-diffusionアーキテクチャ / API提供
- リンク:Pika Music Blog /
A closer look at our new Pika Music model, which accepts four input modalities: text, lyrics, voice references, and music references—individually or in combination.
— Pika (@pika_labs) August 20, 2026
Those signals meet inside one shared latent-diffusion decoder, which resolves musical structure, vocal character,… pic.twitter.com/vlsXmVZDMW
プロダクトリリース・アップデート
Claude Platform Computer Use / Skills API / Files API (GA) — Anthropic
- アップデート内容:AnthropicがClaude Platformにて「Computer Use」「Skills API」「Files API」を正式リリース(GA)しました。新ツール「Browser Use」が追加され、ピクセル情報だけでなくウェブページのDOM構造を直接認識してブラウザ操作を実行可能になりました。さらに、1ターンあたり複数の操作(クリック、入力、スクリーンショット取得など)をまとめて行うことで、やり取りの往復数を20〜40%削減し、タスクの処理速度向上とコスト削減を達成しています。
- 対象ユーザー:[AIエージェント開発者 / エンタープライズ開発チーム]
- 利用方法:Anthropic Announcementから詳細を確認し、Claude APIで即座に利用可能です。
GPT-Image-2 透明背景 API & Apple Messages プラグイン — OpenAI
- アップデート内容:OpenAIが「GPT-Image-2」APIにて透明背景(Transparent Backgrounds)画像の生成プレビューを開始しました。製品画像やデザイン素材を切り抜き不要でそのまま活用可能です。また、macOS版ChatGPTおよびCodex向けに「Apple Messages(メッセージ)」プラグインを公開。Mac上のChatGPTからメッセージ履歴の検索、要約、返信の下書き作成や代行送信が安全に行えるようになります。
- 対象ユーザー:[デザイナー / UI・UXエンジニア / Macユーザー]
- 利用方法:APIはOpenAI Developer Dashboardより、プラグインはmacOS版ChatGPTアプリ内の「Plugins > Public」からインストールできます。
- リンク:/
Transparent backgrounds are now available in preview for GPT-Image-2 in the API.
— OpenAI Developers (@OpenAIDevs) August 20, 2026
Generate reusable assets you can place on any background—for product imagery, graphic design, website mockups, and marketing campaigns. pic.twitter.com/yRhBIYh8uPEveryday conversations just got easier with the new Apple Messages plugin.
— ChatGPT (@ChatGPT) August 20, 2026
Search messages, catch up on conversations, draft and send replies—all with ChatGPT on your Mac.
Now available in ChatGPT Work and Codex on desktop. pic.twitter.com/nicfZMuxZc
Claude Code 「/design」スキル & Concise(簡潔)モード — Anthropic
- アップデート内容:ターミナル向けAIツール「Claude Code」に、デザイン編集ツール「Claude Design」のアートボードワークフローを直接呼び出す「/design」スキルが統合されました。CLI上でUIの試案をインタラクティブに作成・調整し、そのまま実コードへ落とし込めます。また、出力の冗長さを抑えて結論から簡潔に返答する「Concise」モードも追加されました。
- 対象ユーザー:[フロントエンドエンジニア / フルスタックエンジニア / UIデザイナー]
- 利用方法:Claude Codeの最新版(v2.1.238以降)へ更新後、
/designコマンドまたは/configから出力スタイルをConciseに変更して利用します。
Perplexity Agent API — Perplexity
- アップデート内容:Perplexityがマルチモデル対応の「Agent API」を正式リリースしました。OpenAI、Anthropic、Googleなど9社のプロバイダーが提供する全41種類の主要モデルに、単一のエンドポイントからアクセスできます。API内にはリアルタイムWeb検索、金融データ検索、ウェブスクレイピング、サンドボックス環境でのコード実行ツールがあらかじめ組み込まれています。
- 対象ユーザー:[AIエージェント開発者 / システムインテグレーター]
- 利用方法:Perplexity Developer Portalを通じて利用を開始できます。
Notion Agent Skills & 外部エクスポート — Notion
- アップデート内容:Notionが「Notion Agent Skills」機能をチーム全体に公開しました。チーム固有の業務手順やワークフローをSkill(スキル)として定義すると、Agentが文脈に応じて自動的に選択・適用します。作成したスキルはSKILL.md形式でダウンロードでき、Claude Code、Codex、Cursor、Gemini、Grokといった各種ローカルエージェント環境に持ち込んで共通のナレッジとして利用可能です。
- 対象ユーザー:[プロダクトマネージャー / 開発チーム / チームリーダー]
- 利用方法:Notionアプリ内のAgent設定画面からスキルの作成・共有・エクスポートが行えます。
- リンク:
Skills for your whole team are here.
— Notion (@NotionHQ) August 20, 2026
Most agents start from scratch. Skills teach them how your team already works.
Ask your Notion Agent to turn your team’s best work into a skill… then share it, let your agent load it automatically, or use it with your local agents. pic.twitter.com/bw2igoLRNY
Google Antigravity for Enterprise — Google Cloud
- アップデート内容:Google Cloudが、開発エージェント「Google Antigravity」をGemini Enterpriseサブスクリプションに標準統合しました。企業管理者は個別のライセンス管理不要で集中セキュリティ制御やトークン利用量の統合管理を行えます。同時に、VS Codeなどの主要IDE向けプラグインも一般提供され、開発者が使い慣れた開発環境から直接エージェントを活用できるようになりました。
- 対象ユーザー:[エンタープライズエンジニア / 開発部門管理者 / IT管理者]
- 利用方法:Google Cloud BlogからGoogle Cloudコンソール経由で設定可能です。
業界動向
NVIDIAがAIスタートアップpoolsideの「モデルファクトリー」事業を60億ドルで買収
- 概要:NVIDIAが、コード生成AI領域で注目を集めるスタートアップ「poolside」のモデル構築・学習インフラ部門(モデルファクトリー)を60億ドル(約9,000億円)で買収したと報じられました。poolsideの主要な研究者やエンジニアチームの多くがNVIDIAに移籍し、創業者は別会社として計算リソースを提供するクラウド事業者(Neocloud)への転換を図るとされています。
- 影響分析:NVIDIAは単なるGPUハードウェアベンダーにとどまらず、自社で最高峰のモデルやドメイン特化型エージェントを直接開発・提供する垂直統合構造を一層強化しています。半導体からモデル、エージェント基盤までを網羅する巨大AIエコシステム形成への布石と言えます。
- ニュースリンク:
proud that @vibhuuuus and i did the most recent pod with @eisokant on why NVIDIA just paid him $6B to buy the incredible model factory that is pumping out Thinky-beating models (actually not exaggeration, look at the numbers)
— swyx (@swyx) August 20, 2026
tune in / subscribe / whatever… https://t.co/rbdKxywB0r pic.twitter.com/UGIOGC19SK
OpenAIが新研究ブログ「AI Futures」を開設、高度AI社会のガバナンスを考察
- 概要:OpenAIは、超高度なAI(Transformative AI)の登場が世界の電力・国家ガバナンス・経済・個人の自由に与える影響を多角的に研究・議論するための新ブログ「AI Futures」をローンチしました。初回記事では、自律型システムや自動化された官僚組織の台頭によって国家や大企業へ過度に権力が集中し、個人の権利や合意形成が軽視されるリスクに対して警告を発しています。
- 影響分析:AI技術の急速な進展に伴い、安全保障や経済システムへの倫理的・政治的影響が現実味を帯びてきたことを示しています。OpenAIは技術開発だけでなく、政策提言やアライメント(価値観適合)に関する議論をリードする姿勢を明確にしています。
- ニュースリンク:OpenAI AI Futures Announcement
研究論文
Harness Continual Learning: ハーネス継続学習における「ハーネスレベルの忘却」の評価 — DAIR AI / 研究チーム
- 研究の背景:最新のAIエージェントはモデルの重み(ウェイト)を直接更新するのではなく、プロンプト、記憶ファイル、ツール定義、ルーティングルールなどの「ハーネス(Harness)」側で経験を蓄積・自己改善を行います。しかし、ハーネス内のコンポーネントを一部更新した際に、従来正しく動作していた機能が突然破綻する現象が発生していました。
- 主な革新点:研究チームはこの現象を「ハーネスレベルの忘却(Harness-level forgetting)」と名付け、定量的に測定する手法を確立。さらに、候補となる更新案(Candidate Harness)を作成した後に現在の改善率・過去機能の維持率・妥当性を厳密に評価してから適用を決定する「Guarded Harness Evolution(ガード付きハーネス進化)」アーキテクチャを提案しました。
- 研究成果:テキスト推論、マルチモーダル認知、オープンワールド対話など幅広いタスクにおいて、既存の構成を破壊することなく10%以上の相対性能向上を達成しました。
- 論文リンク:arXiv:2608.19013
記憶型自己改善エージェントの性能精度に関する再検証 — DAIR AI / 研究チーム
- 研究の背景:エージェントが過去の実行記憶を保存して自己改善する手法が多数発表されていますが、その性能向上値の真実性について疑義が生じていました。
- 主な革新点:先行研究で見落とされていた「複数回実行による分散測定」と「タスク実行順序のランダム化」を導入し、厳格な再評価を実施。デフォルトの固定されたタスク順序がもたらす暗黙的なカリキュラム学習効果が、みかけ上の性能向上の主因であったことを明らかにしました。
- 研究成果:評価環境のノイズを低減するためには、詳細な評価基準(ルーブリック)の付与と環境からの正確なフィードバックが不可欠であることを示し、今後のエージェント評価のあり方に重要な警戒と指針を提示しました。
- 論文リンク:
Finally a good paper testing whether memory-based self-improving agents actually improve.
— DAIR.AI (@dair_ai) August 20, 2026
The re-evaluation adds two things prior work skipped, multiple runs to measure variance and randomly shuffled task orders.
Both hurt.
Agent evaluation is already noisy on multi-step… pic.twitter.com/ACSukALzZY
その他の話題
Claude Academy — Anthropic
- 内容紹介:Anthropicが誰でも無料で学習できる公式AIラーニングプラットフォーム「Claude Academy」を公開しました。初心者の基礎概念理解から、プロフェッショナルによる高度なプロンプトエンジニアリングやワークフロー構築まで、体系的なコースを無償で提供しています。
- リンク:Claude Academy Hub
Bun 1.4 リリース & Vercel Functions でのサポート開始
- 内容紹介:JavaScript/TypeScriptランタイム「Bun」のバージョン1.4が正式リリースされました。実装言語がZigからRustへと完全再構築され、2,900件以上のバグ修正とNode.js互換性の向上が図られたほか、ブラウザ自動化を行う「Bun.WebView」等の新機能が搭載されました。Vercel Functionsでも即座にサポートが開始されています。
- リンク:Vercel Changelog - Bun 1.4
S1-mini — Superwhisper
- 内容紹介:Superwhisperが、音声認識(ASR)後の生テキストを整形・クリーンアップすることに特化した0.6Bパラメータの軽量オープンモデル「S1-mini」をHugging Faceで公開しました。Qwen3-0.6Bをファインチューニングしており、462MBという超軽量サイズで「えーっと」などのフィラー除去や正確な句読点・大文字化処理を高速に実行できます。
- リンク:MarkTechPost Article


