AIデイリー|Claude Opus 5.5とGPT-6 Sol/Lunaが同時リリース、API価格の引き下げとエージェント向け機能の進化が加速
モデルリリース・アップデート
Claude Opus 5.5 — Anthropic
- ひとことで言うと:Claude Fable 5.1級の優れた性能を維持しながら、コストを前世代のOpus 5から40%削減し、出力速度を30%以上向上させたClaude 5.5ファミリーの最初のフラグシップモデルです。
- 主なポイント:
- 入力4ドル、出力20ドル(百万トークンあたり)に価格改定され、キャッシュ読み取り費用も60%減(0.20ドル)に引き下げられたことで、エージェントやコーディングタスクでのトータルコストが大幅に低下。
- Terminal-BenchやGDPval-AAなどのベンチマークで高い成果を挙げるとともに、文章の自然さや重要情報の前置といったコミュニケーションスタイルが刷新。
- 安全保障分野では外部評価機関(METRなど)による事前評価が実施され、強力な安全対策が継続して適用されています。
- 技術仕様:1Mコンテキストウィンドウ / コスト40%削減 / 出力速度30%向上
- リンク:Anthropic 公式ブログ /
GPT-6 Sol & GPT-6 Luna — OpenAI
- ひとことで言うと:GPT-6 Astraの先進技術を継承し、プロフェッショナルな業務から高頻度なエージェント処理まで幅広く対応しながら、API価格を前世代のプロモーション価格からさらに50%引き下げた軽量・中位モデルです。
- 主なポイント:
- Solは複雑なプロフェッショナル業務や長時程のコーディングに、Lunaは高スループットなエージェントワークフローや日常タスクに最適化。
- 提示詞キャッシュ(プロンプトキャッシュ)の効率が大幅に向上し、キャッシュヒット時の入力トークン割引が最大90%に達するほか、専用の診断ダッシュボードが新設された。
- ChatGPT WorkやCodexのほか、OpenAI APIや各種ゲートウェイを通じて即日提供が開始された。
- 技術仕様:GPT-6ファミリ / API価格50%引き下げ / 提示詞キャッシュ最大90%割引
- リンク:OpenAI 公式ブログ /
MiMo-V2.6 (Pro & Flash) — 小米 (Xiaomi)
- ひとことで言うと:総パラメータ1.02T、アクティブ42BのMoE構造を採用し、大規模な強化学習(MixRL)により構築された小米(Xiaomi)の最新オープンウェイト・マルチモーダルモデルです。
- 主なポイント:
- Artificial Analysisの総合インデックスで46点を記録し、同日発表されたGrok 4.7と並びトップクラスのオープンウェイト性能を証明。
- 75万条以上のRL軌跡を用いた数千ステップの強化学習により、コーディングやツール呼び出しといったエージェント能力を高度に強化。
- プロ版およびフラッシュ版ともにMITライセンスでオープンソース化され、トレーニングフレームワークや専用の環境も同時公開された。
- 技術仕様:1.02T総パラメータ(アクティブ42B) / オープンウェイト(MITライセンス) / 100万トークンコンテキスト
- リンク:小米 MiMo 公式ドキュメント /
プロダクトリリース・アップデート
Worker Previews — Cloudflare
- アップデート内容:Cloudflare Workersにおいて、各Gitブランチごとに本番環境と同等の独立したプレビュー環境(コード、設定、URL、観測性、状態を完備)を自動構築できる「Worker Previews」機能が発表されました。
- 対象ユーザー:AIエージェントによる自動コーディングやCI/CDパイプラインを運用するバックエンド開発者、インフラエンジニア
- 利用方法:Cloudflare 公式ブログ /
Kimi Browser Extension — Moonshot AI (Kimi)
- アップデート内容:従来の「Kimi WebBridge」が「Kimi Browser Extension」へとリブランドされ、Chromeウェブストア等で正式公開されました。ブラウザのサイドバーから直接Kimiと対話し、ウェブのナビゲーションやフォーム入力を自動化できるほか、反復的な操作を「Skill」として記録・再利用できるようになりました。
- 対象ユーザー:ブラウザ上の定型作業を効率化したいビジネスパーソン、開発者
- 利用方法:
Scribe v2 Medical — ElevenLabs
- アップデート内容:臨床音声の認識に特化した音声認識モデル「Scribe v2 Medical」がElevenAPIを通じてリリースされました。医療分野の専門用語(薬剤名、解剖学、病理学など)の単語誤り率(WER)をベースモデル比で18%削減し、HIPAA適合やゼロ保持モード(Zero Retention Mode)を完備しています。
- 対象ユーザー:医療・ヘルスケア分野で音声をテキスト化する開発者、医療従事者
- 利用方法:
業界動向
Firecrawl、シリーズBで7,500万ドルを調達し、AIエージェント向け知識ライブラリ「Alexandria」を発表
- 概要:Web構造化データの「Firecrawl」がSmash Capital主導で7,500万ドルのシリーズB資金調達を完了し、150万人以上の開発者が利用するAPIに続き、エージェントがライブウェブや公式データ、専門研究に即座アクセスできる知識ライブラリ「Alexandria」を立ち上げました。データ提供者が報酬を受け取れるエコシステムも構築されます。
- 影響分析:AIエージェントが「知る」だけでなく「正確で構造化された検証済みデータ」を大規模に取得するためのインフラが急ピッチで整えられており、エージェントの自律的な情報探索能力の向上を強力に後押しします。
- ニュースリンク:/
研究論文
DualSQL: Multi-Agent Reinforcement Learning for Text-to-SQL — Google等の研究チーム
- 研究の背景:従来のText-to-SQLシステムは単一モデルに依存することが多く、複雑なデータベーススキーマやマルチホップクエリへのスケーリングに限界がありました。
- 主な革新点:質問を適切なテーブルやコードに結びつける役割と、実際のSQLを記述する役割の2つのエージェントに分割し、同一のモデルウェイトからマルチエージェント強化学習(Multi-Agent RL)によって協調学習させる「DualSQL」フレームワークを提案。
- 研究成果:わずか3,755件の例を用いた学習にもかかわらず、DualSQL-4BがBIRDベンチマークで68.0%の実行精度を記録し、従来の7Bモデルに匹敵。DualSQL-8Bは71.1%を達成し、32Bパラメータを持つ従来の単一モデルシステムを上回りました。
- 論文リンク:
その他の話題
大模型の価格破壊とエージェント常時稼働の現実化
- 内容紹介:Claude Opus 5.5とGPT-6 Sol/Lunaの同日リリースに伴い、AI APIのコストパフォーマンスが劇的に向上しています。開発者コミュニティや識者からは、インフラコストの低下がエージェントの常時稼働や複雑なオーケストレーションを現実にしているという声が上がっており、価格破壊と性能向上の両立が新たな標準になりつつあります。
- リンク:Simon Willisonのブログ
