AIデイリー|Claude Haiku 5.5発表、Arena B輪2億ドル調達、Google医療AI研究公開
モデルリリース・アップデート
Claude Haiku 5.5 — Anthropic
- 要点:Anthropicは、高ボリュームかつコスト効率に優れた次世代の高速軽量モデル「Claude Haiku 5.5」を発表しました。
- 価格とコスト削減:10万トークン以下のリクエストにおいて前世代比で約90%安価となり、平均実行コストが約75%削減されました。
- 新機能と対応:Haikuシリーズとして初めて「投入力度(effort)」の調整機能が搭載され、主要クラウドや開発プラットフォームで直ちに利用可能です。
- リンク:Anthropic 公式発表
Mellum 2.1 — JetBrains
- 要点:JetBrainsは、強化学習によりコードベース内の自律探索や編集能力を強化した12BのMoEモデル「Mellum 2.1」をオープンソースとして公開しました。
- モデル構成:アクティブパラメータ数2.5BのコンパクトなMoEアーキテクチャを採用し、Apache 2.0ライセンスで提供されます。
- 強化学習の活用:数百万回におよぶサンドボックス環境での強化学習を経て、リポジトリ内の探索やコード修正、自己検証能力が大幅に向上しています。
- リンク:JetBrains 公式ブログ
プロダクトリリース・アップデート
OpenDocRouter — LlamaIndex
- 要点:LlamaIndexは、130種類以上の最新フロンティアおよびオープンウェイトモデルを統合し、文書パースやOCR処理をシームレスに行える統一API「OpenDocRouter」を発表しました。
- 統合と機能:ParseBenchをベースにプロンプト調整やデプロイ管理を一本化し、バウンディングボックスやレイアウト情報を含む位置情報の根拠を付与します。
- モデル対応:LightOn OCR-3などの最先端モデルが統合されており、開発者が最適な価格と性能のモデルを選択できるよう支援します。
- リンク:
GPT-6.1 Sol Ultrafast — OpenAI
- 要点:OpenAIは、インタラクティブなアプリケーションや迅速なコード生成に向けて、通常のSolモデルの最大8倍の速度を実現する「Ultrafast」モードの提供を開始しました。
- 展開プラットフォーム:API、Codex、ChatGPT Workにおいて本日からロールアウトされ、米国およびEUのデータレジデンスをサポートしています。
- 料金と用途:API価格は入力100万トークンあたり12ドル、出力あたり60ドルに設定され、障害デバッグやライブ体験などの高速処理が求められる用途に最適化されています。
- リンク:
業界動向
Arena Series B & Alignment Index — Arena
- 要点:AIモデルの評価プラットフォームを手掛けるArenaは、LightspeedとKhosla Venturesが共同主導する2億ドルのB輪資金調達を完了し、評価額が31億ドルに到達したと発表しました。
- 資金調達と事業成長:年化収益が1億ドルを超え、累計3億5000万回以上のセッションと6200万回の投票を処理するなど、急速な成長を遂げています。
- Alignment Indexの発表:実際のAIエージェントの挙動を評価する新しい「Alignment Index」を同時発表し、20以上のフロンティアモデルの安全性とアライメントを測定しています。
- リンク:
OSS Scanner — Anthropic
- 要点:Anthropicは、オープンソースプロジェクトを対象に、同社の最先端モデルを活用して定期的なセキュリティ脆弱性スキャンを無料で提供する「OSS Scanner」を発表しました。
- サービス内容:参加するオープンソースプロジェクトに対し、モデル生成による概念実証や脆弱性解説、修復提案を含むレポートを定期的に提供します。
- 背景:近年AIツールによるコード解析が進む中、オープンソースメンテナーが抱えるセキュリティ監査の負担軽減とエコシステムの安全性向上を図るものです。
- リンク:The Verge 報道
研究論文
AMIE Clinical Study — Google Research
- 要点:Googleが開発した医療対話システム「AMIE」に関する前瞻的臨床研究が『The Lancet』誌に掲載され、実際のプライマリケア門診における医患関係の強化や診断支援の有効性が示されました。
- 研究結果:就診前にAMIEと対話した患者は自信と整理力が向上し、臨床医の75%が診療準備に役立ったと回答、鑑別診断の一致率は90%に達しました。
- 臨床的意義:臨床医が対話記録を事前確認することで時間を節約し、患者との協調的診療や共同意思決定に集中できるようになることが確認されました。
- リンク:Google Blog 発表
FlowAgent — Google Research
- 要点:Googleの研究チームは、提出前のテスト失敗に対してReActスタイルの生成・検証ループを実行し、コードレビューツール上で自動修復提案を行う「FlowAgent」を発表しました。
- フィルター機構:実行前後の2つの棄却フィルターを備えており、不十分な提案が開発者に届くのを防ぐ仕組みになっています。
- 成果:195件の実例を用いた手動レビューでは修復の67.18%が正確であることが確認され、全社展開後には多数の変更に適用されています。
- リンク:
その他の話題
Thinking Mode — Midjourney
- 要点:Midjourneyは、プロンプトの正確性、文字のレイアウト、画面の連貫性を向上させる新しい「Thinking Mode」をAlphaサイト上でテスト公開しました。
- 機能と効果:ユーザーはタスクのlightboxから「Rerun (Thinking)」を選択して実行でき、複雑な指示に対する描画精度が改善されます。
- 利用環境:現在、alpha.midjourney.comのプラットフォーム上でテストが行われており、コミュニティからのフィードバックを収集しています。
- リンク:Midjourney Update
ML Drift — Google AI Edge
- 要点:Google AI Edgeチームは、LiteRTの中核GPU加速層として動作するクロスプラットフォームの端側GPU推論計算エンジン「ML Drift」をApache 2.0ライセンスでオープンソース公開しました。
- オープンソース化:TFLite GPU delegateの後継として、端側デバイスでの効率的なGPU AI/ML推論を支える計算エンジンとして提供されます。
- 開発者支援:クロスプラットフォームでの高性能な推論処理を軽量に実装できるよう設計されており、モバイルやデバイス側のAI開発を加速します。
- リンク:Google Developers Blog
