AI日報|Kimiが2.8兆パラメータのK3モデルをリリース、Geminiエージェントが稼働、Xiaomiがロボットのデータ障壁を突破
今日のAI界隈も賑やかです。Kimiは2.8兆パラメータのオープンソースの怪物モデルを投入し、GoogleはAIエージェントが開発者の予算を使い切らないように工夫しており、OpenAIはユーザーのホームディレクトリを削除してしまうという大失態の修正に追われています。今日のまとめは以下の通りです。
2.8兆パラメータのオープンソースの怪物:Kimi K3
Kimiは、2.8兆パラメータを持つオープンソースモデル Kimi K3: Open Frontier Intelligence をリリースし、100万トークンのコンテキスト長をサポートしました。アーキテクチャ面では、KDAとAttnResを組み合わせて長文の注意機能と特徴抽出を処理し、Stable LatentMoE技術を通じて896個の専門家ネットワークのうち16個を精密にアクティブ化します。最も注目すべきは、ナノチップの設計と検証を48時間以内に自律的に完了したことです。Claude Fable 5やGPT 5.6 Solを全面的に超えたわけではありませんが、K3は現在、オープンソース界で無視できない重量級の選手です。
視覚知覚の真相:PerceptionBench評価
私たちはAIが画像を理解できると思っていますが、多くの場合、ただの当てずっぽうです。Kimiチームがリリースした PerceptionBench は、「視覚知覚」と「論理的推論」を分けてテストします。計数、深度知覚、空間位置決めなど3,000問を含むこのテストは、悲惨な現実を明らかにしました:現在、正解率が60%を超えるモデルは市場に存在しません。
OpenAIの青少年保護ネット
多くのティーンエイジャーが学習にChatGPTを頼っているため、OpenAIは専用の「学習モード」(Study Mode) をリリースしました。このモードは直接回答を提供するのではなく、質問を通じて思考を導きます。保護者用オプションと組み合わせることで、静かな時間を設定したり、敏感なコンテンツをフィルタリングしたりできます。Family Online Safety Instituteなどの組織も関連する協力の推進に参加しています。
Google検索が外部アプリを統合
Google検索のAIモードは、現在外部アプリケーションを直接連携 できるようになりました。AIにバーベキューのメニューを計画させる際、Instacartを通じて直接食材をショッピングカートに入れて決済できます。ポスターが必要ならCanvaテンプレートを呼び出し、音楽を聴きたいならYouTube Musicに連動してワンクリックで再生できます。
Gemini Notebookが登場
人気のNotebookLMはGemini Notebookに正式名称変更 されました。今回は、Google AI UltraおよびWorkspaceビジネスユーザー向けにクラウドコンピューティング環境が開放されました。つまり、あなたのデジタルノートブックで直接コードを記述、実行し、複雑なデータ分析を処理できるようになりました。
AIの暴走を防ぐGemini API管理エージェント
AIエージェントを自律的に動作させる際、最も恐ろしいのは予算のコントロール不能です。Googleが新たにリリースした Gemini Interactions API により、エージェントは隔離されたクラウドサンドボックス内でコードを書いたり、ネットサーフィンをしたりできます。予算の問題を解決するため、Googleは予算制御オプションを追加しました。開発者は max_total_tokens を設定するだけで直接ブレーキをかけることができます。また、新たに追加されたスケジュールトリガーにより、エージェントが毎日のデバッグやコードのクリーニングを自動実行できるようになりました。詳細は公式ドキュメントを参照してください。
Muse Spark 1.1がオンラインに
Metaの Muse Spark 1.1 がOpenRouterプラットフォームに正式上陸し、米国の開発者により多様なモデルオプションを提供してアプリケーションを構築できるようになりました。
Xiaomiロボットがデータボトルネックを突破
ロボットトレーニングの最大の難関は高品質なデータの不足です。Xiaomiは Xiaomi-Robotics-1 モデルをオープンソース化しました。彼らの方法は:まずモデルに10万時間の第一人称視点(UMI)ビデオを見て物理法則を学ばせ、次に144時間の実際のロボットデータで微調整するというものです。技術レポートによると、モデルは10時間未満のデモンストレーションを見るだけで物の収納を学ぶことができ、成功率は75%に達します。このモデルはすでに GitHub と Hugging Face でオープンソース化されています。
NVIDIA Nemotron 3 Embedがチャンピオンに
検索資料のミスはRAGシステムの致命傷です。NVIDIAが新たにリリースした Nemotron 3 Embed 8BモデルはRTEBリーダーボードで1位を獲得し、32kコンテキストをサポートします。Blackwellアーキテクチャと組み合わせることで、極めて高い計算効率を示し、AIエージェントが検索過程で繰り返される検索のロスを効果的に減らすことができます。
GPT-5.6によるユーザーファイル削除事件
AIがあなたの $HOME ディレクトリを削除した――地獄のようなジョークに聞こえますが、事実です。最近GPT-5.6が誤ってファイルを削除したという報告 がありました。ユーザーがサンドボックスを有効にせずにフルアクセスモードをオンにしていた際、モデルが一時ディレクトリを作成するために $HOME 環境変数を上書きし、誤ってホームディレクトリ全体を削除してしまったのです。OpenAIは緊急パッチを当て、追加のガードレールを追加しました。
SuperGrokがX Premium+を統合
コミュニティとAIの結合がさらに深まりました。SuperGrok Heavyを購読すると、X Premium+の資格が無料で付与されるようになりました。GrokでXアカウントをリンクするだけで有効化され、既存の有料サブスクリプションは次の請求サイクルで自動的に変換されます。
ソフトウェアを書くようにプロンプトを書く
すべての安全規範やドメイン知識を超長いプロンプトに詰め込むと、全体に影響が及びます。Googleチームはプロンプトを「モジュール化」するという概念を提案しました:異なるスキルを独立したファイルに分割し、コンパイラで組み合わせるのです。これにより、構築段階で構文や依存関係のエラーをキャッチし、CI/CDフローに直接統合できます。
Anthropicの100万行コード移行術
AnthropicはAIを使用して大規模なコード移行を完了する方法を公開しました。核心的な概念は:AIに直接コードを修復させるのではなく、「コードを産出するワークフロー」を修復することです。ルールブック、ストレステスト、自動コンパイル比較のワークフローを構築することで、AIエージェントは非常に短い時間で大規模プロジェクトの言語変換を完了できます。
Grok Mermaidターミナルフローチャート
Simon Willisonは、Grok CLIコードベースでRustで書かれたMermaidレンダラーを発掘しました。WebAssemblyを通じて実行され、Mermaid構文をターミナルで純テキストのUnicode境界線図に直接変換でき、レトロで実用的な美学を持っています。
ChatGPT Work文書処理アップグレード
ChatGPTはオフィスシーンのアップグレードを予告しました。ユーザーは会話インターフェースで直接ドキュメント、スプレッドシート、プレゼンテーションを作成、編集、レイアウトでき、AIの草稿を他のソフトウェアにコピー&ペーストする手間が省けます。
AI視覚を騙すDecoyフォント
「Decoy Font」は、AIの視覚的な弱点に対して設計された実験的なフォントです。モデルは画像を見る際、近距離で鮮明な前景画素を読み取る習慣があります。このフォントは干渉レイヤーを使用して、人間が数歩下がると隠されたメッセージを理解できるようにしつつ、AIには無関係な単語の羅列を読み取らせます。
Grok Automations自動スケジュール
Grokはタスク自動化機能を追加しました。タスクを一度説明すると、スケジュールや特定のメールに基づいてトリガーできます。例えば、毎朝8時に未読メールを読み取ってニュースを要約し、実行後の会話記録を保持していつでも引き継げるように設定できます。
Google Vidsデジタル分身
Google VidsはGemini Omniモデルを導入し、テキストや画像からビデオを生成できるようになりました。新たにリリースされた「デジタル分身」(Personal Avatars) 機能により、自撮り写真と録音をアップロードするだけで、AIがあなたに代わってプレゼンを行います。安全のために、生成されたビデオにはすべて目に見えないSynthID透かしが押されます。
1Passwordがエージェントのパスワード問題を解決
Claudeがウェブサイトにログインする必要があるとき(例:Stripeの売上を確認する)、パスワードはどう処理すべきでしょうか?1Passwordは解決策を提供しました:ユーザー承認後、1Passwordがバックグラウンドでクレデンシャルとワンタイムパスワード (OTP) を処理します。その過程で、Claudeは必要な情報を入手できますが、あなたの平文パスワードには全く触れることができません。
Q&A
- Kimi K3の技術的なハイライトは? 2.8兆パラメータのオープンソースモデルで、100万トークンのコンテキストに対応。アーキテクチャはKDA、AttnRes、Stable LatentMoEを組み合わせ、48時間以内にナノチップ設計検証を自律的に完了可能。
- Geminiエージェントはどうやって予算超過を防ぐ? Googleが管理する隔離サンドボックスで実行され、予算管理ガードレールを追加済み。開発者は
max_total_tokens上限を設定でき、スケジュールトリガーもサポート。 - PerceptionBenchが指摘した問題は? 「論理的推論」を取り除くと、AIの視覚知覚は当てずっぽうであることが判明した。現在の最強モデルでも基本視覚テストの正解率は60%を超えられない。
- Xiaomiロボットはどうやってデータ不足を解決した? 2段階トレーニング:まず10万時間の第一人称ビデオを見て物理法則を学び、次に7,200時間の実際のロボットデータで微調整。10時間未満のデモンストレーションで新しいタスクを学習可能。
- GPT-5.6のファイル削除事件は何が起きたのか? サンドボックスなしのフルアクセスモードで、モデルが一時ディレクトリを作成するために
$HOME変数を上書きし、誤ってユーザーのホームディレクトリを削除した。 - 1PasswordはどうやってAIエージェントのパスワードを守るのか? API統合により、1PasswordがバックグラウンドでクレデンシャルとOTPを入力。AIエージェントはログインしてタスクを完了できるが、パスワードには全く触れられない。


