
最強のAIであっても画像を「見誤る」:PerceptionBenchがもたらす視覚的現実への衝撃
現代の大規模言語モデルが複雑なコードさえ書けるようになった今、画像を見て理解することなど容易いことだと私たちは錯覚しがちです。しかし、事実は全く逆です。GPTやKimiのようなトップモデルに最も基礎的な画像認識を行わせると、多くの場合、彼らは単に「当てずっぽう」に猜疑しているに過ぎません。この「AIの視覚はすでに完璧である」という幻覚を打ち砕くために、Kimiチーム(Moonshot AI)は最近、視覚感知評価ツール「PerceptionBench」を発表しました。このツールは、現在のマルチモーダルモデルが物理世界を理解する際に抱える共通の苦境を直接突きつけました。
なぜ今までこの問題に気づかなかったのか?
その理由は、従来の視覚評価(VQA)が「画面の理解」と「論理的推論」を結びつけていたことにあります。
例えば、ぼやけたリンゴの木の写真をAIに見せて「リンゴはどこにある?」と尋ねたとします。AIが画素を全く認識できていなくても、トレーニングデータに蓄積された言語的な常識から「リンゴは木に成る」と推論できてしまいます。このような投機的な回答戦略により、実際には「よく見えていない」という事実が完璧に隠蔽されてきました。
この「視力の悪さ」という欠陥は、実験室内では些細なことに思えるかもしれません。しかし、現実世界、例えば物流倉庫で正確に物を掴む必要があるロボットや自動運転システムに応用された場合、一度の画素レベルの認識ミスが、深刻な物理的衝突や効率的な災害を招く恐れがあります。
PerceptionBenchのアプローチは、推論能力を徹底的に排除し、最も純粋で基層的な「原子感知能力(Atomic Perception)」をテストすることに焦点を当てています。人為的に設計された常識外れのシナリオを通じて、AIが言語ロジックに頼って不正解を回避する道を完全に遮断しました。
テスト結果:60%という越えられない精度の壁
「推測」が許されなくなったとき、現時点で最も優秀なモデルであっても、純粋な視覚感知テストにおいて60%の合格ラインを突破することさえできません。
PerceptionBenchのランキングにおいて、GPT-5.6-Solは59.7%というスコアしか出せず、Kimi-K3が58.5%、Claude-Fable-5が57.2%と続きます。論理的推論という杖を取り上げられると、トップモデルの誤答率は40%を超えてしまいます。
画像出典: https://www.kimi.com/blog/perception-bench
このような性能は、実際の使用においては「不安定さ」として現れます。同一モデルに同じ画像を繰り返し尋ねると、回答が前後矛盾することが頻繁にあります。「写真に5人いる」と答えた直後に「6人いる」と修正するのです。これは、AIが堅牢な視覚神経を構築しておらず、多くの場合、正解は単なる幸運に過ぎないことを示しています。
このテストはどのように設計されているのか?
開発チームは、40以上の視覚テストにおける既存モデルの失敗事例を分析し、3,000の実践的なサンプルをまとめました。これは10の基礎感知カテゴリーをカバーしています。
- 空間と定位:物体の遠近、遮蔽、前後左右の関係を判断する(ロボットアームの把持に不可欠)。
- 詳細と文字認識:微細な特徴の抽出、OCR文字認識、計数。
- 関係と比較:視覚的関係、属性比較、文脈統合。
- 幻覚テスト:存在しない物体をAIが見てしまうかどうかを検証する。
これらの設問において、AIは純粋に「見て」回答しなければならず、外部の常識に頼って推論することは一切できません。
画像出典: https://www.kimi.com/blog/perception-bench
なぜAIは「賢い盲人」になってしまったのか?
問題は、私たちがこれまであまりにも「パラメータの積み上げ」と「言語ロジック」に依存しすぎていたことにあります。
現在のマルチモーダル大規模言語モデル(MLLMs)は、トレーニング時に豊富な言語的事前知識に大きく依存しています。これにより、モデルのパラメータを増やすことは論理推論やプログラミング、執筆能力の向上には大いに役立ちますが、精細な空間認識や計数、あるいは3D構造といった純粋な視覚タスクに直面したとき、本質的には画面を真に「見て」いるのではなく、言語ロジックに頼って「推測」しているに過ぎません。
この「脳は発達しているが目は霞んでいる」という構成は、現実世界では大きなリスクを伴います。もしAIエージェントがオペレーティングシステムの高い権限を持ちながら正確な環境の視覚感知を欠いていれば、「2個のバッテリー」を「3個のバッテリー」と見誤るような原子レベルの視覚的偏差だけでも、自動化タスクが災害へと一変する恐れがあります。
開発者が最も気になるいくつかの質問
- なぜ同じ質問を繰り返すとモデルによって回答が異なるのか? 多くのモデルは、基礎的な視覚の質問に答える際、真の感知(perceive)ではなく運任せの「推測(guess)」を行っているためです。堅牢な基盤となる視覚的特徴抽出能力を欠いている場合、その出力結果が複数回の質問において一貫性を保てないのは当然です。
- PerceptionBenchと他のテストとの最大の違いは何ですか? 最大の違いは「不正解回避(アンチチート)」機能です。10のカテゴリーと3,000の設問はすべて、40以上の既存の視覚テストにおけるリアルな失敗事例から抽出されたものです。モデルが常識推理に頼って視覚的欠陥を補うことを強制的に禁止し、最も真実味のある原子感知能力を測定します。
- これは将来のAI発展にどのような影響を与えますか? 各研究室に対し、評価とトレーニング戦略の再考を強制します。PerceptionBenchは精緻な診断ツールを提供しており、今後のマルチモーダルモデル開発は、これらの基盤となる視覚的弱点を正面から受け止め解決しなければ、真に誠実で一貫した視覚AIシステムを構築することはできません。
結論: 「推測」から「見る」へ
この評価は単なるランキング競争ではなく、一つの安全境界線です。
私たちが「モデルパラメータが大きければすべて理解できる」という迷信を捨て、R&Dリソースの一部を基盤となる視覚的特徴抽出の強化に割くとき初めて、AIは真に目を開く機会を得るでしょう。物理世界でしっかりと歩みを進めるためには、賢い脳があるだけでは不十分であり、まずAIは「道をしっかり見る」ことを学ばなければなりません。
Q&A (Q&A)
Q1:AIの視覚精度が60%未満なのに、ChatGPTやKimiで画像を読むとスマートだと感じるのはなぜですか? A: 私たちが普段入力する画像や質問は、AIが「言語ロジック」や「常識」を駆使して視覚の不足を補えるものだからです。例えば、キッチンという背景と人の影がぼんやりと見えていれば、手元に持っている道具がはっきり見えなくても、その人が料理をしていると「推測」できます。PerceptionBenchの厳しさは、常識に頼る道をすべて遮断し、純粋に「見て(原子感知)」答えを出すことを強制することで、底にある「視覚的欠陥」を露呈させている点にあります。
Q2:PerceptionBenchは具体的にどのような「原子感知」能力をテストしていますか? A: この評価の3,000問は空想の産物ではなく、40以上の既存の視覚テストにおけるリアルな失敗事例から抽出されています。視覚的関連性(Visual Relation)、計数(Counting)、属性(Attribute)、深度と3D感知(Depth & 3D)、空間定位(Localization)、視覚的比較(Comparison)、微細識別(Fine-grained Recognition)、文脈統合(Context Integration)、OCR文字認識、そして幻覚(Hallucination)テストという、最も無視されがちな10の基礎視覚能力を網羅しています。
Q3:ランキングで現在最も優秀なモデルはどれですか?点差は大きいですか? A: 公式最新ランキングによると、現在のトップ3はGPT-5.6-Sol(59.7%)、Kimi-K3(58.5%)、Claude-Fable-5(57.2%)です。業界で最も強力とされるマルチモーダルモデルであっても、スコアが非常に僅差であるだけでなく、例外なく合格ライン(60%)を下回っています。これは「視覚感知能力の低さ」が単一企業の欠点ではなく、AI業界全体が直面している底層アーキテクチャのボトルネックであることを示しています。
Q4:企業プロジェクトで画像処理(自動レポートや視覚検知など)にマルチモーダルAIを導入する場合、実践的なアドバイスはありますか? A: PerceptionBenchが明らかにした通り、現在のモデルは多くの場合「運任せの推測」を行っており、同一画像に対して回答が不安定になります。したがって、医療画像補助、工業的欠陥検知、あるいは精細な物理ロボット操作のような重要タスクに適用する場合、マルチモーダル大規模モデルを唯一の判断ノードとして絶対に使用してはなりません。60%という視覚の壁が完全に突破されるまで、従来のコンピュータービジョンアルゴリズム(専門的なオブジェクト検出モデルなど)による二重検証を併用するか、「人間による協調審査(Human-in-the-loop)」の仕組みを保持することを強く推奨します。


