計算機科学者Melanie Mitchell氏が問うのは、AIの回答が正しいか誤りかではなく、その正解に至る認知プロセスが人間の推論様式とそもそも別物ではないか、という点だ。Mitchell氏はQuanta Magazineのポッドキャスト対談で、AIを乳幼児や動物と並ぶ「異星の知能」として位置づけ、人間との類推(擬人化)に頼らず対照実験や刺激のバリエーションで頑健性を検証する発達心理学・比較認知科学の手法——スタンフォード大学Mike Frank氏が提案した枠組み——をAI評価に応用すべきだと主張する。ベンチマークスコアを根拠にモデルを選定・比較する開発者や意思決定者にとって、この提案が意味するのは「同じスコアでも、どんな実験設計・対照条件で測られたかを問わない限り、能力の実態を取り違えかねない」ということだ。フロンティアモデルの性能争いがリーダーボードの順位に一点集中しがちな中、Mitchell氏の主張は順位という数字そのものの解釈可能性——測定方法が頑健でなければ、順位は擬人化バイアスの産物になりかねない——を問い直す視点の一つといえる。

何が起きたか

2026年8月20日、Quanta Magazineのポッドキャスト「The Joy of Why」(司会Steven Strogatz氏・Janna Levin氏)に計算機科学者Melanie Mitchell氏が出演し、AIの知能をどう理解し、どう測るべきかについて対談した。対談の副題は「Computer scientist Melanie Mitchell discusses why artificial intelligence doesn't 'think' or 'reason' like humans, and how we can create better methods for measuring machine cognition」——AIは人間のように「考え」「推論」しているわけではなく、機械の認知を測るためのより良い手法が必要だ、という趣旨である。

対談中で「異星の知能(alien intelligence)」という言葉を最初に持ち出したのはStrogatz氏で、"the alien intelligence of human babies... the alien intelligence of our pet dogs or smart birds or dolphins" と述べた。Mitchell氏はこれに対し「多くの人がAIを異星の知能と表現している。人間の言語や書籍などインターネット上のあらゆるものから学習していながら、人間とは大きく異なるからだ」と応じ、対談全体を通じてこの枠組みを自らの主張として使い続けている。

仕組み・詳細

Mitchell氏が対談の中で順に語った、AI評価を頑健にするための6つの原則は以下の通り。

  1. 自らの擬人化的な認知バイアスを自覚する(Be aware of your own anthropomorphic cognitive biases)
  2. 仮説に懐疑的になり、対照実験を組む(Be skeptical of hypotheses and develop control experiments)
  3. 刺激やベンチマーク項目の新規バリエーションを開発する(Develop novel variations of your stimuli or benchmark items)
  4. AIシステムをブラックボックス扱いする必要はない(These systems don't have to be black boxes)
  5. 性能(performance)と能力(competence)を区別して考える
  6. 失敗のパターンを分析し、否定的な結果を受け入れる(Analyze failure types and embrace negative results)

このうち1と2は、Mitchell氏が象徴的な逸話として挙げる「賢い馬ハンス(Clever Hans)」の事例と直結する。ハンスは計算問題に足で正解を叩き出せるとされた馬だが、実際には「出題者の顔の微妙な表情の変化を読み取っていただけだった」("he's reading subtle cues on the face of the person who's asking the question")。対照実験を欠いた観察は、動物やAIに人間的な認知能力があるという誤った結論を導きやすい、という警告としてMitchell氏はこの例を用いている。

背景

Mitchell氏によれば、AI評価に発達心理学の手法を取り入れるという着想の起点は、スタンフォード大学のMike Frank氏が発達心理学の観点から書いた論文にある。Mitchell氏は対談で「この着想は発達心理学の研究者、特にスタンフォード大学のMike Frank氏に取り上げられた。同氏は、AI研究者は乳幼児研究——発達心理学——から着想を得るべきだという論文を書いた。その後、他の研究者たちがこれを動物の知能へも拡張した」と説明している。乳幼児や動物は自己申告で「理解している」と言葉で答えられないため、発達心理学・比較認知科学では対照実験や刺激のバリエーションを駆使して能力を間接的に検証する手法が発展してきた。Mitchell氏は、これがAIの評価にも応用できると主張している。

なお、Frank氏の当該論文について、Quanta Magazineの記事中には書誌情報(掲載誌・URL等)の明示がなく、Mitchell氏の口頭言及にとどまる。論文自体の内容はこの記事の裏取り範囲外であり、未確認である。

なぜ重要か

Mitchell氏の主張の核心は、AIベンチマークの多くが暗黙のうちに人間的な推論様式を前提にしている、という点にある。乳幼児や動物の認知研究者たちが自己申告に頼れないからこそ磨いてきた「対照実験」「刺激のバリエーション」「性能と能力の区別」といった手法は、そもそも回答の背後にある推論プロセスを直接観察できないAIの評価にも同様に有効だ、というのがMitchell氏の立場である。

フロンティアモデルの新規発表がベンチマーク順位の推移で語られることが多い現状において、この提案が投げかけるのは「その順位は、どれだけ頑健な実験設計に支えられているのか」という一段深い問いだ。擬人化バイアスへの警戒を欠いた測定は、Clever Hansの逸話が示すように、実際には存在しない能力をあるかのように見せてしまう。ベンチマークスコアを根拠にモデルを選定・比較する実務者にとって、数字そのものだけでなく、その数字を導いた実験設計の頑健性を問う視点が今後ますます求められることになる。