スタンフォード大学とTogether AIの研究者ら(Mirac Suzgunら)が、web検索機能を持つ6種の商用LLMに日々のニュースに関する質問をさせて誤答の原因を分析したところ、誤りの71.5%は検索段階の失敗(該当情報を見つけられない「検索失敗」38.8%+関連ソースはあるが詳細が異なる「ソース相違」32.7%)が占め、モデル自体の推論能力の問題ではなかった。AIにニュースを尋ねる利用者にとっては、モデルの賢さより「そのモデルが何を検索してくるか」の方が正答率を左右するということだ。そして、AIに正しく引用されたい情報発信者にとっては、賢い文章を書くことより、検索エンジンやクローラーにコンテンツを正しく見つけ・取得させる「検索されやすさ」の方が効く——ベンチマーク上の賢さを競うフロンティアモデル間の順位の裏側で、実際の回答精度を左右しているのは検索インフラの側だという実証結果である。
さらに英語以外の言語、特にヒンディー語では正答率が79.3%と他言語・地域(88.9〜91.3%)より大きく落ち込み、ヒンディー語の質問に対しても英語版Wikipediaなど英語ソースを引用する「アングロフォン検索バイアス」が確認された。非英語圏向けのAIO最適化は、モデルへの働きかけではなく「その言語のネイティブソースがどれだけ検索・インデックスされているか」という、一段構造的な問いに行き着く。
何が起きたか
スタンフォード大学とTogether AIに所属する研究者ら(Mirac Suzgun, Emily Shen, Federico Bianchi, Alexander Spangher, Thomas Icard, Daniel E. Ho, Dan Jurafsky, James Zou)は、2026年2月9日〜22日の14日間、web検索機能を持つ6種の商用LLM(Gemini 3 Flash・Gemini 3 Pro・Grok 4・Claude 4.5 Sonnet・GPT-5・GPT-4o mini)に対し、BBCの6つの地域サービス(US & Canada=英語、Arabic=アラビア語、Afrique=フランス語圏アフリカ向け、Hindi=ヒンディー語、Russian=ロシア語、Turkish=トルコ語)のニュース記事に基づく質問を出題した。研究成果は論文「Evaluating Commercial AI Chatbots as News Intermediaries」(arXiv:2605.22785)としてまとめられている。
数字で見る
選択式(多肢選択)形式での正答率は次の通り。
| モデル | 選択式正答率 |
|---|---|
| Gemini 3 Flash | 95.6% |
| Grok 4 | 95.0% |
| Gemini 3 Pro | 93.7% |
| Claude 4.5 Sonnet | 90.4% |
| GPT-5 | 85% |
| GPT-4o mini | 69% |
出題形式を自由回答(フリーフォーム)に変えると、上位モデルでも正答率が11〜13ポイント、コホート全体では16〜17ポイント低下した。
誤答の原因を分類すると、検索段階の失敗が全体の7割超を占める。
| 誤答原因 | 件数・割合 |
|---|---|
| 検索失敗(Retrieval Failure) | 581件・38.8% |
| ソース相違(Source Divergence、関連ソースはあるが詳細が異なる) | 490件・32.7% |
| 上記2つの合計 | 71.5% |
地域別では、ヒンディー語(Hindi)の正答率が79.3%と最も低く、次に低い地域より約10ポイント低かった。他の地域は88.9〜91.3%の範囲に収まっている。
誤った前提を含む質問(false-premise questions)への正答率は、Grok 4が70.0%で他モデルを15ポイント以上上回った一方、GPT-5は19.0%と、6択形式の設問でほぼランダムな水準にとどまった。
仕組み・詳細
研究チームは誤答を「検索失敗」(そもそも該当する一次情報にたどり着けない)と「ソース相違」(関連する情報源は見つけているが、記載内容の細部が食い違う)の2種類に分類した。この2つを合わせると全誤答の71.5%に達し、モデルが取得した情報をどう解釈・要約したかという推論プロセスの誤りは、相対的に小さな割合にとどまった。
言語間の性能差についても、単なる言語処理能力の差ではなく検索段階のバイアスが関与している。ヒンディー語での質問に対しても、モデルは英語版Wikipediaなど英語ソースを引用する傾向が確認されており、研究チームはこれを「アングロフォン検索バイアス」と呼んでいる。非英語言語での検索時に、その言語のネイティブソースより英語ソースが優先的に取得・引用される構造があることを示す。
誤った前提を含む質問への耐性の測定では、質問文自体に事実と異なる前提が埋め込まれたケースを用意し、モデルがその前提の誤りに気づけるかを6択形式で検証した。Grok 4が高い耐性を示した一方、GPT-5は選択肢が6つある設問でほぼランダムな水準(19.0%)にとどまり、モデル間の差が大きいことが明らかになった。
背景
AIチャットボットは検索エンジンに代わってニュースを要約・回答する「情報仲介者」としての利用が広がっている。本調査は、その回答精度を実際のニュース記事とBBCの6つの地域サービスをもとに14日間にわたって定量評価した点に特色があり、正答率の単純比較だけでなく、誤答の原因を「検索」と「推論」に切り分けて分析した点が既存のベンチマークと異なる。
なぜ重要か
この結果が示すのは、AIチャットボットのニュース回答精度を左右しているのは主にモデルの推論能力ではなく検索インフラの側だという構造だ。AI検索エンジンやAIチャットボットに自社・自分の情報が正しく引用されることを目指す情報発信者にとっては、文章表現を磨くこと以上に、コンテンツがクローラーに正しく取得され、検索段階で高い確度で見つけられる状態を作ることが効く。
さらに非英語圏、特にヒンディー語で確認された「アングロフォン検索バイアス」は、日本語を含む非英語コンテンツの発信者にとっても他人事ではない構造的な示唆を含む。モデルの多言語対応力そのものより、その言語のネイティブソースがどれだけ検索・インデックスされているかが、AIによる正確な引用を左右する変数になりうるということだ。フロンティアモデルの賢さを競う競争の裏側で、検索インフラの整備状況こそが実際の回答精度を分けている——この非対称性が、AIに引用される側の情報発信者にとっての本当の勝負どころを示している。