OpenAIが公開したのは単発の証明ではなく、未公開の内部モデルが量産した数学論文の束そのものだ。719〜722本という規模に対し、Leanで機械検証されているのはトップライン結果の約42%にとどまる。AIの数学成果を引用・評価する研究者や記者は、「Lean検証済み」と「人間の読解待ち」を分けて扱う必要がある。これは、AIの自律的な研究成果が相次ぐ流れの中で、律速が「証明を作ること」から「証明を検証し、功績を帰属させること」へ移ったことを示す動きだ。本当の問いは、生成の速度に検証の速度がいつ追いつくのか、そして誰が残りを検証するのかにある。

何が起きたか

OpenAIは2026年10月6日、内部の未公開フロンティアモデルが生成した数学の成果をGitHubリポジトリ「openai/math」で公開した。OpenAI Developer Communityの投稿は、公開物を「722 manuscripts organized into 372 related result families」と説明している。一方、リポジトリのREADMEは719本と記し、両者の数字は食い違っている(取得時点の差の可能性がある)。

見出しなどで流通した「372件の成果」は、論文数ではなく結果のファミリー数である。論文そのものは719〜722本ある。

数字で見る

  • 論文数: READMEは719本、OpenAI投稿は722本。372は関連する結果のファミリー数
  • Lean形式化: トップライン結果の約42%。投稿は「Computer-checkable Lean proofs for many, but not all, manuscripts」と、全件ではないことを明記している
  • 計算量: 1結果あたり平均でChatGPT Pro相当の約3時間分の思考計算(OpenAI自身の見積もり)
  • 評価の母集団: 約4,000問を対象にした評価に由来する
  • 付属資料: モデルの推論の要約10件、引用・改訂のプロトコル(過去版は参照可能なまま残る。各論文のディレクトリにBibTeXがある)

仕組み・詳細

公開方針は、高等研究所(IAS)の独立した「Advisory Group on Mathematics and Artificial Intelligence」の助言を得て策定したとOpenAIは説明している。一方、proofsandprompts.comの記事は、実際の公開がこのグループの推奨の一部から乖離したと述べている。これは同サイトの指摘であり、本稿では独立には確認していない。

背景:検証をめぐる反応

Scott Aaronson氏は2026年10月7日のブログ記事「The Mathocalypse」で、「it also appears that no human has understood just about any of these proofs yet; the race to do so has just started.」と書いた。「ほぼ全て」という限定つきの観察であり、同氏個人の見解である。

論文の質については、Dana Moshkovitz氏の評として「the paper is so horribly written that it's impossible to read it without AI help.」が引かれ、Aaronson氏自身も「The citations are often irrelevant and confusing.」と述べている。ただしこれは特定の1論文に対する評価であり、719〜722本全体に一般化することはできない。

数学コミュニティの反応は一枚岩ではない。proofsandprompts.comは、10月6日の発表を受けた100以上の反応を「コミュニティの現時点の感触のスナップショット」として公開している。

なぜ重要か

  • 使う側の実務: 形式化されたものは機械が正しさを担保し、そうでないものは人間の読解という別の経路で検証されるため、同じリポジトリの中に信頼度の異なる成果が混在する。引用する際は、どちらに属するかを確認する必要がある
  • 大きな流れ: AIが暗号解読・数学・インフラ最適化で自律的な成果を出す事例が続く中、この件は「成果の量」が人間の検証能力を上回る局面を具体的な数字で示した

未検証の事項

  • 成果の数学的な正しさと新規性は、本稿では検証していない。Lean形式化されているのは約42%に限られる
  • OpenAIが数学コミュニティ向けにワークショップ・会議を資金提供する計画があるとの報道は、一次ソースで確認できなかったため未検証である
  • 今回の件が以前のNavier-Stokes案件と同種の検証負荷を持つという論評も、一次ソースに記述がなく未検証である
  • OpenAI投稿・READMEの引用は要約経由で取得したもので、原文での再確認が望ましい