AI研究者Zafir Stojanovski氏(Reasoning GymのNeurIPS 2025 Spotlight採択に関わるコア貢献者)が、フロンティアモデルの学習パイプラインに起きている構造変化を、判定モデル(judges)・コーパス・教師モデル(teachers)・カリキュラム・RL環境という5つの要素に整理した。かつて人間が生成・選別・採点していたこれらの要素は、十分に強いモデルが育つと生成・選別の役割ごとモデル自身へ引き継がれる——GPT-4を審判役に使う「LLM-as-a-judge」は、人間評価者同士の一致率とほぼ同水準(約80%)の一致率にまで達した。学習パイプラインを設計する開発者にとっては、評価や教師データの多くを人手でなくモデル自身の判定・生成でまかなえる段階に入ったことを意味し、データ収集・アノテーションのコストと律速が変わる。だがこの整理が線を引くのは、その先だ。模倣(SFT)は訓練データを記憶するだけで未知タスクへの汎化に乏しいのに対し、検証可能な報酬を持つRL環境でのオンポリシー学習は汎化する——判定・コーパス・教師・カリキュラムの多くをモデル自身が担うようになった今、学習パイプラインの品質を最終的に担保するアンカーは、模倣ではなく、サンドボックス・ハーネス・検証器(verifier)を備えたRL環境をどれだけスケーラブルに設計できるかに移りつつある。フロンティアモデル開発競争の主戦場は、データ量の獲得から環境設計の巧拙へ、静かに移行し始めている。

何が起きたか

Zafir Stojanovski氏が個人ブログに「Recursive Synthetic Improvement」と題する分析記事を2026年9月4日に公開した。記事は「Judges」「Corpora」「Teachers」「Curricula」「Environments」の5節構成で、フロンティアモデルの学習パイプラインを構成する各要素が、人間による生成・キュレーションからモデル自身による生成・キュレーションへ移行していく共通パターンを整理している。この記事は、ニュースレターTLDR AIが2026年9月13日頃に取り上げたことで広く知られるようになった。ブログ公開(9月4日)からニュースレター紹介まで約9日のラグがある。

なお、ニュースレター内のリンクはX(旧Twitter)の投稿へリダイレクトされたが、投稿本文自体はアクセス制限(402 Payment Required)のため直接確認できなかった。リダイレクト先アカウント名と、Web検索で特定した個人ブログの著者名が一致し、同ブログに同一タイトルの記事が存在することを確認できたため、このブログ記事を一次ソースとして採用している。X投稿そのものの文言は未確認だが、主張の裏取りはブログ記事本体で完了している。

仕組み・詳細

Stojanovski氏の整理によれば、学習パイプラインの各要素は次のパターンを辿る。「成果物(artifact)は当初、大部分が人間によって生成・選別される。その手法を検証できるだけの強いモデルのベースラインが訓練されると、その成果物の生成・選別はモデルへ引き継がれる。合成データが改善するにつれてそれで学習するモデルも改善し、そのモデルが次世代モデルのためのさらに優れた合成データを生成する」という循環構造だ。

5要素のうち、一次ソースで具体的な裏付けが取れているのは次の2点である。

  • 判定モデル(judges): 強力な既製LLMを審判役として使う「LLM-as-a-judge」の有効性を検証した研究では、GPT-4が人間評価者とおよそ80%の一致率を記録し、これは人間評価者同士の一致率とほぼ同水準だった。
  • カリキュラム(curricula): 学習順序自体をモデルがブートストラップするようになっている例として、STaR(Self-Taught Reasoner)が挙げられている。STaRは各ラウンドが「前のラウンドで解けなかった問題を解く」という暗黙のカリキュラムを形成する。

コーパス・教師モデルについては、上記の一般的な循環パターン(人間生成→モデル生成への移行)が同様に当てはまる要素として名指しされている。

もう一つの柱がRL環境だ。RL環境は「エージェントが何らかの目標を達成するために生きる世界」と定義され、サンドボックス・ハーネス・検証器(verifier)の3要素で構成される。ここで強調されるのが、模倣とオンポリシー学習の違いだ。オンポリシー学習(逆KL最小化)は「モードを求める」性質を持ち、学習者は自分のサンプルから到達できない領域にわずかでも確率質量を置くとペナルティを受けるため、自分が到達可能な領域を先鋭化させる。そして実在する先行研究「SFT Memorizes, RL Generalizes」は、SFT(教師あり微調整)が学習データを記憶する傾向がありドメイン外への汎化に乏しい一方、結果ベース報酬によるRLは未見タスクへの汎化がはるかに優れることを示している。

数字で見る

  • 約80%: LLM-as-a-judgeでGPT-4が記録した、人間評価者との一致率(人間評価者同士の一致率とほぼ同水準)
  • 5: 記事が整理する学習パイプラインの要素数(judges / corpora / teachers / curricula / RL environments)
  • 約9日: ブログ公開(2026年9月4日)からニュースレターTLDR AIによる紹介(2026年9月13日頃)までのラグ

背景

著者のZafir Stojanovski氏は、Reasoning Gym(NeurIPS 2025 Spotlight採択)のコア貢献者で、ML担当としてLoka、リサーチ担当としてOpen-Thoughtに関わる。強化学習・継続学習・RLHF・モデル評価を専門領域とする。

記事が引用する先行研究のうち、STaR(Self-Taught Reasoner)はモデルが自分の推論過程を自己生成し、それを使って自分自身を再学習させる手法として知られる。「SFT Memorizes, RL Generalizes」は、模倣学習と強化学習の汎化性能の違いを実証した研究として引用されており、本記事の中心的な論点——模倣を超えるにはオンポリシー学習とスケーラブルなRL環境が重要になる——の根拠になっている。

なぜ重要か

この整理が示す再帰ループは、フロンティアモデル開発競争の主戦場を静かに移動させつつある。新モデルの発表がベンチマーク順位を競う一方で、その裏側では「どれだけスケーラブルで検証可能なRL環境を用意できるか」が次世代モデルの能力を左右する変数になりつつある。判定・コーパス・教師・カリキュラムの多くをモデル自身が生成・採点するようになった今、学習パイプラインの品質を最終的に担保するアンカーは、人手による検証ではなく、サンドボックス・ハーネス・検証器を備えたRL環境の設計に残る——ラボ間の競争軸は、データをどれだけ集めるかから、環境をどれだけうまく設計できるかへ移行しつつある。

ただし、この「依存度が高まっている」という一般化は著者個人の分析であり、業界全体を対象にした実証データではない点には留意が必要だ。引用されている個別の主張(LLM-as-a-judgeの一致率、STaRの構造、SFT/RLの汎化性能の違い)はいずれも実在する先行研究に基づくが、それらを束ねた「フロンティアモデル開発が全体としてこの再帰ループへの依存を強めている」というテーゼ自体は、著者の分析的な見立てである。