UIUCの研究者3名(Yuxuan Zhu・Tengjun Jin・Yoojin Choi)とBridgewater AIA Labs/UIUCのDaniel Kang氏が、Thinking Machinesと協力してText-to-SQLタスクに関する報告を公表した。記事自体はThinking Machines公式ブログに掲載されているが、著者はThinking Machines社員単独ではなく外部研究者との共同執筆であり、見出しを「Thinking Machinesが発表」と単純化する際は帰属に注意が必要な内容だ。
報告の核心は、Text-to-SQLというタスクでAIが初めて人間の専門家水準を超えたことに加え、その達成方法にある。従来はプロンプトやツール呼び出しの手続き的な工夫(スキャフォールディング)でモデルの性能を引き出そうとしてきたが、これはベースモデル自体の能力に制約される。今回のチームは、その専門知識を強化学習の訓練信号そのものに移すというアプローチを取った。ベースモデルmoonshotai/Kimi-K2.6を、Thinking Machines自身のRL訓練基盤「Tinker」上でRLVR(検証可能な報酬による強化学習)でファインチューンした結果、16サンプル自己整合性投票で92.97%・タスクあたり56セントを達成し、人間水準(92.96%)を上回った。同時に、GPT-5.6 Sol Ultra(86.75〜89.60%、23セント〜3.68ドル)やClaude Fable 5(84.94%)を8〜22ポイント・同等以下のコストで上回っている。
これは、データが十分に揃うタスクであれば、汎用フロンティアモデルを都度呼び出すよりも、専用のRLファインチューンに切り出した方が性能とコストの両面で有利になり得るという、具体的な判断材料を提供する。開発者にとっては「どのモデルを呼ぶか」だけでなく「どこまでを訓練データ・報酬設計に落とし込むか」がタスク選定の軸に加わる。これはThinking Machines自身のTinkerプラットフォーム(オープンウェイトモデルInklingの提供にも使われる同社の中核基盤)を通じて示された具体例であり、エージェント性能向上の主戦場がプロンプト・スキャフォールド設計から、訓練データ・報酬設計そのものへ広がりつつあることを示している。
何が起きたか
Thinking Machinesは、UIUC・Bridgewater AIA Labsの研究者との協力のもと、Text-to-SQL(自然言語からSQLクエリへの変換)タスクにおいてAIシステムが人間の専門家水準を初めて超えたと報告した。手法上の主張は明確で、「スキャフォールドに含まれるタスク知識は、訓練信号の中に、つまりモデル自体を向上させるのと同じ訓練プロセスの中に置かれるべきだ」という考え方に基づく。専門家の判断をタスク特化の訓練プロセスに——AIがどこで失敗するかを特定し、訓練データにラベルを付け、訓練を目的に合わせる、という形で——組み込むことが、最終的にスケールする手法だとしている。
仕組み・詳細
ベースモデルはmoonshotai/Kimi-K2.6で、訓練後のモデルは「ReViSQL-K2.6」と呼ばれる。訓練はThinking Machinesの「Tinker」プラットフォーム上で、RLVR(reinforcement learning with verifiable rewards)を用いて実施された。RL目的関数はCISPO、学習率5×10⁻⁵、LoRAランク32というハイパーパラメータが用いられている。
報酬設計には2つの整形が加えられている。1つは「VeriEQL」による報酬整形で、SQLの実行結果が一致していても、有界検証ソルバーVeriEQL(arXiv:2403.03193)が意味論的に非等価と判定した場合はペナルティ0.2を課す。これは、実行結果の一致だけでは見逃してしまう誤った正解(誤検出)を防ぐための工夫だ。もう1つは「プロセス報酬整形」で、必須とされる外部知識分析の手順に従わなかった場合にペナルティ0.1を課す。
数字で見る
- ReViSQL-K2.6(greedy・1サンプル): Arcwise-Plat-SQLで91.37%、タスクあたり0.035ドル
- ReViSQL-K2.6(16サンプル自己整合性投票): 92.97%、タスクあたり0.56ドル——人間水準のプロキシ値92.96%を上回る
- GPT-5.6 Sol Ultra: 86.75%(0.23ドル)〜89.60%(3.68ドル)
- Claude Fable 5: 84.94%
- ReViSQL-K2.6は、Infly-RL-SQL-32B・OmniSQL-32B・XiYanSQL-32B・Arctic-R1-7Bなど既存のText-to-SQLパイプラインを、同等以下のコストで8〜22ポイント上回った
- 評価はArcwise-Plat-SQLに加え、BIRD-Platinum・Spider2-SQLite・Spider2-Snowでも実施された
背景
Thinking Machines協力チームは、スキャフォールディング的アプローチの限界を、最良のスキャフォールド付きモデルでも人間より11ポイント低いSQL性能にとどまっている、という観察から論じている。指示に従わせるだけのスキャフォールディングには限界があり、人間の専門家が反復経験でスキルを獲得するのと同じように、AIも専門知識を訓練プロセスの内側に取り込む必要があるという論理展開だ。
なぜ重要か
この報告が示すのは、単に1つのベンチマークでAIが人間を超えたという事実だけではない。スキャフォールドという「外側の工夫」に頼るアプローチと、訓練信号という「内側の工夫」に頼るアプローチのどちらがスケールするかという、エージェント設計上の分岐点を具体的な数値で提示した点にある。データが十分にあり、検証可能な報酬設計が組めるタスクであれば、汎用フロンティアモデルを都度呼び出すよりも、タスク特化のRLファインチューンに投資する方が性能・コストの両面で優位になり得る——この選択肢が、Thinking Machines自身のTinker基盤を通じて実証された形だ。