Redwood Researchが示したのは、CoT(Chain-of-Thought)監視が効くかどうかを「CoTを経由しない逐次計算がどれだけ長く続けられるか」という一つの数字で比べる物差しだ。安全対策をCoTの監視に預けている実務者は、これで「どのアーキテクチャ変更なら監視の前提が保たれ、どれなら崩れるか」をモデル採用の前に議論できる。自律エージェントが評価環境を抜け出す事案が相次ぎ、軌跡の監視が主要な防衛線になっている今、その監視自体が将来のアーキテクチャで空洞化しうるという構造が、初めて測れる量として置かれた。本当の問いは「CoTを見張れば足りる、という前提はいつまで成り立つのか」に移る。

何が起きたか

Redwood Researchの公式ブログは、CoTが現在AIモデルを監視する上で有用なツールだと前置きしたうえで、一部のアーキテクチャ変化はCoTの監視可能性を大きく損ないうると指摘した。そのうえで、モデルが言語化しない形でどれだけの逐次的な思考を実行できるかを、操作的に測る手法を提案している。

背景にはBrown-Cohen et al.(Google DeepMind)の「opaque serial depth(不透明な逐次深度)」という概念がある。Redwoodはこれを具体的な指標に落とし込んだ。

仕組み・詳細

提案された指標はNLS深度(Natural-Language-rooted node-Separated depth)である。ブログは「ある種の『解釈可能なボトルネック』を通らない、計算グラフ上の最長経路を測る」ことを提案している。言語化されたトークン(CoT)に一度でも落ちれば人間や監視モデルが読める。読めない区間がどれだけ連続して続くかが、監視をすり抜ける余地の大きさになる。

ブログは個別のアーキテクチャについて、NLS深度への影響を「大幅に増える」「中程度」「増えない」に分類している。

  • 大幅な増加の可能性があるもの: COCONUT型の潜在状態フィードバック、Abstract CoT、トークンの重ね合わせ、不透明なメモリバンク、テスト時訓練(TTT)
  • 増加させないもの: CoTの自然な劣化、単純な推論ステップの単一パスへの圧縮

ループ型トランスフォーマーやMamba/DeltaNetsなども検討対象に含まれる。

数字で見る

ブログは既存のオープンソースCoTモデルのNLS深度が、モデルの規模とともにどう伸びるかのスケーリング傾向にも言及している。ただし、活性パラメータ数に対するべき指数や年率の伸びといった具体的数値は、検証ブリーフの筆者が原文の表・数式を直接確認していない間接的な取得にとどまる。そのため本記事では具体的な数値を採用せず、**未検証(根拠強度: 弱)**として扱う。引用する際は原文での確認が必要だ。

背景

CoT監視は、モデルが推論を言葉に出すことに依存した安全策である。エージェントの軌跡を監視する運用も、この前提の上に立つ。潜在空間で推論を進める設計は性能やコストの面で魅力があるため、設計上の選択が監視可能性を左右する局面は今後増える。NLS深度は、その選択の安全面の代償を比較可能にする試みである。

なぜ重要か

  • 採用判断の材料になる: 潜在推論やテスト時訓練を取り込むモデルを評価する際、性能・コストに加えて「監視をすり抜ける逐次計算の長さ」という軸を持てる。
  • 安全対策の前提が点検対象になる: CoT監視に依存する対策は、アーキテクチャが変わるたびに有効性を再確認する必要がある。
  • 留意点: 本研究は、CoT監視に依存する安全対策の前提がどれだけ崩れうるかを定量的に検討する初期的な試みであり、指標の妥当性は今後の検証を要する。著者はNathan Sheffield、Alek Westover、Lukas Finnveden、Alexa Panらを含む複数名(Redwood Research、公開日2026-09-10)で、全著者名の完全なリストは未確認である。