Jimmy Millerが示したのは、AI生成コードの危うさは「バグが多い」ことではなく、「未完成の在り処が見えない」ことだという点だ。同氏によれば、AIが書いたプログラムは大量のテストとベンチマークを添え、即座の速度改善まで見せて「完全に書かれ、完全に動く解決策」という錯覚を与える——しかしデモ以外の用途で使うと即座にクラッシュしうる。AIコーディングエージェントを採用・運用する開発者や意思決定者にとって、テストの数やベンチマークの存在は「完成度の証拠」として使えなくなり、受け入れ判断はデモの外での実使用で行う必要がある。これは、AIが書いたものを人がどう検証するかという、エージェント活用全体の評価軸の問い直しを強める指摘だ。ただし本稿の根拠は著者個人の実務観察に基づくエッセイであり、定量データによる実証ではない。
何が起きたか
Jimmy Millerが自身のブログで、「The Chasm: The Shape of Unfinished AI Codebases」と題した論考を公開した(2026年9月)。AIが生成するコードベースは、人間が書くものとは異なる形で不完全さを表すという主張が中心にある。
仕組み・詳細:「ひび」と「裂け目」
論考の対比構造は次のとおり。
- 人間が書いたコード:未完成の部分は目に見える形で欠けている。著者の例では、パーサーが完全な入力を受け付けない、ボタンが何もしない、といった具合だ。著者は「人間が書いたコードなら、崖から落ちる前にひびが入っていくのが見える」と述べる。
- AIが書いたコード:著者は、AIコードベースは人間の予測可能性とはまったく別の形で予測可能だと述べる。見た目は完成しており、テストやベンチマークも揃うが、デモ以外の用途では即座にクラッシュしうる。著者はこれを「裂け目(chasm)は深く、隠れていて、しばしば登り出ることができない」と表現する。
著者の結論:書き直し
著者は、こうして台無しになったソフトウェアを救おうとするのは悪夢になると述べ、「ではどうするか。書き直す(Rewrite)」と結論づける。論考は「完成とは何かを理解する」「ひびか裂け目か」「書き直しの必要」「代替案は?」という構成で進む。
数字で見る
この論考には、経験的データや定量的な検証は含まれない。故障率やコスト、書き直し頻度の数値は示されておらず、主張の根拠強度は弱い(著者個人の実務観察)。
なぜ重要か
事実として確認できるのは「著者がそう論じている」ことまでで、AIコード全般にその傾向があるかは、この論考だけでは判断できない。それでも、AIが生成したコードの「見た目の完成度」と「内部の健全性」を切り分けて評価するという視点は、AIコーディングエージェントの導入可否を判断する側にとって、検証手順を設計する際の具体的な論点になる。テストやベンチマークの存在をそのまま信頼の根拠にせず、統制されたデモの外での挙動を確かめる——その運用を問う議論として押さえておく価値がある。