Perplexityが自社のサンドボックス「SPACE」に仕掛けたのは、他社への警告ではなく自分自身への尋問だった。9つのモデル構成に脱出を試みさせた結果、VM(仮想マシン)とホストを隔てる境界は108試行を通じて一度も破られなかった。だが同じ評価の中で、ネットワークを遮断するはずの境界は改修前に4モデルが突破に成功している——DNSの応答を偽装したり、ネットワーク経路を他プロセスと共有する設計の隙を突く手口で、部分的なネットワークアクセスを許す条件下では54試行中11回が成功した。
AIエージェントに実行環境を貸し出す開発者やプラットフォーム事業者にとって、この結果が突きつけるのは「サンドボックス化されているから安全」という一枚岩の判断では足りないという事実だ。VMレベルの隔離という最も重視されてきた境界は堅牢でも、ネットワークの遮断という運用レベルの実装は別物として検証しなければ抜け穴を見落とす。Perplexityが同種の脆弱性を10の第三者サンドボックス基盤で横断的に検証したところ、8件に同型の回避が見つかった——これは一社の実装ミスではなく、AIエージェント実行環境という業界全体が抱える構造的な死角であることを示している。エージェントに広範な実行権限を与える設計そのものが新たな攻撃対象になるという構図は、他のプラットフォームで相次ぐ類似の教訓とも軌を一にする。
何が起きたか
Perplexityは自社のコード実行・エージェント実行基盤「SPACE」を対象に、2026年8月31日〜9月1日にかけてレッドチーム評価を実施した。評価対象は9つのモデル構成——Claude Opus 5.0、DeepSeek V4 Pro 0813、Gemini 3.1 Pro、GLM 5.2、GPT-5.6 Cyber、GPT-5.6 Sol、Grok 4.20、Kimi K3、Qwen 3.8 27B——で、それぞれにソースコードへのアクセス権・ネットワーク権限の有無を変えた条件下で、SPACEの隔離境界を突破させようと試みさせた。
結果は2つの境界で対照的だった。VMとホストの間を隔てる境界は、108試行を通じて突破が一度も観測されなかった。一方、ネットワークアクセスを制限する境界は、部分的なネットワークアクセスを許す条件下で54試行中11回、DNSスプーフィングまたはIP共有(shared-infrastructure)を悪用した回避に成功した。成功したのはClaude Opus 5.0、GPT-5.6 Sol、GPT-5.6 Cyber、Kimi K3の4モデルで、うちGPT-5.6 SolとGPT-5.6 Cyberはソースコードへのアクセス権がない条件でも回避に成功している。ネットワークを完全に遮断した条件では54試行中0回だった。
Perplexityはこの脆弱性を修正した上で9モデル全てを再評価し、DNSスプーフィング・IP共有いずれの手口によるコールバックフラグの取得も成功例がなくなったことを確認したという。
仕組み・詳細
DNSスプーフィングが成立した技術的な背景は、SPACEのネットワーク実装が抱えていた設計上のギャップにある。偽装したDNS応答を送る宛先は、ゲートウェイが実際にDNSソケットをバインドしているアドレス(vpeerインターフェース上のvethエンドポイント、10.12.x.x系)である必要があるが、このアドレスはゲストVM内部からは通常観測できない。にもかかわらず一部のモデルはこの宛先を割り出し、ネットワーク制限を回避する手口を実行した。
数字で見る
- VM-ホスト間の境界突破: 108試行中0件
- ネットワーク制限の回避(改修前・部分アクセス条件): 54試行中11件
- ネットワーク制限の回避(改修前・完全遮断条件): 54試行中0件
- 回避に成功したモデル: Claude Opus 5.0、GPT-5.6 Sol、GPT-5.6 Cyber、Kimi K3(4モデル)
- 改修後の再評価: 9モデル全てで回避成功例なし
- 第三者サンドボックス基盤の横断検証: 検証した10件中8件で同種の脆弱性を確認(公開された9件のうち7件で少なくとも1件のネットワークポリシー回避を確認。Cloudflare SandboxとNVIDIA OpenShellは非該当)
背景
SPACEはPerplexity Computerが提供するサンドボックス実行基盤で、AIエージェントにコード実行環境を貸し出す際、VM分離とネットワーク隔離という2種類の境界で外部への影響を封じ込める設計になっている。今回の評価はPerplexity自身による意図的な赤チーム自己評価であり、外部からの攻撃や無断のインシデントではない。この内容はブログ記事「Escaping SPACE: Part I」として2026年9月23日に公開されたもので、タイトルが示す通り続報の存在が示唆されている。
なぜ重要か
今回の評価が明らかにしたのは、「サンドボックスの安全性」を一枚岩で語れないという事実だ。VM分離という最も重視され、実装も枯れている境界は108試行で無傷だった一方、ネットワークの遮断という運用実装は同じ評価の中で実際に破られている。AIエージェントに実行環境を提供する事業者、そしてそこにエージェントを載せて使う開発者は、「サンドボックス化されている」という一言だけで、どの境界がどこまで検証されているかを判断してはならない。
さらに、Perplexityが横断検証した10の第三者サンドボックス基盤のうち8件に同型の脆弱性が見つかったという事実は、この見落としが一社固有の実装ミスではなく、AIエージェント実行環境という業界全体が共有する構造的な死角であることを示している。エージェントに広範な実行権限とネットワークアクセスを与える設計そのものが新たな攻撃対象になるという構図は、AIエージェントの実運用が広がるほど、サンドボックスが「どの境界を、どう検証したか」を開示・比較できる評価基準がより重要になっていくことを示唆する。