フロンティアモデル2026 — GPT-5.6・Claude・中国オープンモデルの動向を追う特集
GPT-5.6・Claude Fable 5・中国発オープンモデル・AIエージェント・ベンチマークの読み方まで、フロンティアモデルの動向を一次ソース検証済みで追う特集ハブ。
特集記事一覧
-
GPT-5.6(Sol/Terra/Luna)とは — 何ができて何が変わったか
OpenAIがGPT-5.6のSolについて公表したのは、競合と同等のExploitBench結果を出力トークン約1/3で達成したという数字——だが同じ発表は、ChatGPT・APIへの広範な提供開始が米国政府のAI安全性レビュー完了を前提とすると明記している。出荷を最後に握るのはベンチマークでなく審査だ。
-
Claude Fable 5 復活の顛末 — 輸出規制から18日間の停止、そして再開まで
米商務省がClaude Fable 5・Mythos 5に発動したのは、チップの禁輸でなく「外国籍者のアクセス禁止」だった——Anthropic自社の外国籍従業員まで18日間締め出され、引き金はAmazonの研究者が報告した軽微な脆弱性のジェイルブレイク。規制の単位はチップからモデルの使い手へ動くのか。
-
2026年オープンモデル勢力図 — Hy3・DeepSeek-V4・GLM-5.2・LongCat-2.0を比較する
Tencent・DeepSeek・Zhipu・Meituanの中国オープンモデル4本が3か月で出揃い、うち1.6兆パラメータのLongCat-2.0は35兆トークン超の学習をNVIDIA製GPUなしで回したと公式GitHubが説明する——重みの公開に、学習基盤の脱Nvidiaという主張が重なり始めた。
-
AIベンチマークの読み方 — Agents' Last Exam・ARC-AGI-3・Intelligence Index
UC Berkeley RDI主導のAgents' Last Examで完全合格率は1%未満、ARC PrizeのARC-AGI-3では人間100%に対しフロンティアAIが0.51%——ベンチマークの高得点と実務の完遂は別物だ。数字は運営主体・採点方式(決定論的スクリプトかpass@1か)・評価範囲の3点で読む。
-
AIエージェントの現在地 — OpenAI CodexとClaude Coworkが変えた仕事の形
Anthropicが公開したClaude Cowork 120万セッションの内訳で、software developmentは8.7%どまり。最大はbusiness process and operationsの33.4%で、約半分は「the work around the work」——「エージェント=コーディング」の見立てを、提供元自身のデータが裏切った。
-
メタハーネスとは何か — Sakana FuguとDatabricks Omnigentを一次ソースで検証する
メタハーネス=エージェントの上に載る統括層。6月にFugu(Sakana)とOmnigent(Databricks)が商用化、Fable 5全停止事件が追い風に。出回っている数値には注意——73.7%はUltra版の自己報告値。