Anthropicの「Claude Sonnet 5.5」で見るべきは、トークン単価の安さではなく、タスクあたりに消費されるトークン量だ。Artificial Analysis(AA)によると、価格は入力$2・出力$10(100万トークンあたり)と低いが、最高effort設定ではIntelligence Index評価中に420Mトークンを出力した(中央値は81M)。タスクあたりの加重平均コストは$7.67に達する。エージェントを大量に回す開発者にとって、見るべき指標は「単価」から「単価×消費トークン×effort設定」へ移る。モデル選定は、effortをどこまで上げるかという運用設計とセットで決まる段階に入っている。
何が起きたか
AAの計測では、Claude Sonnet 5.5(Max effort)はArtificial Analysis Intelligence Indexで56点を記録した。
数字で見る
- Intelligence Index:56点(Max effort設定)
- 価格:入力$2.00/出力$10.00(100万トークンあたり)
- コンテキスト窓:1Mトークン
- Index評価中の総出力:420Mトークン(中央値81M)
- タスクあたり加重平均コスト:$7.67
出力量420Mは中央値の5倍超で、AAの数字からも冗長さは裏付けられる。なお一部報道は$7.60と伝えたが、AAのページの値は$7.67だ(更新または丸めの差とみられる)。
未検証の点
次の主張は、今回の一次ソース(AAモデルページ)では確認できていない。
- Opus 5.5に2点差の総合2位という順位
- 1タスク約19.3万出力トークン、および他モデルとの倍率
- Terminal-Bench 4.0でOpus 5.5を上回る/事実精度(AA-Omniscience)で劣るという個別ベンチ値
- Sonnet 5と同一価格という点とSonnet 5比のコスト増
Anthropic公式の発表ページも今回は取得できず、公開日・公式の性能比較は未確認だ。本記事はAAの計測値にのみ依拠しており、性能の順位や個別ベンチの評価は確定していない。