Anthropicの Sonnet 5.5 は、第三者指標では看板のOpus 5.5にほぼ並んだ。ただし「半額のトークン単価」がそのまま「安いタスク」を意味しない。Artificial Analysisの測定では、最大努力設定の1タスク平均コストはSonnet 5.5が$7.67、Opus 5.5が$5.98で、安いはずのモデルの方が高くつく。モデルを選ぶ開発者は、料金表の単価ではなく、自分のタスクを自分の努力設定で回した実コストを測る必要がある。モデル競争の評価軸が「賢さ」から「同じ成果を出すのに実際に払う総コスト」へ寄っていく動きを、この数字は示している。
何が起きたか
- Anthropicの公式モデル一覧に Claude Sonnet 5.5(モデルID
claude-sonnet-5-5)が掲載されている。退役の下限は2027年9月28日。公開日は公式ページに明記がなく、退役下限から2026年9月28日前後と推定されるが、断定はできない。 - Artificial Analysis の知能指数(Intelligence Index)で、Sonnet 5.5 は56点で224モデル中2位(Max設定の掲載)。1位は58点の Opus 5.5 で、差は2点。
数字で見る
| 項目 | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 入力 / 出力(100万トークン) | $2 / $10 | $4 / $20 |
| 知能指数(Artificial Analysis) | 56(2位) | 58(1位) |
| 1タスク平均コスト(最大努力設定) | $7.67 | $5.98 |
| 指数評価中の出力トークン総量 | 4.2億 | 2.6億 |
- Sonnet 5.5 の指数評価中の出力トークンは4.2億で、同ページが示す中央値8,100万を大きく上回る。Opus 5.5 の2.6億と比べると約1.6倍(4.2億÷2.6億からの概算)。
- 出力トークンが多いほど、安い単価の利点は相殺される。最大努力設定では、単価半額でも1タスクあたりはSonnetの方が約3割高い($7.67÷$5.98)。
- 1タスクコストは取得時点の掲載値。ニュースレター等で伝わっていた「約$7.60」は、掲載値$7.67に訂正して扱う。
仕様
- コンテキスト窓は100万トークン、最大出力は12.8万トークン。入力はテキストと画像、出力はテキスト。
- キャッシュ読み取りは基本入力価格の10%($0.20)。
- 同じモデル一覧で、Opus 5.5 は$4/$20、Fable 5.1 は$10/$50。
確認できていないこと
以下は一次ソースで確認できておらず、ここでは事実として扱わない。
- 1タスクあたり約19.3万出力トークン、Artificial Analysis測定史上最多、GPT-6 Astra の約7倍といった数値。総量が多いことは確認できたが、タスクあたりの値は二次情報のみ。
- Terminal-Bench 4.0で Sonnet 5.5 が Opus 5.5 を上回る、事実精度(AA-Omniscience)では下回る、Humanity's Last Exam・SciCode でも下回るという個別ベンチの比較。ベンチ別の内訳を取得できなかった。
- 価格が Sonnet 5 と同一であること、最大努力設定のコストが Sonnet 5 比で約5割増という点。Sonnet 5 側の値を確認していない。
- Anthropicのリリース告知ページ(anthropic.com/news/claude-sonnet-5-5)は取得時点でHTTP 404だった。
なぜ重要か
モデル選定の実務では、料金表の単価、ベンチマークの順位、最大努力設定での出力量の3つが別々に動く。知能指数でOpus 5.5に2点差まで迫りながら、タスク単価では上回るという今回の結果は、「安い下位モデルで十分」という前提を機械的に当てはめられないことを示す。努力設定ごとに実コストを測ることが、コスト設計の出発点になる。