中位モデルが上位モデルに迫る。Anthropicが2026年6月30日にClaude Sonnet 5を公開し、開発者のコスト構造を大きく変えました。

この記事では、Claude Sonnet 5の性能・料金・Opus 4.8との違いを整理します。

  • Sonnet 5がどのベンチマークでOpus 4.8に迫るか
  • 導入価格と標準価格の違い
  • トークナイザー変更がコストに与える影響
  • どんな用途でSonnet 5を選ぶべきか

Sonnet 5は何が変わったか

https://www.anthropic.com/news/claude-sonnet-5

AnthropicはClaude Sonnet 5を「これまでで最もエージェント的なSonnetモデル」と位置づけています。API名はclaude-sonnet-5、コンテキストウィンドウは100万トークンです。

これまでSonnetは常にOpusの一つ下に置かれてきました。今回はその前提が崩れ、公式ブログは性能が「Opus 4.8に近いが、価格は低い」と明言しています。Free・Proプランのデフォルトモデルになり、Max・Team・Enterprise、Claude Code、APIでも利用できます。

なぜ今、中位モデルの話が重要か

LLM(大規模言語モデル)を本番で使う開発者にとって、最大の課題は「品質とコストのトレードオフ」です。エージェント的なタスクでは、推論ステップが増えるほどトークン消費が膨らみ、月額請求が跳ね上がります。

上位モデルを常時使えば精度は上がりますが、APIコストは2〜3倍になります。逆に安いモデルに寄せると、複数ステップのコーディングやターミナル操作で途中離脱が増え、結局リトライでコストが戻ることもあります。

Sonnet 5は、この板挟みを正面から狙ったモデルです。

ベンチマークで見る性能

Anthropicのシステムカードに掲載された主要スコアを整理します。

ベンチマーク Sonnet 5 Sonnet 4.6 備考
SWE-bench Pro 63.2% 58.1% 実在リポジトリの複数ファイル修正
Terminal-Bench 2.1 80.4% 67.0% ターミナル上のコーディング
OSWorld-Verified 81.2% 78.5% PC操作エージェント
Humanity’s Last Exam(ツールあり) 57.4% 46.8% Opus 4.8は57.9%
GDPval-AA v2 ELO 1618 ELO 1395 Opus 4.8はELO 1615で統計的に同水準

SWE-bench Proは、メンテナンス中のリポジトリから抽出した課題を解くコーディングベンチマークです。Sonnet 4.6比で5.1ポイント上がりました。GDPval-AA v2は44職種の実務タスクを盲検ペア比較で採点する評価で、Sonnet 5はOpus 4.8と差がほぼありません。

Yahoo Techの検証では、ゼロショットのブラウザゲーム生成でSonnet 4.6より見た目とロジックが改善した一方、推論に約30分かかり、Claude Proの5時間制限の90%を1回で消費したと報じています(参考)。高effort設定ではトークン消費が大きい点は押さえておく必要があります。

料金とOpus 4.8との比較

https://docs.anthropic.com/en/docs/about-claude/pricing

モデル 入力(100万トークン) 出力(100万トークン)
Sonnet 5(導入価格〜2026年8月31日) $2 $10
Sonnet 5(標準価格・9月1日以降) $3 $15
Sonnet 4.6 $3 $15
Opus 4.8 $5 $25

導入価格はOpus 4.8の入力・出力ともに40%安です。9月以降の標準価格はSonnet 4.6と同額のまま、性能だけが上がる形です。

ただし、Sonnet 5はトークナイザー(テキストを課金単位に分割する仕組み)が更新されています。同じ入力でも1.0〜1.35倍のトークン数になる場合があり、Anthropicは導入価格で切り替えコストをほぼ中立にしたと説明しています。9月以降は実質コストが上がる可能性があるため、本番移行前にトークン数の再計測が必要です。

effortレベルでコストと精度を調整する

Sonnet 5の大きな変化は、effort(推論の深さ)をダイヤルで変えられる点です。WebアプリやAPIでeffortを下げれば安く、上げればOpus 4.8に近い精度を狙えます。

公式のコスト性能曲線では、BrowseComp(難易度の高いWeb検索タスク)とOSWorld-Verified(PC操作)の両方で、Sonnet 4.6はOpus 4.8に届かなかった領域を、Sonnet 5が中〜高effortでカバーしています。開発者はタスクごとに「この作業はmedium、リリース前の検証はhigh」と使い分けられます。

セキュリティ面の位置づけ

サイバーセキュリティ用途向けの訓練は意図的に行っていません。Firefox 147の脆弱性悪用テストでは、完全なエクスプロイト作成は0%でした。Opus 4.8やMythos 5より能力は低く、デフォルトでサイバー保護が有効です。

一方、Fable 5とMythos 5は2026年6月12日から米国の輸出管理に伴い外国籍ユーザー向けに停止中です。Sonnet 5はこの制限の対象外で、グローバルに使えます。

どの用途でSonnet 5を選ぶか

Sonnet 5向き

  • エージェント的なコーディング(ターミナル操作、複数ファイル修正)
  • ナレッジワーク全般(GDPval-AA v2でOpus並み)
  • コストを抑えつつClaude Codeを日常使いしたいチーム

Opus 4.8を残す場面

  • SWE-bench Proで最後の数ポイントが必要な大規模リファクタリング
  • サイバーセキュリティ関連の高度な作業
  • 数学オリンピック級の推論(USAMO 2026でOpusが17ポイント以上リード)

Claudeの世代更新は、Claude 3(2023年3月)→ Claude 4(2025年5月)と約14ヶ月周期でした。Sonnet 5はその翌年に登場し、競争の激しさを反映したリリースです。過去のサイクル(Sonnet 4.5→Haiku 4.5→Opus 4.5が各1ヶ月間隔)から推すと、Haiku 5とOpus 5も年内に出る可能性がありますが、Anthropicはリリース間隔を一定にしていないため、確定情報ではありません。

使い始めるには

ClaudeのWebアプリではFree・Proユーザーに自動適用されます。APIではモデル名claude-sonnet-5を指定します。Claude Codeユーザーも同モデルが利用可能です。

2026年8月31日までの導入価格を活かすなら、今のうちに既存のSonnet 4.6ワークフローを移行し、トークン消費量とeffort設定の最適点を測るのが現実的です。精度がOpus級に近づいた今、中位モデルだけで回せる業務の範囲が広がっています。