Anthropic は Opus 5 と Sonnet 5 を直接比較したベンチマークを公開していません。各リリース記事は、それぞれの前世代モデルと Opus 4.8 を基準に比較しています。以下の数値はその一端にすぎません。残りは、いつもの Opus と Sonnet の選び分けと同じ判断です。どれだけ高い上限が本当に必要か、そしてそのためにどこまでコストを払うか、という話になります。
Claude Opus 5 とは?
Opus 5 は Anthropic の最上位モデルで、2026 年 7 月 24 日にリリースされました。価格は入力 100 万トークンあたり $5、出力 100 万トークンあたり $25。Anthropic は Frontier-Bench と GDPval-AA で最先端と呼び、より大きい Fable 5 に近い性能を半額で達成しているとしています。Claude Max ではデフォルト、Claude Pro では最も強力なモデルです。
際立つ特長は自己検証です。自分の作業を点検し、データ供給がない場合はテスト環境を構築し、誤った指示には迎合せず押し返します。
Claude Sonnet 5 とは?
Sonnet 5 は Anthropic の中位モデルで、2026 年 6 月 30 日にリリースされました。これまでで最もエージェント性の高い Sonnet と説明され、より低価格で Opus 4.8 に近い性能とされています。Free と Pro プランのデフォルトであり、Max、Team、Enterprise、API でも利用可能です。
価格: 2026 年 8 月 31 日までは入力 100 万トークンあたり $2/出力 $10、その後は標準価格 $3/$15 になります。
実務的に見たティアの違い
ここはリリース記事では明示されません。というのも、特定の 2 モデルの話というより、Anthropic のラインアップ全体に共通する前提だからです。
Opus は「天井」モデル
間違いの代償が高いとき、長時間にわたり自律的に走らせ、中間確認が入らないとき、あるいは課題が本当に未知でモデルが見慣れたバリエーションではないときに選びます。複数ファイルにまたがる大規模リファクタリング、曖昧なリサーチ課題、エラーが累積しやすい長時間のエージェント実行 — これらは Opus の領分です。問題になる前にモデル自身がミスを見つける、そのためのコストを払う、ということです。
Sonnet は「主力」モデル
常時稼働させても十分に速く安価であるよう設計されています。チャットアシスタント、大量分類、数ステップごとに人がレビューする反復的なコーディング、レイテンシ重視のアプリケーションなど。判断の上限は低めでも、現実の多くの業務ではそこに到達しません。日々の利用は Sonnet 側に寄せ、必要な場面だけ Opus を呼ぶのが大半のチームにとって妥当です。
とりわけ Sonnet 5 は、中位モデルとしての上限を従来より引き上げる試みです。だからこそ「これまでで最もエージェント性の高い Sonnet」であり、タスクによっては Opus 4.8 に近づくとされます。以下のベンチマークはその文脈で読み取ってください。Sonnet 5 は単に安いだけでなく、従来の Sonnet より Opus に近い位置まで寄っています。
リリース数値が示すもの
価格
最も明確で解釈の余地が少ない違いです。Sonnet 5 は $2/$10(〜8/31)または標準 $3/$15、Opus 5 は一律 $5/$25。期間によりますが、Sonnet 5 は Opus 5 の 40–60% のコストです。
アラインメント
ここだけは 2 本のリリース記事で互いを名指しで比較しています。Anthropic の自動監査では、Opus 5 は「Opus 4.8、Sonnet 5、Fable 5 よりも Claude のコンスティテューションにより忠実」とされました。推測ではなく明示の結果です。Opus 5 はこの監査で 2.3 を記録し、過去最高の安全性スコア。Sonnet 5 も前世代から改善(ハルシネーション低減、追従的態度の低減、プロンプトインジェクション耐性の向上)しましたが、依然として Opus 4.8 より不整合行動率は高いと述べられています。
サイバーセキュリティ
両モデルとも意図的なサイバー分野の学習は外されていますが、到達点は異なります。
Opus 5 は脆弱性の発見では Mythos 5 に近い一方、それをエクスプロイト化する点では劣ります。Sonnet 5 はさらに後方に位置します。Anthropic は、Sonnet 5 は「Opus 4.8 や Mythos 5 よりもサイバー能力が大幅に劣る」と明言。Firefox のエクスプロイト開発評価では、完全な作動エクスプロイトを一度も生成できず(成功率 0.0%)、部分的試行でも Sonnet 4.6 をわずかに上回る程度でした。
ユースケースがサイバー領域に接するなら、この差は実在し、明確に Opus 5 に分があります。
コーディングとナレッジワーク
ここはそれぞれ異なるベンチマーク群を使っており、きれいな横並び比較にはなりません。
Opus 5 は Frontier-Bench v0.1 で Opus 4.8 のスコアを 2 倍以上にし、CursorBench 3.2 では Fable 5 に 0.5% 差まで迫りつつコストは半分。Sonnet 5 は BrowseComp と OSWorld-Verified で高努力設定時に Opus 4.8 に近づくと説明されています。
前述のティア論理と合わせて読むと、Anthropic が強調した特定タスクでは Sonnet 5 は近づくものの、Opus 5 の勝ちはより大きく広い範囲に及ぶ印象です。ここは厳密な比較というより、方向性として捉えるのがよいでしょう。
どちらを選ぶべきか
Opus 5 を選ぶ場合
タスクの重要度が高い、長時間走らせる、本当に新規の課題である。生命科学・化学・複雑な多段のエージェント作業を行う。最もアラインしたモデルが必要。サイバーセキュリティ関連が射程に入る。
Sonnet 5 を選ぶ場合
大量実行、レイテンシ重視、またはタスクの範囲が明確で Opus の「判断の天井」を必要としない。Free/Pro でデフォルトになっている。トークン単価が主要な制約である。
どちらも不適なら
ガードレールを弱めたサイバーセキュリティ作業が必要な場合。Opus 5 は自動的に Opus 4.8 にフォールバックし、Sonnet 5 はそもそも Opus 4.8 より後方に位置します。
まとめ
本質的な判断軸は、どの Opus 対 Sonnet でも同じです。そのタスクは「天井」を要するのか、それとも規模を出して確実に完了すればよいのか。Sonnet 5 は従来の Sonnet よりもこの天井を押し上げた点が、リリースの最大のニュースです。しかし、2 モデルを同じ土俵で数値化した箇所(アラインメント監査)では Opus 5 が上回り、サイバーセキュリティの観点も同じ方向を指します。ボリューム用途は Sonnet 5 を基本に、誤答が許されないタスクでは Opus 5 を選んでください。