メインコンテンツへスキップ

Claude Opus 5 vs GPT-5.6 Sol:ベンチマーク、料金、選び方

Anthropic の Opus 5 と OpenAI の GPT-5.6 Sol はともに2026年7月に登場し、エージェント的作業で競合。コーディング、推論、エージェント的ツール利用、セキュリティの各ベンチマークを比較しました。
更新 2026年7月31日  · 14 分 読む

AIで探索

ChatGPTで開くClaudeで開くPerplexityで開く

2026年後半にエージェント的な作業のためのモデルを選ぶなら、候補は多くありません。しかもその二強は2週間違いで登場しました。Anthropic は7月24日に Claude Opus 5 を、OpenAI は7月9日に GPT-5.6 Sol を一般提供に移行しました。どちらも最上位グレードで、長時間のプロ業務を想定した位置付け、そして料金もほぼ同等です。

本記事では、Claude Opus 5 と GPT-5.6 Sol を、コーディング、推論、コンピュータ操作、ツール利用、料金、アクセスの観点で比較し、ワークフローに合う方を判断できるようにします。各モデル個別の詳細は、Claude Opus 5 ガイドGPT-5.6 ファミリーガイドをご覧ください。

TL;DR

  • Opus 5 は「新規性の高い推論」とエージェント作業に強み。GPT-5.6 Sol はターミナル操作とブラウジングに強い汎用型。
  • 入力トークンは両者とも100万あたり$5。出力では Opus 5 が17%安い。
  • 未知の問題やコーディング、コンピュータ操作には Opus 5。ターミナル中心のワークフロー、ブラウジングエージェント、サイバー防御には Sol。

Claude Opus 5 とは?

Claude Opus 5 は Anthropic の Opus ティアのモデルで、2026年7月24日に公開。上位のFable 5に匹敵する性能を半額で提供します。Claude Max の新たなデフォルトであり、Claude Pro で利用可能な最強モデルです。

このモデルの際立つ挙動は「粘り強さ」です。Anthropic の説明では、Opus 5 は自らの作業を検証し、もっともらしいところで止まらず成功するまで反復します。不正行動監査スコアは2.3で、直近の Anthropic モデル中で最も低い数値です。コンテキストは最大100万トークン、出力上限は128K、思考モードはデフォルトで有効です。

読むだけでなく実装したい場合は、Claude Opus 5 API チュートリアルで、バグ修正エージェントの構築と5段階の労力度にわたるベンチマーク手順を解説しています。

GPT-5.6 Sol とは?

GPT-5.6 Sol は OpenAI の GPT-5.6 ファミリーの最上位モデルで、限定プレビューを経て2026年7月9日に一般提供に到達しました。ファミリーは3つのティアで構成されます。

  • Sol: 最高性能のフラッグシップ
  • Terra:  バランスのとれた日常用途向け
  • Luna: コスト効率重視

OpenAI は Sol を、コーディング、知的労働、サイバーセキュリティ、科学の各分野で最先端の結果を出しつつ、競合モデルより少ないトークンで済ませると説明します。

Sol の看板機能は、デフォルトで4つのエージェントを並行ワークストリームで協調させる推論設定の ultra。さらに Responses API に Programmatic Tool Calling が追加され、モデルが小さなプログラムを書いてツール連携や中間データのフィルタリングを実行し、あらゆるツール応答を都度モデルに戻さずにオーケストレーションできるようになりました。

ファミリー構成やプレビュー期の注意点はGPT-5.6 の詳説を参照してください。なお、これまでで最も興味深い成果としては、GPT-5.6 Pro による Dinitz-Garg-Goemans 予想の反例主張も取り上げました。

Claude Opus 5 vs GPT-5.6 Sol:項目別の直接比較

各項目に入る前に、要点を表でまとめます。

項目 Claude Opus 5 GPT-5.6 Sol
リリース 2026年7月24日 2026年7月9日
入力(100万トークンあたり) $5.00 $5.00
出力(100万トークンあたり) $25.00 $30.00
コンテキストウィンドウ 100万トークン 100万トークン
最大出力 128K トークン 128K トークン
新規推論(ARC-AGI-3) 30.2% 7.78%
リポジトリコーディング(SWE-Bench Pro) 79.2% 64.6%
ターミナルコーディング(Terminal-Bench 2.1) 89.1% 88.8%(ultra で 91.9%)
長期的コーディング(DeepSWE V1.1) 68.8% 72.7%
コンピュータ操作(OSWorld 2.0) 70.6% 62.6%
ブラウジングエージェント(BrowseComp) 90.8% 90.4%(ultra で 92.2%)
主な特徴 自己検証と反復 ultra の並列エージェントモード
モデルID claude-opus-5 gpt-5.6-sol

新規推論と抽象問題

両モデルの差が最も大きいのがここです。ARC-AGI-3 は、学習時に遭遇していない問題の解決を求めるため、想起ではなく推論を測るテストに最も近いものです。

Opus 5 は30.2%。GPT-5.6 Sol は7.78%で、ただしリーダーボードでは2位です。参考として、Gemini 3.1 Pro Preview は0.42%。文脈として言えば、2か月前の Opus 4.8 は1.5%だったので、Anthropic の1世代の中で20倍の伸びです。

ただし単一のベンチマークで4倍差が何を意味するかは慎重に扱いたいところです。ARC-AGI-3 は記憶への依存を意図的に逆手に取っており、30.2%でも失敗が多数派です。しかし、訓練コーパスに似た事例が存在しない問題に取り組むなら、この比較で最も関係の深い数字であり、差は歴然です。

コーディングとエージェント工学

コーディングは、どちらかが総取りというより分野ごとに分かれます。各社とも自社が重視するベンチマークで優位に立っており、それは想定通りでもあります。だからこそ見出しだけでなく中身を読む必要があります。

ベンチマーク Claude Opus 5 GPT-5.6 Sol 注記
SWE-Bench Verified 96.0% 96.2% 実質同率。Fable 5 は 95.0%
SWE-Bench Pro 79.2% 64.6% Claude Mythos 5 が 80.3% で首位
DeepSWE v1.1 68.8% 72.7% Sol が 3.9 ポイント差で優位
Terminal-Bench 2.1 89.1% 88.8%(ultra で 91.9%) 同水準だが、差は ultra で出る
Frontier-Bench v0.1 43.3% 37.5% 2か月前の Opus 4.8 は 18.7%
AA Coding Agent Index v1.1 未公開 80 Fable 5 は 77.2、Opus 4.8 は 72.5

リポジトリ作業とターミナル作業を分けると模様がはっきりします。Opus 5 は SWE-Bench Pro で約15ポイント差をつけ、機械部品を図面から FreeCAD で再構築するなどのエージェント型ソフトウェア工学を測る Frontier-Bench でも、Opus 4.8 のスコアを倍以上に伸ばします。Anthropic の自社例も引用に値します。図面を表示する手段がない状況で、Opus 5 は生のピクセルから形状を抽出する独自のコンピュータビジョンパイプラインを書き、5回の試行でこれを解いたモデルは他にありませんでした。

Sol はターミナル領域を得意としますが、その差は以前より小さいです。Terminal-Bench 2.1 では Opus 5 と同水準、ultra を有効にすると 91.9% に伸びます。実在コードベースでの長期エンジニアリングテストの DeepSWE v1.1 でも、Sol が 3.9 ポイント上回り、Fable 5 の出力トークンの半分以下、コストも約3割減と報告されています。

実地検証で得られた補足を一点。Opus 5 でバグ修正エージェントを作り、5段階の労力度で実行したところ、low 努力度では3回すべて修正成功、max 努力度では3回中1回が失敗でした。この失敗ケースはスキーマ妥当だが中身のないレポートを返し、ツール呼び出しはゼロ、根本原因欄は「b0」。教訓は、構造化出力は構造を保証しても中身は保証しないこと、そして労力度が高ければ自動的に良いわけではないという点です。詳細はOpus 5 API チュートリアルで解説しています。

総括すると、エージェントがシェル内で動き、ultra を負担できるなら Sol がわずかに優位。多数ファイルにまたがるアーキテクチャの推論が要るリポジトリ中心の作業なら Opus 5。いずれも「コーディング」全体としての明確な勝者ではなく、真逆の主張はベンチマークの取捨選択に過ぎません。

コンピュータ操作とブラウジング

GUI を操作するエージェントを作るなら重要な軸で、コーディング同様に分かれます。

Opus 5 は OSWorld 2.0 で 70.6%、Sol は 62.6% と8ポイント差。Anthropic はまた、Opus 5 が Fable 5 のベスト結果をコスト3分の1強で上回ると主張しており、Fable 5 が入力100万トークンあたり$10、Opus 5 が$5であることを踏まえると、この見方はより興味深いでしょう。

ブラウジングは実質的に同水準です。Opus 5 は BrowseComp で 90.8%、Sol は 90.4%、ultra 有効時は16の並列エージェントで 92.2% に到達。ここでも差を生むのは ultra です。

Sol の OSWorld 結果には注目すべきトークン効率の主張が付随します。OpenAI は、Opus 4.8 を上回りつつ出力トークンを85%削減したと述べています。これは Opus 5 ではなく前世代との比較なので今回の直接対決には当てはまりませんが、Sol のコンピュータ操作系のコストが1タスク当たり相対的に安価であることを示唆します。

ツール利用と自動化

ツール利用は、抽象的な能力差が実務タスクの完遂につながる領域で、Opus 5 が明確に先行します。

ビジネスタスクを完了まで運べるかを測る Zapier の AutomationBench で、Opus 5 は 26.0%、Sol は 18.1%。Anthropic は、同一タスク当たりのコストで次点モデルの約1.5倍の成功率であり、最低労力度でも他モデルを上回るタスク完了数だと報告しています。

Zapier の CEO、Wade Foster は具体例を挙げています。Opus 5 は粗いアカウント健全性ワークブックを受け取り、離反防止の一連の手順を端から端まで実行。リスク顧客の特定、適切な担当者への通知、リテンション運用向けの要約まで完遂しました。以前のモデルは不合格でしたが、Opus 5 は100%達成です。

Sol の対抗はスコアというよりアーキテクチャにあります。Responses API の Programmatic Tool Calling により、Sol は小さなプログラムを書いてツールを調整し、中間結果をフィルタし、作業の進行に応じて次のアクションを選べます。これにより、ツール主体の作業がモデル往復を減らして前進します。これは実効的な効率化ですが、「より多くのタスクを正しく完了する」こととは別の主張であり、AutomationBench が測っているのは後者です。

サイバーセキュリティと科学

この領域では両社が意図的に正反対の選択をしており、読者によってはここだけで決め手になるでしょう。

Anthropic は Opus 5 をサイバー用途に訓練していません。Opus 5 はデュアルユース能力の最前線を押し広げず、生物学研究や攻撃的サイバー分野では Mythos 5 に劣ると明言しています。OSS-Fuzz では、Opus 5 は脆弱性の特定率は Mythos 5 に近いものの、エクスプロイト作成では大きく後れます。Opus 5 のサイバー分類器は、バイナリに基づく脆弱性スキャン、ペネトレーションテスト、エクスプロイト生成をブロックしますが、介入頻度は Fable 5 より約85%低減する見込みです。

OpenAI は逆を選びました。Sol は OpenAI 史上最強のサイバーセキュリティモデルとされ、数値は大きいものです。

  • ExploitBench: 73.5%(出力トークン予算が同等の GPT-5.5 は 47.9%)
  • ExploitGym: 2時間上限で 24.9%、6時間で 33.7%(GPT-5.5 のピークは 15.1%)
  • SEC-Bench Pro: 71.2%(GPT-5.5 は 45.8%)、レイテンシ向上
  • Capture-the-Flag: 96.7%

両社ともここはゲーティングがあります。OpenAI は高度な防御能力へのアクセスを Daybreak の Trusted Access for Cyber 経由にし、9月1日までにハードウェアバックドパスキーを要求、Sol のサイバーセーフガードは潜在的に有害な活動を前世代比で約10倍多くブロックするとしています。Anthropic は、登録企業や研究者に制限の少ない Opus 5 ビルドを提供する Cyber Verification Program を運用しています。

科学分野では、Opus 5 は Anthropic のライフサイエンス評価すべてで Opus 4.8 を上回り、有機化学(分光データからの分子構造推定で+10.2ポイント)とタンパク質配列—機能予測(+7.7ポイント)が最大の伸びです。Sol は GeneBench Pro で 28.7%(GPT-5.5 は 12%)、LifeSciBench で 59.9% を報告。共通ベンチマークがないため、これは比較ではなく、異なる試験での自己採点に相当します。

料金

標準コンテキストでは入力とキャッシュ読み取りの単価が完全一致し、変数が一つ減ります。残る差は、Sol の出力が20%高いことと、長文コンテキストの追加課金が Sol のみに存在することです。

トークン単価の対比

単価 Claude Opus 5 GPT-5.6 Sol
入力(100万トークンあたり) $5.00 $5.00
出力(100万トークンあたり) $25.00 $30.00
キャッシュ入力読み取り(100万トークンあたり) $0.50 $0.50
キャッシュ書き込み(100万トークンあたり) $6.25 $6.25
長文コンテキストの追加課金 なし(100万までフラット) 入力2倍/出力1.5倍(272K入力超)
高速モード 価格2倍、速度約2.5倍 価格2倍、速度約2.5倍

短文コンテキストでは、差は生成側にのみ出るため、Sol のプレミアムは冗長な推論や長文出力で最も響きます。入出力比が「入力多・出力少」の検索型では差が縮みますが、Sol の長文コンテキスト課金が効き始めると逆転します。

両モデルとも、標準価格の約2倍で約2.5倍速の「高速モード」を提供しています。OpenAI は2026年7月30日に、従来の Priority Processing を高速モードに統合しました。ここは対称で差別化要因ではありません。

実際のワークロードはいくらかかるか

100万トークン単価は予算化しづらく、固定比は最重要点を隠します。この2モデルの差はワークロードの形状に完全に依存します。以下は標準単価での代表的な3パターン(キャッシュやバッチ割引なし)です。

ワークロード 前提ボリューム Claude Opus 5 GPT-5.6 Sol Sol 対 Opus
生成寄り 25万入力 / 100万出力 $26.25 $31.25 +19%
検索(272K 未満) 25万入力 / 2.5万出力 $1.88 $2.00 +7%
検索(272K 超) 50万入力 / 5万出力 $3.75 $7.25 +93%

生成寄りでは、出力20%のプレミアムがそのまま効き、Sol は約19%高くなります。短い検索型では、出力が小さく入力単価が同一のため約7%まで縮みます。

注目すべきは3行目。入力が272Kを超えると、Sol の追加課金が「入力2倍・出力1.5倍」をリクエスト全体に適用します。一方 Opus 5 は100万までフラット。つまりスケールしてもプレミアムは縮まず、請求がほぼ倍増します。大規模文脈の検索系では、見出しの出力プレミアムよりこの逆転の方が重要です。

同じタスクで料金が変わる理由

見出し単価以外で、同一作業でも請求額が変わる主因は2つあります。

  • Sol の長文コンテキスト課金。 272K入力を超えると、そのリクエスト全体が入力2倍・出力1.5倍で課金されます。Opus 5 には存在しない上位レート帯に、巨大プロンプト1本で移行してしまいます。これはトークン量差ではなくレート切替で、上表3行目に反映済みです。
  • Sol の ultra Ultra 自体はレートにプレミアムはなく、基本の $5/$30 と同一課金ですが、多エージェント・高労力度のためタスク当たりのトークン消費が増え、同レートでもベースの Sol 比でコストが約3倍になることがあります。これは報告ベースの推定で、実測値ではありません。

この留意点は出力側全般に当てはまります。現在出回っている効率主張の多くは他モデル比です。Sol は Coding Agent Index で Fable 5 の出力トークンを半分未満とし、Anthropic は Opus 5 が最大推論で Opus 4.8 より26%少ないトークン生成と報告します。いずれも前世代との比較であり、上の金額計算を変更するものではありません。 

Claude Opus 5 と GPT-5.6 Sol の選び方

各項目の結果はワークロードに素直に対応します。まずは意思決定の早見表です。

ユースケース 推奨 理由
学習前例のない、真に新規の問題 Claude Opus 5 ARC-AGI-3 で 30.2%(Sol は 7.78%)
複雑なターミナル/コマンドラインエージェント GPT-5.6 Sol Terminal-Bench 2.1 で 88.8%、ultra で 91.9%
リポジトリ横断のリファクタリングや設計作業 Claude Opus 5 SWE-Bench Pro で 79.2%(Sol は 64.6%)
防御的サイバーセキュリティとエクスプロイト再現 GPT-5.6 Sol ExploitBench で 73.5%。Opus 5 は設計上エクスプロイト生成をブロック
GUI 操作・コンピュータ操作エージェント Claude Opus 5 OSWorld 2.0 で 70.6%(Sol は 62.6%)
大規模文脈の長文検索 Claude Opus 5 デフォルトで100万トークン、追加課金なし
マルチクラウド企業展開 Claude Opus 5 Bedrock、Vertex AI、Azure AI Foundry で利用可能

Claude Opus 5 を選ぶべき場合

  • 課題が本当に新しい。 ARC-AGI-3 の差は本比較最大で、研究や、答えが学習コーパス上にない領域に直結します。
  • 「試行」ではなく「完了」を重視する。 AutomationBench の優位は、能力ではなく完遂に関する最も強いシグナルです。
  • 長文コンテキストで作業する。 デフォルトかつ上限ともに100万トークンで追加課金なし、というシンプルさは、Sol のコンテキスト取り扱いに関する公表値より明快です。
  • アラインメントが要件。 不正行動監査 2.3 は Anthropic 史上最良で、欺瞞率も悪用誘導への脆弱性も最低です。

GPT-5.6 Sol を選ぶべき場合

  • シェル内で動く複雑なエージェントを運用している。 Sol の ultra モードはこの分野でトップレベルに押し上げます。
  • 防御的セキュリティ業務を行う。 ExploitBench、ExploitGym、SEC-Bench Pro の数値は大きく、Opus 5 は分類器がエクスプロイト生成を積極的にブロックするため、ここは明確です。
  • 並列エージェントのオーケストレーションを内蔵で使いたい。 ultra はデフォルトで4エージェントを協調し、BrowseComp も16エージェントで 92.2% に到達。Responses API のマルチエージェントβで同様のパターンを自作できます。

まとめ

2週間差で、両社は正反対の賭けに出ました。Opus 5 は新規推論とタスク完了を追求し、Sol はターミナル作業、ブラウジング、防御的セキュリティを強化し、出力に20%のプレミアムを課しています。

課題が本当に新しい、エージェントに完遂が必要、または長文文脈で Sol の追加課金より Opus 5 のフラットな100万単価が有利、という場合は Opus 5。エージェントがシェル内で生き、Opus 5 が設計上ブロックするエクスプロイト再現を行う、もしくはターミナルやブラウジングのリーダーボードで首位に立つため ultra を負担できるなら Sol を選んでください。

それ以外の多くの軸では、両社のマーケティングが示すほどの差はありません。見出しのベンチマークではなく、主たるワークロードにモデルを合わせるのが賢明です。

FAQs

Claude Opus 5 と GPT-5.6 Sol はどちらが優れていますか?

一概にどちらが上とも言えません。Opus 5 は抽象推論とリポジトリレベルのコーディングで優位、GPT-5.6 Sol は長期タスクで強く、ターミナルコーディングやコストでは拮抗します。総合順位ではなく、ニーズに合う方を選んでください。

どちらのモデルが安いですか?

テストした3種類のワークロードでは Opus 5 の方が安価ですが、差は状況次第です。272K 未満の文脈では 7%、生成寄りの作業では 19%、入力が 272K トークンを超えると Sol のレートが跳ね上がり 93% の差に。大規模文脈に達しないなら、両者はほぼ同等です。

コーディングに適しているのはどちらですか?

コーディングの種類によります。本ベンチマークでは、Opus 5 はリポジトリレベルの作業で優位(SWE-Bench Pro 79.2% 対 64.6%)、ターミナルコーディングは概ね同水準(89.1% 対 88.8%)、長期コーディングでは GPT-5.6 Sol が優位(72.7% 対 68.8%)。単独の勝者はおらず、リポ全体の編集か、ターミナル自動化か、長い多段作業かでモデルを選んでください。

2つのモデルを簡単に切り替えられますか?

部分的には可能です。API と料金体系が別なので、エンドポイント変更とプロンプトの微調整が必要です。最大の落とし穴はコストで、Sol は 272K トークン超で Opus 5 の約2倍に跳ね上がるため、片方で安い作業がもう片方では高くつくことがあります。

ベンチマークはモデル選びの決め手になりますか?

一部は参考になります。推論の差(30.2% 対 7.78%)は大きいですが、絶対値としては双方とも高くはないため、日常利用では影響が小さいこともあります。コーディングは総じて高得点かつ接戦なので、リーダーボードより実作業での検証が重要です。

トピック

DataCamp で AI を学ぼう!

Tracks

ChatGPTの基礎

3時間
ChatGPTとプロンプトエンジニアリングの基礎を学びましょう。 ChatGPTの能力を最大限に引き出すプロンプト作成を習得します。
詳細を見るRight Arrow
コースを開始
もっと見るRight Arrow