Перейти к основному контенту

Claude Opus 5 против GPT-5.6 Sol: бенчмарки, цены и как выбрать

Anthropic Opus 5 и OpenAI GPT-5.6 Sol вышли в июле 2026 года с конкурирующими заявлениями о «агентной» работе. Я сравнил их бенчмарки по кодингу, рассуждениям, использованию инструментов и безопасности.
Обновлено 31 июл. 2026 г.  · 14 мин читать

Изучить с помощью AI

Открыть в ChatGPTОткрыть в ClaudeОткрыть в Perplexity

Если вы выбираете модель для агентных задач во второй половине 2026 года, короткий список совсем короткий, и две модели в нём вышли с разницей в две недели. Anthropic выпустила Claude Opus 5 24 июля, а OpenAI сделала GPT-5.6 Sol общедоступной 9 июля. Обе — флагманские уровни, обе рассчитаны на длительные профессиональные задачи, а цены у них практически идентичны.

В этой статье я сравню Claude Opus 5 и GPT-5.6 Sol по кодингу, рассуждению, работе за компьютером, использованию инструментов, ценам и доступности, чтобы вы могли выбрать то, что лучше подходит вашему рабочему процессу. Для более подробного разбора каждой модели по отдельности см. наш гайд по Claude Opus 5 и наш гайд по семейству GPT-5.6.

Кратко

  • Opus 5 — специалист по новому типу рассуждений и агентным задачам; GPT-5.6 Sol — более сильный универсал для терминала и браузинга.
  • Входные токены стоят $5 за миллион у обеих. По выходу Opus 5 дешевле на 17%.
  • Выбирайте Opus 5 для действительно новых задач, кодинга и работы за компьютером. Выбирайте Sol для терминальных сценариев, браузерных агентов и задач оборонительной кибербезопасности.

Что такое Claude Opus 5?

Claude Opus 5 — модель уровня Opus от Anthropic, выпущенная 24 июля 2026 года, даёт результаты, схожие с более высоким уровнем Fable 5, но за половину цены. Это новая модель по умолчанию в Claude Max и самая сильная модель, доступная в Claude Pro.

Ключевая особенность модели — настойчивость. В формулировке Anthropic, Opus 5 проверяет свою работу и итеративно идёт к успеху, а не останавливается на правдоподобном ответе; при этом у неё отчётный показатель невыверенного поведения 2,3 — самый низкий среди недавних моделей Anthropic. Контекст — до 1 млн токенов с потолком выхода 128K, «мышление» включено по умолчанию.

Если хотите не читать, а строить, наш учебник по API Claude Opus 5 показывает, как собрать агента для исправления багов и прогнать его по всем пяти уровням усилий.

Что такое GPT-5.6 Sol?

GPT-5.6 Sol — флагман семейства GPT-5.6 от OpenAI, ставший общедоступным 9 июля 2026 года после ограниченного превью. В семействе три уровня:

  • Sol: флагманская модель с наивысшей производительностью
  • Terra: сбалансированная модель на каждый день
  • Luna: экономичный вариант

OpenAI описывает Sol как дающую передовые результаты в кодинге, интеллектуальной работе, кибербезопасности и науке при меньших затратах токенов, чем у моделей, которые она обходит.

Главная функция Sol — ultra, режим рассуждений, который по умолчанию координирует четыре агента в параллельных потоках. OpenAI также добавила Programmatic Tool Calling в Responses API, что позволяет модели писать и запускать небольшие программы для оркестрации инструментов и фильтрации промежуточных данных вместо того, чтобы прогонять каждый ответ инструмента обратно через модель.

Подробнее о структуре семейства и оговорках периода превью см. наш разбор GPT-5.6. Мы также писали о заявленном контрпримере гипотезе Диница—Гарга—Гоэманса от GPT-5.6 Pro — это самое интересное применение семейства на сегодня.

Claude Opus 5 против GPT-5.6 Sol: сравнение лоб в лоб

Краткое резюме перед разбором отдельных измерений.

Характеристика Claude Opus 5 GPT-5.6 Sol
Релиз 24 июля 2026 9 июля 2026
Вход, за 1 млн токенов $5.00 $5.00
Выход, за 1 млн токенов $25.00 $30.00
Окно контекста 1 млн токенов 1 млн токенов
Максимальный выход 128K токенов 128K токенов
Новые типы рассуждений (ARC-AGI-3) 30,2% 7,78%
Код в репозиториях (SWE-Bench Pro) 79,2% 64,6%
Кодинг в терминале (Terminal-Bench 2.1) 89,1% 88,8% (91,9% с ultra)
Дальнобойный кодинг (DeepSWE V1.1) 68,8% 72,7%
Работа за компьютером (OSWorld 2.0) 70,6% 62,6%
Браузерные агенты (BrowseComp) 90,8% 90,4% (92,2% с ultra)
Ключевая особенность Самопроверка и итерации Режим параллельных агентов ultra
ID модели claude-opus-5 gpt-5.6-sol

Новые типы рассуждений и абстрактные задачи

Здесь модели расходятся сильнее всего, поэтому начну с этого. ARC-AGI-3 просит модель решать задачи, которых не было в обучении, — это максимально близко к проверке рассуждений, а не запоминания.

Opus 5 набирает 30,2%. GPT-5.6 Sol — 7,78%, хотя это второй результат в таблице лидеров. Для сравнения, превью Gemini 3.1 Pro даёт 0,42%. Для контекста: Opus 4.8 два месяца назад набрала 1,5%, то есть рост в 20 раз в пределах одного поколения Anthropic.

Важно аккуратно интерпретировать четырёхкратную разницу по одному бенчмарку. ARC-AGI-3 сознательно противостоит запоминанию, а 30,2% — это всё ещё большинство неуспехов. Но если ваша работа — задачи, не похожие ни на что из обучающего корпуса, это самый релевантный показатель во всём сравнении — и разница здесь велика.

Кодинг и агентная инженерия

В кодинге результаты разделились, а не достались одной из моделей. Каждый вендор лидирует на тех бенчмарках, которые сам акцентирует, — это ожидаемо и именно поэтому стоит читать дальше заголовков.

Бенчмарк Claude Opus 5 GPT-5.6 Sol Заметки
SWE-Bench Verified 96,0% 96,2% Фактически ничья; Fable 5 — 95,0%
SWE-Bench Pro 79,2% 64,6% Лидирует Claude Mythos 5 с 80,3%
DeepSWE v1.1 68,8% 72,7% Преимущество Sol — 3,9 п.п.
Terminal-Bench 2.1 89,1% 88,8% (91,9% с ultra) Ничья, разницу даёт ultra
Frontier-Bench v0.1 43,3% 37,5% Opus 4.8 два месяца назад — 18,7%
AA Coding Agent Index v1.1 Не опубликовано 80 Fable 5 — 77,2; Opus 4.8 — 72,5

Паттерн очевиден, если разделить работу в репозитории и работу в терминале. Opus 5 берёт SWE-Bench Pro почти на 15 пунктов и более чем вдвое увеличивает свой результат на Frontier-Bench, который измеряет агентную инженерную работу над задачами вроде реконструкции детали в FreeCAD по чертежу. Пример Anthropic достоин цитаты: не имея способа посмотреть чертёж, Opus 5 написал собственный конвейер компьютерного зрения, чтобы извлечь геометрию из пикселей, и ни одна конкурирующая модель не решила задачу за пять попыток.

Sol — хозяин терминала, но разрыв меньше, чем в прошлых версиях. Он сравнялся с Opus 5 на Terminal-Bench 2.1, но выходит на 91,9% с включённым ultra. Sol также лидирует на DeepSWE v1.1 — тесте долгого горизонта на реальных кодовых базах — на 3,9 пункта, при этом тратит менее половины выходных токенов Fable 5 и примерно на треть меньше по стоимости.

Наблюдение по нашим экспериментам: когда мы собрали агента-фиксера багов на Opus 5 и прогнали по всем пяти уровням усилий, режим low исправил баг во всех трёх прогонах, тогда как max провалился в одном из трёх. Неудачный прогон вернул валидный по схеме, но пустой отчёт — без вызовов инструментов и с полем корневой причины "b0". Вывод: структурированный вывод гарантирует структуру, а не содержание, и более высокий «уровень усилий» не всегда лучше. Подробности — в нашем учебнике по API Opus 5.

Мой вывод: если ваши агенты живут в оболочке и вы можете позволить себе ultra, у Sol есть небольшой плюс. Если они живут в репозитории и им нужно рассуждать об архитектуре по многим файлам, преимущество у Opus 5. Ни одна модель не выигрывает «кодинг» как категорию целиком, и любые заявления обратного — это выбор удобных бенчмарков.

Работа за компьютером и браузинг

Это важно, если вы строите что-то, что управляет GUI, и распределение сил здесь такое же, как в кодинге.

Opus 5 берёт OSWorld 2.0 с 70,6% против 62,6% у Sol — разница 8 пунктов. Anthropic также утверждает, что Opus 5 обходит лучший результат Fable 5 на OSWorld при цене чуть более трети, что показательно, ведь Fable 5 стоит $10 за млн входных токенов против $5 у Opus 5.

Браузинг — фактически ничья. Opus 5 показывает 90,8% на BrowseComp; Sol — 90,4%, до 92,2% с ultra при шестнадцати параллельных агентах. И снова разницу делает ultra.

Результат Sol на OSWorld сопровождается важной ремаркой об эффективности по токенам: OpenAI говорит, что он превосходит Opus 4.8 при 85% меньшем числе выходных токенов. Это сравнение с прошлым поколением Anthropic, а не с Opus 5, так что напрямую к этому матчу не применимо, но указывает на необычно низкую стоимость пути «работа за компьютером» у Sol в расчёте на задачу.

Использование инструментов и автоматизация

Здесь разрыв в абстрактных возможностях превращается в завершённые бизнес-задачи — и Opus 5 заметно лидирует.

На AutomationBench от Zapier, который измеряет способность модели довести бизнес-задачу от начала до конца, Opus 5 набирает 26,0% против 18,1% у Sol. Anthropic сообщает, что его доля успехов примерно в 1,5 раза выше следующей лучшей модели при той же цене за задачу, и что даже на минимальном уровне усилий Opus 5 проходит больше задач, чем любая другая модель.

CEO Zapier Уэйд Фостер приводит конкретный прогон: Opus 5 взял «сырую» книгу по здоровью аккаунтов и выполнил последовательность предотвращения оттока от начала до конца — пометил рискованные аккаунты, уведомил нужного владельца и подготовил сводку для команды удержания. Предыдущие модели не проходили; Opus 5 показал 100%.

Ответ Sol — архитектурный, а не по баллам. Programmatic Tool Calling в Responses API позволяет Sol писать небольшие программы, координирующие инструменты, фильтровать промежуточные результаты и выбирать следующий шаг по мере выполнения — то есть инструментально насыщённые задачи двигаются с меньшим числом проходов через модель. Это реальный механизм эффективности, но это иное утверждение, чем «завершает больше задач корректно», а AutomationBench измеряет именно второе.

Кибербезопасность и наука

Здесь вендоры сознательно сделали противоположные выборы — и для некоторых читателей это уже решит исход.

Anthropic не обучала Opus 5 на киберзадачах. Прямо заявлено, что Opus 5 не двигает границы двуличных возможностей и уступает Mythos 5 как в биологических исследованиях, так и в наступательной кибербезопасности. На OSS-Fuzz Opus 5 находит уязвимости почти как Mythos 5, но значительно отстаёт в разработке эксплойтов. Классификаторы Opus 5 блокируют двоичный скан уязвимостей, пентест и генерацию эксплойтов, хотя ожидается, что будут вмешиваться примерно на 85% реже, чем у Fable 5.

OpenAI пошла в обратную сторону. Sol описан как самая сильная кибермодель OpenAI, и цифры велики:

  • ExploitBench: 73,5% против 47,9% у GPT-5.5 при сопоставимом бюджете выходных токенов
  • ExploitGym: 24,9% при лимите в два часа, до 33,7% при шести часах, против пика 15,1% у GPT-5.5
  • SEC-Bench Pro: 71,2% против 45,8% у GPT-5.5, при лучшей задержке
  • Capture-the-Flag: 96,7%

Оба вендора ставят заслоны. OpenAI направляет продвинутые защитные возможности через Trusted Access for Cyber от Daybreak, требует аппаратные passkey к 1 сентября для продолжения доступа к самым киберспособным моделям и заявляет, что защитные меры Sol блокируют примерно в десять раз больше потенциально вредной активности, чем раньше. Anthropic ведёт программу Cyber Verification Program, дающую зарегистрированным предприятиям и исследователям менее ограниченную сборку Opus 5.

В науке Opus 5 обходит Opus 4.8 на всех оценках по бионаукам у Anthropic, с наибольшим приростом в органической химии (на 10,2 п.п. при выводе молекулярных структур из спектроскопии) и предсказании функции по белковой последовательности (на 7,7 п.п.). Sol сообщает 28,7% на GeneBench Pro против 12% у GPT-5.5 и 59,9% на LifeSciBench. Общего бенчмарка нет, так что это не сравнение, а две «проверки домашней работы» на разных экзаменах.

Цены

Ставки за вход и за чтение из кэша совпадают при стандартном контексте, что убирает одну переменную. Остаётся 20%-ная наценка Sol на выход и надбавка за длинный контекст, которую берёт только Sol.

Ставки по токенам бок о бок

Ставка Claude Opus 5 GPT-5.6 Sol
Вход, за 1 млн токенов $5.00 $5.00
Выход, за 1 млн токенов $25.00 $30.00
Чтение кэша, за 1 млн токенов $0.50 $0.50
Запись в кэш, за 1 млн токенов $6.25 $6.25
Надбавка за длинный контекст Нет (плоско до 1 млн) 2× вход / 1,5× выход сверх 272K входа
Быстрый режим Цена ×2, скорость ~×2,5 Цена ×2, скорость ~×2,5

Весь разрыв стоимости при коротком контексте приходится на генерацию, поэтому наценка Sol сильнее бьёт по многословным рассуждениям и длинному тексту. На задачах извлечения, где входных токенов сильно больше, чем выходных, разница сжимается — до момента, когда вступает в силу надбавка Sol за длинный контекст.

Обе модели теперь предлагают Быстрый режим примерно за двойную цену при ускорении около 2,5×. OpenAI 30 июля 2026 года «сложила» старый Priority Processing Sol в Быстрый режим, так что этот рычаг симметричен и не различает модели.

Сколько стоит реальная нагрузка

Ставки за миллион токенов сложно закладывать в бюджет, а одна фиксированная пропорция скрывает главное: разница между моделями полностью зависит от формы нагрузки. Ниже три типовых сценария по стандартным ставкам, без кэша и пакетных скидок.

Нагрузка Предполагаемый объём Claude Opus 5 GPT-5.6 Sol Sol vs Opus
Генерация 250K вход / 1 млн выход $26.25 $31.25 +19%
Извлечение, до 272K 250K вход / 25K выход $1.88 $2.00 +7%
Извлечение, свыше 272K 500K вход / 50K выход $3.75 $7.25 +93%

В задачах с преобладанием генерации 20%-ная наценка на выход почти напрямую проходит в итог, и Sol дороже примерно на 19%. На коротком извлечении разница почти закрывается — около 7%, потому что выход — это округление на фоне одинаковой цены входа.

Третья строка — ключевая. Как только запрос превышает 272K входных токенов, у Sol вся заявка тарифицируется как 2× по входу и 1,5× по выходу, тогда как Opus 5 остаётся плоским до 1 млн. Поэтому премия не сжимается на масштабе — счёт почти удваивается. Для извлечения или больших контекстов это важнее, чем заголовочная наценка на выход.

Почему одна и та же задача стоит по-разному

Здесь есть две причины, помимо базовых ставок:

  • Надбавка Sol за длинный контекст. Любой запрос свыше 272K входных токенов тарифицируется как 2× по входу и 1,5× по выходу на всю заявку, так что один «переросший» промпт переводит Sol в более дорогой тариф, которого у Opus 5 нет. Это переключение тарифа, а не разница в токенах, и оно уже отражено в третьем сценарии выше.
  • Sol ultra. Ultra не несёт наценки — тарифицируется как базовый Sol $5/$30, — но его многоагентный, «высокоусиленный» режим тратит заметно больше токенов на задачу, что может утроить стоимость агентной работы по тем же ставкам. Это оценка по сообщениям, а не измеренная величина.

Та же оговорка относится и к выходу в целом. Почти все заявления об эффективности — это сравнения с другими моделями: у Sol якобы меньше половины выходных токенов Fable 5 на Coding Agent Index, а Anthropic сообщает, что Opus 5 генерирует на 26% меньше токенов, чем Opus 4.8, при максимальном рассуждении. Оба сравнивают с предшественниками и не меняют цифры выше. 

Когда выбирать Claude Opus 5, а когда GPT-5.6 Sol

Результаты по измерениям довольно прозрачно мапятся на нагрузки, поэтому вот краткое руководство до подробностей по каждой стороне.

Сценарий Рекомендация Почему
Действительно новые задачи без прецедентов в обучении Claude Opus 5 30,2% на ARC-AGI-3 против 7,78% у Sol
Сложные агенты в терминале и CLI GPT-5.6 Sol 88,8% на Terminal-Bench 2.1, до 91,9% с ultra
Рефакторинг и архитектура на уровне репозитория Claude Opus 5 79,2% на SWE-Bench Pro против 64,6%
Оборонительная кибербезопасность и воспроизведение эксплойтов GPT-5.6 Sol 73,5% на ExploitBench; Opus 5 по замыслу блокирует генерацию эксплойтов
GUI-управление и агенты «работы за компьютером» Claude Opus 5 70,6% на OSWorld 2.0 против 62,6%
Длинный контекст и извлечение по большим корпусам Claude Opus 5 1 млн контекста по умолчанию без надбавок
Мультиоблачное корпоративное развёртывание Claude Opus 5 Доступен на Bedrock, Vertex AI и Azure AI Foundry

Выберите Claude Opus 5, если…

  • Ваши задачи действительно новы. Разрыв по ARC-AGI-3 — самый крупный результат в сравнении; он напрямую относится к исследовательской работе и ко всем задачам, где ответа нет в обучающем корпусе.
  • Вам нужны агенты, которые завершают задачи, а не пытаются. Преимущество на AutomationBench — самый сильный сигнал в статье о завершении, а не только о способностях.
  • Вы работаете с длинными контекстами. 1 млн токенов и по умолчанию, и максимум — без «дорогих» уровней — это понятнее любой цифры, которую OpenAI публиковала для обработки контекста Sol.
  • Важна сдержанность модели. Оценка невыверенного поведения 2,3 — лучший показатель Anthropic на сегодня, с самыми низкими уровнями обмана и уязвимости к злоупотреблениям.

Выберите GPT-5.6 Sol, если…

  • Вы запускаете сложных агентов в оболочке. Режим ultra выводит его в лидеры 
  • Вы занимаетесь оборонительной безопасностью. Показатели ExploitBench, ExploitGym и SEC-Bench Pro высокие, а Opus 5 активно блокирует генерацию эксплойтов — выбор очевиден.
  • Вам нужна встроенная оркестрация нескольких агентов. ultra координирует четыре агента по умолчанию и поднял BrowseComp до 92,2% при шестнадцати агентах; многоагентная бета в Responses API позволяет строить подобные паттерны самостоятельно.

Итоги

С разницей в две недели вендоры сделали противоположные ставки: Opus 5 делает упор на новые типы рассуждений и завершение задач, а Sol — на работу в терминале, браузинг и оборонительную безопасность, при этом берёт на 20% дороже за выход.

Выбирайте Opus 5, если ваши задачи действительно новые, агентам важно завершать работу, а не пытаться, или вы работаете с длинными контекстами, где его «плоская» цена за 1 млн бьёт надбавку Sol; выбирайте Sol, если ваши агенты живут в оболочке, вы занимаетесь воспроизведением эксплойтов, что Opus 5 блокирует по замыслу, или если вы можете позволить себе ultra, чтобы возглавить рейтинги по терминалу и браузингу.

По большинству других направлений разрыв меньше, чем утверждает маркетинг, так что подбирайте модель под доминирующий тип ваших задач, а не под заголовок бенчмарка.

Частые вопросы

Какая модель лучше: Claude Opus 5 или GPT-5.6 Sol?

Без однозначного лидера. Opus 5 лидирует в абстрактном рассуждении и кодинге на уровне репозитория, тогда как GPT-5.6 Sol сильнее в задачах с длинным горизонтом; по терминальному кодингу и стоимости у них плотная борьба. Правильный выбор зависит от вашей нагрузки, а не от общего рейтинга.

Какая модель дешевле?

Opus 5 дешевле во всех трёх протестированных сценариях, но разница разная: всего 7% ниже 272K контекста, 19% на задачах с преобладанием генерации и 93% после превышения 272K входных токенов, когда ставка Sol скачет. Если вы редко выходите в большие контексты, модели почти равны по цене.

Какая модель лучше для кодинга?

Зависит от типа работы. В этих бенчмарках Opus 5 лидирует на задачах уровня репозитория (SWE-Bench Pro, 79,2% против 64,6%) и примерно сравнивается в терминальном кодинге (89,1% против 88,8%), тогда как GPT-5.6 Sol лидирует в задачах с длинным горизонтом (72,7% против 68,8%). Единого победителя нет, поэтому соотнесите модель с тем, что у вас преобладает: массовые изменения по репозиторию, терминальная автоматизация или длинные многошаговые задачи.

Легко ли переключаться между моделями?

Частично. Они работают через разные API с различными ценами, так что переключение потребует новых эндпоинтов и небольшой правки промптов. Главная ловушка — стоимость: после 272K токенов цена Sol примерно вдвое выше Opus 5, поэтому дёшево на одной модели может оказаться дорого на другой.

Подскажут ли бенчмарки, какую модель выбрать?

Отчасти. Разрыв в рассуждении огромный (30,2% против 7,78%), но в абсолюте у обеих там невысокие баллы, так что на повседневные задачи это может не влиять. По кодингу результаты у обеих высокие и близкие, поэтому тесты на реальных задачах важнее таблицы лидеров.

Темы

Изучайте ИИ с DataCamp!

Track

Основы ChatGPT

3 ч
Изучите основы ChatGPT и инженерии промптов. Освойте создание промптов, чтобы максимально раскрыть возможности ChatGPT.
ПодробнееRight Arrow
Начать Курс
Смотрите большеRight Arrow