Track
Если вы выбираете модель для агентных задач во второй половине 2026 года, короткий список совсем короткий, и две модели в нём вышли с разницей в две недели. Anthropic выпустила Claude Opus 5 24 июля, а OpenAI сделала GPT-5.6 Sol общедоступной 9 июля. Обе — флагманские уровни, обе рассчитаны на длительные профессиональные задачи, а цены у них практически идентичны.
В этой статье я сравню Claude Opus 5 и GPT-5.6 Sol по кодингу, рассуждению, работе за компьютером, использованию инструментов, ценам и доступности, чтобы вы могли выбрать то, что лучше подходит вашему рабочему процессу. Для более подробного разбора каждой модели по отдельности см. наш гайд по Claude Opus 5 и наш гайд по семейству GPT-5.6.
Кратко
- Opus 5 — специалист по новому типу рассуждений и агентным задачам; GPT-5.6 Sol — более сильный универсал для терминала и браузинга.
- Входные токены стоят $5 за миллион у обеих. По выходу Opus 5 дешевле на 17%.
- Выбирайте Opus 5 для действительно новых задач, кодинга и работы за компьютером. Выбирайте Sol для терминальных сценариев, браузерных агентов и задач оборонительной кибербезопасности.
Что такое Claude Opus 5?
Claude Opus 5 — модель уровня Opus от Anthropic, выпущенная 24 июля 2026 года, даёт результаты, схожие с более высоким уровнем Fable 5, но за половину цены. Это новая модель по умолчанию в Claude Max и самая сильная модель, доступная в Claude Pro.
Ключевая особенность модели — настойчивость. В формулировке Anthropic, Opus 5 проверяет свою работу и итеративно идёт к успеху, а не останавливается на правдоподобном ответе; при этом у неё отчётный показатель невыверенного поведения 2,3 — самый низкий среди недавних моделей Anthropic. Контекст — до 1 млн токенов с потолком выхода 128K, «мышление» включено по умолчанию.
Если хотите не читать, а строить, наш учебник по API Claude Opus 5 показывает, как собрать агента для исправления багов и прогнать его по всем пяти уровням усилий.
Что такое GPT-5.6 Sol?
GPT-5.6 Sol — флагман семейства GPT-5.6 от OpenAI, ставший общедоступным 9 июля 2026 года после ограниченного превью. В семействе три уровня:
- Sol: флагманская модель с наивысшей производительностью
- Terra: сбалансированная модель на каждый день
- Luna: экономичный вариант
OpenAI описывает Sol как дающую передовые результаты в кодинге, интеллектуальной работе, кибербезопасности и науке при меньших затратах токенов, чем у моделей, которые она обходит.
Главная функция Sol — ultra, режим рассуждений, который по умолчанию координирует четыре агента в параллельных потоках. OpenAI также добавила Programmatic Tool Calling в Responses API, что позволяет модели писать и запускать небольшие программы для оркестрации инструментов и фильтрации промежуточных данных вместо того, чтобы прогонять каждый ответ инструмента обратно через модель.
Подробнее о структуре семейства и оговорках периода превью см. наш разбор GPT-5.6. Мы также писали о заявленном контрпримере гипотезе Диница—Гарга—Гоэманса от GPT-5.6 Pro — это самое интересное применение семейства на сегодня.
Claude Opus 5 против GPT-5.6 Sol: сравнение лоб в лоб
Краткое резюме перед разбором отдельных измерений.
| Характеристика | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|
| Релиз | 24 июля 2026 | 9 июля 2026 |
| Вход, за 1 млн токенов | $5.00 | $5.00 |
| Выход, за 1 млн токенов | $25.00 | $30.00 |
| Окно контекста | 1 млн токенов | 1 млн токенов |
| Максимальный выход | 128K токенов | 128K токенов |
| Новые типы рассуждений (ARC-AGI-3) | 30,2% | 7,78% |
| Код в репозиториях (SWE-Bench Pro) | 79,2% | 64,6% |
| Кодинг в терминале (Terminal-Bench 2.1) | 89,1% | 88,8% (91,9% с ultra) |
| Дальнобойный кодинг (DeepSWE V1.1) | 68,8% | 72,7% |
| Работа за компьютером (OSWorld 2.0) | 70,6% | 62,6% |
| Браузерные агенты (BrowseComp) | 90,8% | 90,4% (92,2% с ultra) |
| Ключевая особенность | Самопроверка и итерации | Режим параллельных агентов ultra |
| ID модели | claude-opus-5 |
gpt-5.6-sol |
Новые типы рассуждений и абстрактные задачи
Здесь модели расходятся сильнее всего, поэтому начну с этого. ARC-AGI-3 просит модель решать задачи, которых не было в обучении, — это максимально близко к проверке рассуждений, а не запоминания.
Opus 5 набирает 30,2%. GPT-5.6 Sol — 7,78%, хотя это второй результат в таблице лидеров. Для сравнения, превью Gemini 3.1 Pro даёт 0,42%. Для контекста: Opus 4.8 два месяца назад набрала 1,5%, то есть рост в 20 раз в пределах одного поколения Anthropic.
Важно аккуратно интерпретировать четырёхкратную разницу по одному бенчмарку. ARC-AGI-3 сознательно противостоит запоминанию, а 30,2% — это всё ещё большинство неуспехов. Но если ваша работа — задачи, не похожие ни на что из обучающего корпуса, это самый релевантный показатель во всём сравнении — и разница здесь велика.
Кодинг и агентная инженерия
В кодинге результаты разделились, а не достались одной из моделей. Каждый вендор лидирует на тех бенчмарках, которые сам акцентирует, — это ожидаемо и именно поэтому стоит читать дальше заголовков.
| Бенчмарк | Claude Opus 5 | GPT-5.6 Sol | Заметки |
|---|---|---|---|
| SWE-Bench Verified | 96,0% | 96,2% | Фактически ничья; Fable 5 — 95,0% |
| SWE-Bench Pro | 79,2% | 64,6% | Лидирует Claude Mythos 5 с 80,3% |
| DeepSWE v1.1 | 68,8% | 72,7% | Преимущество Sol — 3,9 п.п. |
| Terminal-Bench 2.1 | 89,1% | 88,8% (91,9% с ultra) |
Ничья, разницу даёт ultra |
| Frontier-Bench v0.1 | 43,3% | 37,5% | Opus 4.8 два месяца назад — 18,7% |
| AA Coding Agent Index v1.1 | Не опубликовано | 80 | Fable 5 — 77,2; Opus 4.8 — 72,5 |
Паттерн очевиден, если разделить работу в репозитории и работу в терминале. Opus 5 берёт SWE-Bench Pro почти на 15 пунктов и более чем вдвое увеличивает свой результат на Frontier-Bench, который измеряет агентную инженерную работу над задачами вроде реконструкции детали в FreeCAD по чертежу. Пример Anthropic достоин цитаты: не имея способа посмотреть чертёж, Opus 5 написал собственный конвейер компьютерного зрения, чтобы извлечь геометрию из пикселей, и ни одна конкурирующая модель не решила задачу за пять попыток.
Sol — хозяин терминала, но разрыв меньше, чем в прошлых версиях. Он сравнялся с Opus 5 на Terminal-Bench 2.1, но выходит на 91,9% с включённым ultra. Sol также лидирует на DeepSWE v1.1 — тесте долгого горизонта на реальных кодовых базах — на 3,9 пункта, при этом тратит менее половины выходных токенов Fable 5 и примерно на треть меньше по стоимости.
Наблюдение по нашим экспериментам: когда мы собрали агента-фиксера багов на Opus 5 и прогнали по всем пяти уровням усилий, режим low исправил баг во всех трёх прогонах, тогда как max провалился в одном из трёх. Неудачный прогон вернул валидный по схеме, но пустой отчёт — без вызовов инструментов и с полем корневой причины "b0". Вывод: структурированный вывод гарантирует структуру, а не содержание, и более высокий «уровень усилий» не всегда лучше. Подробности — в нашем учебнике по API Opus 5.
Мой вывод: если ваши агенты живут в оболочке и вы можете позволить себе ultra, у Sol есть небольшой плюс. Если они живут в репозитории и им нужно рассуждать об архитектуре по многим файлам, преимущество у Opus 5. Ни одна модель не выигрывает «кодинг» как категорию целиком, и любые заявления обратного — это выбор удобных бенчмарков.
Работа за компьютером и браузинг
Это важно, если вы строите что-то, что управляет GUI, и распределение сил здесь такое же, как в кодинге.
Opus 5 берёт OSWorld 2.0 с 70,6% против 62,6% у Sol — разница 8 пунктов. Anthropic также утверждает, что Opus 5 обходит лучший результат Fable 5 на OSWorld при цене чуть более трети, что показательно, ведь Fable 5 стоит $10 за млн входных токенов против $5 у Opus 5.
Браузинг — фактически ничья. Opus 5 показывает 90,8% на BrowseComp; Sol — 90,4%, до 92,2% с ultra при шестнадцати параллельных агентах. И снова разницу делает ultra.
Результат Sol на OSWorld сопровождается важной ремаркой об эффективности по токенам: OpenAI говорит, что он превосходит Opus 4.8 при 85% меньшем числе выходных токенов. Это сравнение с прошлым поколением Anthropic, а не с Opus 5, так что напрямую к этому матчу не применимо, но указывает на необычно низкую стоимость пути «работа за компьютером» у Sol в расчёте на задачу.
Использование инструментов и автоматизация
Здесь разрыв в абстрактных возможностях превращается в завершённые бизнес-задачи — и Opus 5 заметно лидирует.
На AutomationBench от Zapier, который измеряет способность модели довести бизнес-задачу от начала до конца, Opus 5 набирает 26,0% против 18,1% у Sol. Anthropic сообщает, что его доля успехов примерно в 1,5 раза выше следующей лучшей модели при той же цене за задачу, и что даже на минимальном уровне усилий Opus 5 проходит больше задач, чем любая другая модель.
CEO Zapier Уэйд Фостер приводит конкретный прогон: Opus 5 взял «сырую» книгу по здоровью аккаунтов и выполнил последовательность предотвращения оттока от начала до конца — пометил рискованные аккаунты, уведомил нужного владельца и подготовил сводку для команды удержания. Предыдущие модели не проходили; Opus 5 показал 100%.
Ответ Sol — архитектурный, а не по баллам. Programmatic Tool Calling в Responses API позволяет Sol писать небольшие программы, координирующие инструменты, фильтровать промежуточные результаты и выбирать следующий шаг по мере выполнения — то есть инструментально насыщённые задачи двигаются с меньшим числом проходов через модель. Это реальный механизм эффективности, но это иное утверждение, чем «завершает больше задач корректно», а AutomationBench измеряет именно второе.
Кибербезопасность и наука
Здесь вендоры сознательно сделали противоположные выборы — и для некоторых читателей это уже решит исход.
Anthropic не обучала Opus 5 на киберзадачах. Прямо заявлено, что Opus 5 не двигает границы двуличных возможностей и уступает Mythos 5 как в биологических исследованиях, так и в наступательной кибербезопасности. На OSS-Fuzz Opus 5 находит уязвимости почти как Mythos 5, но значительно отстаёт в разработке эксплойтов. Классификаторы Opus 5 блокируют двоичный скан уязвимостей, пентест и генерацию эксплойтов, хотя ожидается, что будут вмешиваться примерно на 85% реже, чем у Fable 5.
OpenAI пошла в обратную сторону. Sol описан как самая сильная кибермодель OpenAI, и цифры велики:
- ExploitBench: 73,5% против 47,9% у GPT-5.5 при сопоставимом бюджете выходных токенов
- ExploitGym: 24,9% при лимите в два часа, до 33,7% при шести часах, против пика 15,1% у GPT-5.5
- SEC-Bench Pro: 71,2% против 45,8% у GPT-5.5, при лучшей задержке
- Capture-the-Flag: 96,7%
Оба вендора ставят заслоны. OpenAI направляет продвинутые защитные возможности через Trusted Access for Cyber от Daybreak, требует аппаратные passkey к 1 сентября для продолжения доступа к самым киберспособным моделям и заявляет, что защитные меры Sol блокируют примерно в десять раз больше потенциально вредной активности, чем раньше. Anthropic ведёт программу Cyber Verification Program, дающую зарегистрированным предприятиям и исследователям менее ограниченную сборку Opus 5.
В науке Opus 5 обходит Opus 4.8 на всех оценках по бионаукам у Anthropic, с наибольшим приростом в органической химии (на 10,2 п.п. при выводе молекулярных структур из спектроскопии) и предсказании функции по белковой последовательности (на 7,7 п.п.). Sol сообщает 28,7% на GeneBench Pro против 12% у GPT-5.5 и 59,9% на LifeSciBench. Общего бенчмарка нет, так что это не сравнение, а две «проверки домашней работы» на разных экзаменах.
Цены
Ставки за вход и за чтение из кэша совпадают при стандартном контексте, что убирает одну переменную. Остаётся 20%-ная наценка Sol на выход и надбавка за длинный контекст, которую берёт только Sol.
Ставки по токенам бок о бок
| Ставка | Claude Opus 5 | GPT-5.6 Sol |
|---|---|---|
| Вход, за 1 млн токенов | $5.00 | $5.00 |
| Выход, за 1 млн токенов | $25.00 | $30.00 |
| Чтение кэша, за 1 млн токенов | $0.50 | $0.50 |
| Запись в кэш, за 1 млн токенов | $6.25 | $6.25 |
| Надбавка за длинный контекст | Нет (плоско до 1 млн) | 2× вход / 1,5× выход сверх 272K входа |
| Быстрый режим | Цена ×2, скорость ~×2,5 | Цена ×2, скорость ~×2,5 |
Весь разрыв стоимости при коротком контексте приходится на генерацию, поэтому наценка Sol сильнее бьёт по многословным рассуждениям и длинному тексту. На задачах извлечения, где входных токенов сильно больше, чем выходных, разница сжимается — до момента, когда вступает в силу надбавка Sol за длинный контекст.
Обе модели теперь предлагают Быстрый режим примерно за двойную цену при ускорении около 2,5×. OpenAI 30 июля 2026 года «сложила» старый Priority Processing Sol в Быстрый режим, так что этот рычаг симметричен и не различает модели.
Сколько стоит реальная нагрузка
Ставки за миллион токенов сложно закладывать в бюджет, а одна фиксированная пропорция скрывает главное: разница между моделями полностью зависит от формы нагрузки. Ниже три типовых сценария по стандартным ставкам, без кэша и пакетных скидок.
| Нагрузка | Предполагаемый объём | Claude Opus 5 | GPT-5.6 Sol | Sol vs Opus |
|---|---|---|---|---|
| Генерация | 250K вход / 1 млн выход | $26.25 | $31.25 | +19% |
| Извлечение, до 272K | 250K вход / 25K выход | $1.88 | $2.00 | +7% |
| Извлечение, свыше 272K | 500K вход / 50K выход | $3.75 | $7.25 | +93% |
В задачах с преобладанием генерации 20%-ная наценка на выход почти напрямую проходит в итог, и Sol дороже примерно на 19%. На коротком извлечении разница почти закрывается — около 7%, потому что выход — это округление на фоне одинаковой цены входа.
Третья строка — ключевая. Как только запрос превышает 272K входных токенов, у Sol вся заявка тарифицируется как 2× по входу и 1,5× по выходу, тогда как Opus 5 остаётся плоским до 1 млн. Поэтому премия не сжимается на масштабе — счёт почти удваивается. Для извлечения или больших контекстов это важнее, чем заголовочная наценка на выход.
Почему одна и та же задача стоит по-разному
Здесь есть две причины, помимо базовых ставок:
- Надбавка Sol за длинный контекст. Любой запрос свыше 272K входных токенов тарифицируется как 2× по входу и 1,5× по выходу на всю заявку, так что один «переросший» промпт переводит Sol в более дорогой тариф, которого у Opus 5 нет. Это переключение тарифа, а не разница в токенах, и оно уже отражено в третьем сценарии выше.
- Sol
ultra. Ultra не несёт наценки — тарифицируется как базовый Sol $5/$30, — но его многоагентный, «высокоусиленный» режим тратит заметно больше токенов на задачу, что может утроить стоимость агентной работы по тем же ставкам. Это оценка по сообщениям, а не измеренная величина.
Та же оговорка относится и к выходу в целом. Почти все заявления об эффективности — это сравнения с другими моделями: у Sol якобы меньше половины выходных токенов Fable 5 на Coding Agent Index, а Anthropic сообщает, что Opus 5 генерирует на 26% меньше токенов, чем Opus 4.8, при максимальном рассуждении. Оба сравнивают с предшественниками и не меняют цифры выше.
Когда выбирать Claude Opus 5, а когда GPT-5.6 Sol
Результаты по измерениям довольно прозрачно мапятся на нагрузки, поэтому вот краткое руководство до подробностей по каждой стороне.
| Сценарий | Рекомендация | Почему |
|---|---|---|
| Действительно новые задачи без прецедентов в обучении | Claude Opus 5 | 30,2% на ARC-AGI-3 против 7,78% у Sol |
| Сложные агенты в терминале и CLI | GPT-5.6 Sol | 88,8% на Terminal-Bench 2.1, до 91,9% с ultra |
| Рефакторинг и архитектура на уровне репозитория | Claude Opus 5 | 79,2% на SWE-Bench Pro против 64,6% |
| Оборонительная кибербезопасность и воспроизведение эксплойтов | GPT-5.6 Sol | 73,5% на ExploitBench; Opus 5 по замыслу блокирует генерацию эксплойтов |
| GUI-управление и агенты «работы за компьютером» | Claude Opus 5 | 70,6% на OSWorld 2.0 против 62,6% |
| Длинный контекст и извлечение по большим корпусам | Claude Opus 5 | 1 млн контекста по умолчанию без надбавок |
| Мультиоблачное корпоративное развёртывание | Claude Opus 5 | Доступен на Bedrock, Vertex AI и Azure AI Foundry |
Выберите Claude Opus 5, если…
- Ваши задачи действительно новы. Разрыв по ARC-AGI-3 — самый крупный результат в сравнении; он напрямую относится к исследовательской работе и ко всем задачам, где ответа нет в обучающем корпусе.
- Вам нужны агенты, которые завершают задачи, а не пытаются. Преимущество на AutomationBench — самый сильный сигнал в статье о завершении, а не только о способностях.
- Вы работаете с длинными контекстами. 1 млн токенов и по умолчанию, и максимум — без «дорогих» уровней — это понятнее любой цифры, которую OpenAI публиковала для обработки контекста Sol.
- Важна сдержанность модели. Оценка невыверенного поведения 2,3 — лучший показатель Anthropic на сегодня, с самыми низкими уровнями обмана и уязвимости к злоупотреблениям.
Выберите GPT-5.6 Sol, если…
- Вы запускаете сложных агентов в оболочке. Режим ultra выводит его в лидеры
- Вы занимаетесь оборонительной безопасностью. Показатели ExploitBench, ExploitGym и SEC-Bench Pro высокие, а Opus 5 активно блокирует генерацию эксплойтов — выбор очевиден.
- Вам нужна встроенная оркестрация нескольких агентов.
ultraкоординирует четыре агента по умолчанию и поднял BrowseComp до 92,2% при шестнадцати агентах; многоагентная бета в Responses API позволяет строить подобные паттерны самостоятельно.
Итоги
С разницей в две недели вендоры сделали противоположные ставки: Opus 5 делает упор на новые типы рассуждений и завершение задач, а Sol — на работу в терминале, браузинг и оборонительную безопасность, при этом берёт на 20% дороже за выход.
Выбирайте Opus 5, если ваши задачи действительно новые, агентам важно завершать работу, а не пытаться, или вы работаете с длинными контекстами, где его «плоская» цена за 1 млн бьёт надбавку Sol; выбирайте Sol, если ваши агенты живут в оболочке, вы занимаетесь воспроизведением эксплойтов, что Opus 5 блокирует по замыслу, или если вы можете позволить себе ultra, чтобы возглавить рейтинги по терминалу и браузингу.
По большинству других направлений разрыв меньше, чем утверждает маркетинг, так что подбирайте модель под доминирующий тип ваших задач, а не под заголовок бенчмарка.
Частые вопросы
Какая модель лучше: Claude Opus 5 или GPT-5.6 Sol?
Без однозначного лидера. Opus 5 лидирует в абстрактном рассуждении и кодинге на уровне репозитория, тогда как GPT-5.6 Sol сильнее в задачах с длинным горизонтом; по терминальному кодингу и стоимости у них плотная борьба. Правильный выбор зависит от вашей нагрузки, а не от общего рейтинга.
Какая модель дешевле?
Opus 5 дешевле во всех трёх протестированных сценариях, но разница разная: всего 7% ниже 272K контекста, 19% на задачах с преобладанием генерации и 93% после превышения 272K входных токенов, когда ставка Sol скачет. Если вы редко выходите в большие контексты, модели почти равны по цене.
Какая модель лучше для кодинга?
Зависит от типа работы. В этих бенчмарках Opus 5 лидирует на задачах уровня репозитория (SWE-Bench Pro, 79,2% против 64,6%) и примерно сравнивается в терминальном кодинге (89,1% против 88,8%), тогда как GPT-5.6 Sol лидирует в задачах с длинным горизонтом (72,7% против 68,8%). Единого победителя нет, поэтому соотнесите модель с тем, что у вас преобладает: массовые изменения по репозиторию, терминальная автоматизация или длинные многошаговые задачи.
Легко ли переключаться между моделями?
Частично. Они работают через разные API с различными ценами, так что переключение потребует новых эндпоинтов и небольшой правки промптов. Главная ловушка — стоимость: после 272K токенов цена Sol примерно вдвое выше Opus 5, поэтому дёшево на одной модели может оказаться дорого на другой.
Подскажут ли бенчмарки, какую модель выбрать?
Отчасти. Разрыв в рассуждении огромный (30,2% против 7,78%), но в абсолюте у обеих там невысокие баллы, так что на повседневные задачи это может не влиять. По кодингу результаты у обеих высокие и близкие, поэтому тесты на реальных задачах важнее таблицы лидеров.
