Course
Пока что 2026 год проходит под знаком агентного ИИ. Улучшения моделей привели к появлению множества инструментов для агентной работы — от персональных ИИ-ассистентов до код-агентов. Крупнейшие игроки в этой области — Gemini от Google, серия GPT от OpenAI и модели Anthropic, которые стали фаворитами разработчиков.
В этой статье мы сравним Claude Opus 4.7 и Gemini 3.1 Pro, включая бенчмарки и цены. В конце вы получите критерий, по которому можно решить, какая модель лучше подойдёт для вашего рабочего процесса.
Что такое Claude Opus 4.7?
Как мы рассказываем в нашем материале об Opus 4.7, Claude Opus 4.7 — флагманская модель Anthropic, обновление для её предшественницы Claude Opus 4.6. Она создана для сложных агентных пайплайнов и многошагового рассуждения. Модель лучше справляется с агентным кодингом, визуальным рассуждением и использованием инструментов.
Ключевые возможности и характеристики Claude Opus 4.7
Одна из центральных функций Opus 4.7 — бюджеты задач, позволяющие задать финансовое ограничение на число токенов, которое агент может израсходовать на задачу. Это предотвращает неожиданные расходы при автономной работе агента, вынуждая его оптимизировать действия и укладываться в бюджет.
У Claude Opus 4.7 окно контекста — 1 миллион токенов и 128 тыс. выходных токенов. Это означает, что модель может выполнять длительные задачи, сохраняя весь контекст. Особенно полезно это при работе с крупными кодовыми базами.
Модель также улучшила возможности зрения, поддерживая изображения до 3,75 мегапикселя. В результате она лучше справляется с визуальным рассуждением, чем Opus 4.6, и идеально подходит для задач вроде извлечения данных из графиков высокого разрешения.
Opus 4.7 также предлагает новый режим рассуждения xhigh, расположенный между high и max, чтобы обеспечивать лучшие результаты в кодинге и агентных задачах. Можно использовать и режим high — с несколько меньшими затратами на «мышление». Anthropic также представила /ultrareview в Claude Code для запуска код-ревью изменений и поиска багов.

Возможно, вас удивит, что Adaptive Thinking теперь по умолчанию не выводит «мысли». Суммаризованную версию рассуждений можно вернуть, установив thinking.display в значение summarized.
Что касается бенчмарков, Opus 4.7 показывает:
- 87,6% в SWE-bench Verified
- 64,3% в более сложном варианте SWE-bench Pro
- 78% в OSWorld, который измеряет автономное использование компьютера
- 77,3% в MCP Atlas для оркестрации многоинструментальных процессов
На момент выхода Claude Opus 4.7 он возглавлял Artificial Analysis Intelligence Index с оценкой 57. Также он лидировал в реальных агентных задачах по метрике GDPval-AA с результатом 1753 Elo. Со временем GPT-5.5 обошёл его по обоим показателям.
Узнайте, как создать бенчмарк-приложение на Streamlit, которое проверяет, действительно ли память самокритики Opus 4.7 улучшает качество кодинга при уровнях усилия high, xhigh и max, в нашем практическом бенчмарке Claude Opus 4.7.
Плюсы и минусы Claude Opus 4.7
Модели Anthropic известны как лучшие для программирования, и бенчмарки Opus 4.7 это подтверждают. Однако семейство Opus недешёвое, поэтому бюджеты задач — полезное дополнение, особенно для тех, кто запускает длинные агентные процессы.
Модель доступна у разных облачных провайдеров, таких как Amazon Bedrock, Google Vertex AI и Microsoft Foundry. Это упрощает интеграцию с помощью вашего текущего провайдера.
Opus 4.7 также поставляется с новым токенизатором, из-за чего сравнивать фактическую стоимость с прошлой моделью Opus немного сложнее. Однако, по данным Artificial Analysis Intelligence, Opus 4.7 использовал примерно на 35% меньше выходных токенов, чем Opus 4.6, при запуске индекса.

Узнайте о возможностях лучшей общедоступной модели Anthropic — Claude Opus 4.7 — и создайте инструмент для науки о данных, который преобразует график в «сырые» данные, в нашем руководстве по API Claude Opus 4.7.
Что такое Gemini 3.1 Pro?
Gemini 3.1 Pro — актуальная флагманская модель рассуждения от Google DeepMind на базе «смеси экспертов» в архитектуре Transformer. На момент выхода Gemini 3.1 Pro лидировала в Artificial Analysis Intelligence Index с отрывом в 4 пункта от Opus 4.6, а сейчас наравне с Opus 4.7 с оценкой 57.
Чтобы узнать больше о Gemini 3.1 Pro, ознакомьтесь с нашим материалом «Создание приложений с Gemini 3.1 Pro», где показано, как построить готовое к продакшену приложение на базе Gemini 3.1 Pro.
Ключевые возможности и характеристики Gemini 3.1 Pro
В отличие от Gemini 3 Pro, у которого было два уровня, у Gemini 3.1 Pro три уровня «мышления»: low, medium и high. low подходит для скорости и экономии токенов. medium обеспечивает баланс. Поскольку high генерирует больше «мыслительных» токенов и даёт самые медленные ответы, его стоит использовать для задач, требующих сложного рассуждения.
Gemini 3.1 Pro также поддерживает окно контекста в 1 миллион входных токенов, но меньшее — примерно 65 тыс. выходных токенов. Модель мультимодальная и поддерживает аудио, PDF, текст и изображения.
Перейдём к бенчмаркам. Вот две области, где Gemini 3.1 Pro выделяется:
- Gemini 3.1 Pro лидирует по ARC-AGI-2 с результатом 77,1%.
- Gemini 3.1 Pro набирает 73,9% в MCP Atlas, который измеряет координацию многоинструментальных процессов.

По данным Artificial Analysis Intelligence, Gemini 3.1 Pro Preview эффективно расходует токены, используя около 57 млн токенов для запуска их Индекса по сравнению с Opus 4.6.
Gemini 3.1 Pro опережает Opus 4.7 в Coding Index Artificial Analysis, но уступает ему в Agentic Index.
Плюсы и минусы Gemini 3.1 Pro
Цены на Gemini 3.1 Pro весьма привлекательны, особенно для задач с большим числом токенов. Google также предлагает скидку 50% по пакетному тарифу (batch pricing), что делает модель идеальной, когда не нужны результаты в реальном времени.
Из минусов — окно из 65 тыс. выходных токенов у Gemini 3.1 Pro вдвое меньше, чем у Opus 4.7 (128 тыс.).
Сравнение Claude Opus 4.7 и Gemini 3.1 Pro — очное противостояние
Краткая справка перед тем, как перейти к каждой категории.
|
Claude Opus 4.7 |
Gemini 3.1 Pro |
|
|
Дата релиза |
16 апреля 2026 |
19 февраля 2026 |
|
Окно контекста |
1 млн токенов |
1 млн токенов |
|
Макс. вывод |
128 тыс. токенов |
65 тыс. токенов |
|
SWE-bench Verified |
87,6% |
80,6% |
|
SWE-bench Pro |
64,3% |
54,2% |
|
ARC-AGI-2 |
75,8% |
77,1% |
|
GPQA Diamond |
94,2% (на равных) |
94,3% (на равных) |
|
MCP Atlas |
77,3% |
73,9% |
|
OSWorld |
78,0% |
Нет опубликованной оценки |
|
Vision |
2576px / 3,75 МП |
Мультимодальность (видео, аудио, PDF) |
|
Цена ввода |
$5/млн токенов |
$2/млн токенов |
|
Цена вывода |
$25/млн токенов |
$12/млн токенов |
Производительность в агентных задачах и при работе за компьютером
Opus 4.7 — очень сильная модель для агентной работы, в частности потому, что позволяет контролировать, сколько токенов агент может использовать. В Gemini 3.1 Pro такой системы нет; для контроля расхода токенов нужно менять уровень «мышления».
Opus 4.7 набирает 78% в бенчмарке OSWorld по автономному использованию компьютера. Это сильный результат на уровне GPT 5.5 (78,7%), тогда как у Gemini 3.1 Pro нет опубликованной оценки OSWorld. В MCP Atlas Opus 4.7 лидирует с 77,3% против 73,9% у Gemini. Эти цифры делают Opus 4.7 отличным выбором для продакшен-систем с агентами.
Бенчмарки по программированию
Посмотрим, какая модель лучше в программировании по доступным бенчмаркам, в частности SWE-bench Verified, который тестирует реальные задачи GitHub.
Opus 4.7 достигает 87,6% против 80,6% у Gemini 3.1 Pro. В SWE-bench Pro, более сложном варианте тестов, Opus 4.7 получает 64,3% против 54,2% у Gemini (и 58,6% у GPT 5.5). Эти данные показывают, что Opus 4.7 — на данный момент самая сильная модель для кодинга в мире.
Посмотрим, как модели справляются с Terminal-Bench 2.0, который проверяет умение писать код в терминале. Opus 4.7 — 69,4%, Gemini Pro — 68,5%, а новый GPT 5.5 — 82,7%. В этом бенчмарке явный лидер — GPT-5.5, а наши две модели тут фактически на равных.
Рассуждение и научные задачи
Какая модель лучше для рассуждения и научных задач? Разберёмся. Я не буду использовать бенчмарк GPQA Diamond, потому что все модели проходят его на отлично. Вместо этого посмотрим на ARC-AGI-2, который оценивает «текучий интеллект», то есть способность модели решать новые абстрактные задачи рассуждения.
Gemini 3.1 Pro набирает 77,1% против 75,8% у Opus 4.7 и 85,0% у GPT 5.5, что делает GPT 5.5 явным лидером, а за ним следует Gemini 3.1 Pro.
В бенчмарке Humanity's Last Exam, который измеряет уровень рассуждения выпускников по наукам, математике и гуманитарным дисциплинам, Opus 4.7 опережает Gemini 3.1 Pro как с инструментами, так и без них:
- Без инструментов: Opus 4.7 лидирует с 46,9%, за ним — Gemini 3.1 Pro (44,4%) и GPT 5.5 Pro (43,1%).
- С инструментами: GPT 5.5 Pro лидирует с 57,2%, далее Opus 4.7 (54,7%) и Gemini 3.1 Pro (51,4%).
Стоимость и эффективность по токенам
Opus 4.7 стоит $5 за миллион входных токенов и $25 за миллион выходных токенов, в то время как Gemini 3.1 Pro — $2 за миллион входных и $12 за миллион выходных. Gemini значительно дешевле, а с 50%-ной скидкой по пакетной тарификации модель очень выгодна для задач с большими объёмами токенов.
Также важно отметить, что новый токенизатор в Opus 4.7 немного затрудняет сравнение стоимости с предыдущей моделью Opus.
Окно контекста и объём вывода
Обе модели принимают до 1 миллиона входных токенов, что позволяет им «съедать» целые кодовые базы и длинные исследовательские документы в одном запросе.
По выходу Opus 4.7 поддерживает 128 тыс. токенов, а Gemini 3.1 Pro — 65 536. Это делает Opus лучшим выбором для процессов, где требуется генерировать больше выходных токенов.

Узнайте, как Opus 4.7 и GPT 5.4 соотносятся, в нашем руководстве «Opus 4.7 vs. GPT-5.4», где мы сравниваем их для кодинга, агентных процессов и задач с длинным контекстом и анализируем бенчмарки.
Claude Opus 4.7 лучше, чем Gemini 3.1 Pro?
Это подводит нас к вопросу: какую из двух моделей выбрать?
Выберите Claude Opus 4.7, если...
- Вы строите агентные пайплайны для кодинга, где разница в 10 пунктов в SWE-bench Pro напрямую означает меньше неудачных запусков в продакшене.
- Вам нужны бюджеты задач, чтобы сделать длинные автономные циклы более предсказуемыми без добавления внешней логики мониторинга.
- Ваш пайплайн генерирует длинные ответы, и потолок в 128 тыс. токенов имеет значение — это почти вдвое больше, чем поддерживает Gemini 3.1 Pro.
- Вам важен самый высокий показатель мультиинструментальной оркестрации в MCP Atlas для сложных агентных процессов.
- Вы уже находитесь в экосистеме Anthropic через Claude Code, Amazon Bedrock или Claude API, и стоимость переключения перевешивает разницу в цене.
Выберите Gemini 3.1 Pro, если...
- Ваши объёмы токенов делают разницу в цене ввода 2,5 раза существенной: при 500 млн токенов в месяц это $1500 экономии ежемесячно.
- Вам нужны нативные видео-, аудио- или PDF-входы в одном API-вызове без отдельного шага предобработки.
- Вы строите решения на инфраструктуре Google и хотите работать с одним вендором через Vertex AI.
- Абстрактное визуальное рассуждение — ваш основной сценарий. Opus отстаёт в ARC-AGI-2 с 75,8% против 77,1% у Gemini.
Заключение
И Claude Opus 4.7, и Gemini 3.1 Pro — сильные модели. Выбор зависит от вашего бюджета и решаемых задач. Opus выигрывает в агентных сценариях, но если он не укладывается в бюджет, Gemini 3.1 Pro — тоже сильный кандидат, особенно с более дешёвыми токенами и скидкой 50% по пакетной тарификации.
Anthropic удерживает лидерство среди лучших моделей для кодинга, что делает их особенно подходящими для агентных задач, требующих сложного рассуждения и программирования. Google предлагает передовые модели рассуждения по значительно более низкой цене по сравнению с Anthropic. Борьба между обеими компаниями и другими крупными игроками, такими как OpenAI, идёт за то, чтобы предложить лучший агентный ИИ, который одновременно будет хорош и как универсальная модель.
С учётом высокой стоимости семейства Opus приятно видеть появление бюджетов задач. Не удивимся, если другие провайдеры внедрят это в будущих релизах. Это хорошее дополнение, которое сделает стоимость запуска долгих агентных задач более предсказуемой.
Чтобы узнать больше о работе с ИИ-инструментами, рекомендуем посмотреть наш гид по лучшим бесплатным ИИ-инструментам. Для более широких навыков по ИИ-кодингу попробуйте курс AI-Assisted Coding for Developers, чтобы развить навыки, делающие ИИ-ассистентов более надёжными партнёрами в вашем процессе разработки.
Наконец, вы также можете узнать, как создавать приложения на базе ИИ с использованием LLM, подсказок, чейнов и агентов в LangChain на нашем курсе Developing LLM Applications with LangChain.
Claude Opus 4.7 и Gemini 3.1 Pro: ответы на частые вопросы
Claude Opus 4.7 лучше, чем Gemini 3.1 Pro?
Зависит от сценария использования. Opus 4.7 лидирует в бенчмарках по кодингу (87,6% против 80,6% в SWE-bench Verified), в использовании агентных инструментов (MCP Atlas 77,3% против 73,9%) и по объёму вывода (128 тыс. против 65 тыс. токенов).
Что такое бюджет задачи в Claude Opus 4.7?
Бюджет задачи — это лимит токенов, который вы задаёте для всего агентного цикла, включая «мышление», вызовы инструментов, результаты инструментов и финальный ответ. Claude отслеживает, какая часть бюджета уже израсходована, и корректирует работу соответствующим образом.
Сколько стоит Gemini 3.1 Pro по сравнению с Claude Opus 4.7?
Gemini 3.1 Pro стоит $2 за миллион входных токенов и $12 за миллион выходных токенов. Claude Opus 4.7 стоит $5 за миллион входных и $25 за миллион выходных токенов, поэтому Gemini в 2,5 раза дешевле по входу. Gemini также предлагает пакетный API со скидкой 50%, снижая стоимость входа до $1 за миллион токенов для асинхронных задач.
Как Claude Opus 4.7 и Gemini 3.1 Pro сравниваются в бенчмарке SWE-bench?
Gemini 3.1 Pro набирает 80,6% в SWE-bench Verified и 54,2% в SWE-bench Pro. Claude Opus 4.7 набирает 87,6% в SWE-bench Verified и 64,3% в SWE-bench Pro. Разница в 10 пунктов в варианте Pro — наиболее существенное отличие между моделями в задачах кодинга.
У какой модели самое длинное окно контекста?
И Claude Opus 4.7, и Gemini 3.1 Pro поддерживают окно контекста в 1 миллион токенов для входа. По выходу Opus 4.7 поддерживает до 128 000 токенов — это вдвое больше, чем 65 536 у Gemini 3.1 Pro. Если вам нужно генерировать длинные документы или сложный многофайловый код за один проход, потолок вывода у Opus 4.7 выше.