Перейти к основному контенту

Claude Opus 4.7 и Gemini 3.1 Pro: какая модель лучше?

Мы сравниваем Opus 4.7 и Gemini 3.1 Pro по программированию, рассуждению, агентным бенчмаркам, ценам и лимитам контекста, чтобы помочь выбрать подходящую модель.
Обновлено 31 авг. 2026 г.  · 10 мин читать

Изучить с помощью AI

ChatGPTClaudePerplexity

Пока что 2026 год проходит под знаком агентного ИИ. Улучшения моделей привели к появлению множества инструментов для агентной работы — от персональных ИИ-ассистентов до код-агентов. Крупнейшие игроки в этой области — Gemini от Google, серия GPT от OpenAI и модели Anthropic, которые стали фаворитами разработчиков. 

В этой статье мы сравним Claude Opus 4.7 и Gemini 3.1 Pro, включая бенчмарки и цены. В конце вы получите критерий, по которому можно решить, какая модель лучше подойдёт для вашего рабочего процесса. 

Что такое Claude Opus 4.7?

Как мы рассказываем в нашем материале об Opus 4.7, Claude Opus 4.7 — флагманская модель Anthropic, обновление для её предшественницы Claude Opus 4.6. Она создана для сложных агентных пайплайнов и многошагового рассуждения. Модель лучше справляется с агентным кодингом, визуальным рассуждением и использованием инструментов.

Ключевые возможности и характеристики Claude Opus 4.7

Одна из центральных функций Opus 4.7 — бюджеты задач, позволяющие задать финансовое ограничение на число токенов, которое агент может израсходовать на задачу. Это предотвращает неожиданные расходы при автономной работе агента, вынуждая его оптимизировать действия и укладываться в бюджет.

У Claude Opus 4.7 окно контекста — 1 миллион токенов и 128 тыс. выходных токенов. Это означает, что модель может выполнять длительные задачи, сохраняя весь контекст. Особенно полезно это при работе с крупными кодовыми базами. 

Модель также улучшила возможности зрения, поддерживая изображения до 3,75 мегапикселя. В результате она лучше справляется с визуальным рассуждением, чем Opus 4.6, и идеально подходит для задач вроде извлечения данных из графиков высокого разрешения.  

Opus 4.7 также предлагает новый режим рассуждения xhigh, расположенный между high и max, чтобы обеспечивать лучшие результаты в кодинге и агентных задачах. Можно использовать и режим high — с несколько меньшими затратами на «мышление». Anthropic также представила /ultrareview в Claude Code для запуска код-ревью изменений и поиска багов. 

Ключевые возможности и характеристики Claude Opus 4.7

Возможно, вас удивит, что Adaptive Thinking теперь по умолчанию не выводит «мысли». Суммаризованную версию рассуждений можно вернуть, установив thinking.display в значение summarized.  

Что касается бенчмарков, Opus 4.7 показывает:

  • 87,6% в SWE-bench Verified
  • 64,3% в более сложном варианте SWE-bench Pro
  • 78% в OSWorld, который измеряет автономное использование компьютера
  • 77,3% в MCP Atlas для оркестрации многоинструментальных процессов

На момент выхода Claude Opus 4.7 он возглавлял Artificial Analysis Intelligence Index с оценкой 57. Также он лидировал в реальных агентных задачах по метрике GDPval-AA с результатом 1753 Elo. Со временем GPT-5.5 обошёл его по обоим показателям.

Узнайте, как создать бенчмарк-приложение на Streamlit, которое проверяет, действительно ли память самокритики Opus 4.7 улучшает качество кодинга при уровнях усилия high, xhigh и max, в нашем практическом бенчмарке Claude Opus 4.7

Плюсы и минусы Claude Opus 4.7

Модели Anthropic известны как лучшие для программирования, и бенчмарки Opus 4.7 это подтверждают. Однако семейство Opus недешёвое, поэтому бюджеты задач — полезное дополнение, особенно для тех, кто запускает длинные агентные процессы. 

Модель доступна у разных облачных провайдеров, таких как Amazon Bedrock, Google Vertex AI и Microsoft Foundry. Это упрощает интеграцию с помощью вашего текущего провайдера. 

Opus 4.7 также поставляется с новым токенизатором, из-за чего сравнивать фактическую стоимость с прошлой моделью Opus немного сложнее. Однако, по данным Artificial Analysis Intelligence, Opus 4.7 использовал примерно на 35% меньше выходных токенов, чем Opus 4.6, при запуске индекса. 

Плюсы и минусы Claude Opus 4.7

Узнайте о возможностях лучшей общедоступной модели Anthropic — Claude Opus 4.7 — и создайте инструмент для науки о данных, который преобразует график в «сырые» данные, в нашем руководстве по API Claude Opus 4.7. 

Что такое Gemini 3.1 Pro? 

Gemini 3.1 Pro — актуальная флагманская модель рассуждения от Google DeepMind на базе «смеси экспертов» в архитектуре Transformer. На момент выхода Gemini 3.1 Pro лидировала в Artificial Analysis Intelligence Index с отрывом в 4 пункта от Opus 4.6, а сейчас наравне с Opus 4.7 с оценкой 57. 

Чтобы узнать больше о Gemini 3.1 Pro, ознакомьтесь с нашим материалом «Создание приложений с Gemini 3.1 Pro», где показано, как построить готовое к продакшену приложение на базе Gemini 3.1 Pro. 

Ключевые возможности и характеристики Gemini 3.1 Pro

В отличие от Gemini 3 Pro, у которого было два уровня, у Gemini 3.1 Pro три уровня «мышления»: low, medium и high. low подходит для скорости и экономии токенов. medium обеспечивает баланс. Поскольку high генерирует больше «мыслительных» токенов и даёт самые медленные ответы, его стоит использовать для задач, требующих сложного рассуждения.  

Gemini 3.1 Pro также поддерживает окно контекста в 1 миллион входных токенов, но меньшее — примерно 65 тыс. выходных токенов. Модель мультимодальная и поддерживает аудио, PDF, текст и изображения. 

Перейдём к бенчмаркам. Вот две области, где Gemini 3.1 Pro выделяется: 

  • Gemini 3.1 Pro лидирует по ARC-AGI-2 с результатом 77,1%.
  • Gemini 3.1 Pro набирает 73,9% в MCP Atlas, который измеряет координацию многоинструментальных процессов. 

Ключевые возможности и характеристики Gemini 3.1 Pro

По данным Artificial Analysis Intelligence, Gemini 3.1 Pro Preview эффективно расходует токены, используя около 57 млн токенов для запуска их Индекса по сравнению с Opus 4.6. 

Gemini 3.1 Pro опережает Opus 4.7 в Coding Index Artificial Analysis, но уступает ему в Agentic Index. 

Плюсы и минусы Gemini 3.1 Pro

Цены на Gemini 3.1 Pro весьма привлекательны, особенно для задач с большим числом токенов. Google также предлагает скидку 50% по пакетному тарифу (batch pricing), что делает модель идеальной, когда не нужны результаты в реальном времени. 

Из минусов — окно из 65 тыс. выходных токенов у Gemini 3.1 Pro вдвое меньше, чем у Opus 4.7 (128 тыс.). 

Сравнение Claude Opus 4.7 и Gemini 3.1 Pro — очное противостояние

Краткая справка перед тем, как перейти к каждой категории.

 

Claude Opus 4.7

Gemini 3.1 Pro

Дата релиза

16 апреля 2026

19 февраля 2026

Окно контекста

1 млн токенов

1 млн токенов

Макс. вывод

128 тыс. токенов

65 тыс. токенов

SWE-bench Verified

87,6%

80,6%

SWE-bench Pro

64,3%

54,2%

ARC-AGI-2

75,8%

77,1%

GPQA Diamond

94,2% (на равных)

94,3% (на равных)

MCP Atlas

77,3%

73,9%

OSWorld

78,0%

Нет опубликованной оценки

Vision

2576px / 3,75 МП

Мультимодальность (видео, аудио, PDF)

Цена ввода

$5/млн токенов

$2/млн токенов

Цена вывода

$25/млн токенов

$12/млн токенов

Производительность в агентных задачах и при работе за компьютером 

Opus 4.7 — очень сильная модель для агентной работы, в частности потому, что позволяет контролировать, сколько токенов агент может использовать. В Gemini 3.1 Pro такой системы нет; для контроля расхода токенов нужно менять уровень «мышления». 

Opus 4.7 набирает 78% в бенчмарке OSWorld по автономному использованию компьютера. Это сильный результат на уровне GPT 5.5 (78,7%), тогда как у Gemini 3.1 Pro нет опубликованной оценки OSWorld. В MCP Atlas Opus 4.7 лидирует с 77,3% против 73,9% у Gemini. Эти цифры делают Opus 4.7 отличным выбором для продакшен-систем с агентами. 

Бенчмарки по программированию 

Посмотрим, какая модель лучше в программировании по доступным бенчмаркам, в частности SWE-bench Verified, который тестирует реальные задачи GitHub. 

Opus 4.7 достигает 87,6% против 80,6% у Gemini 3.1 Pro. В SWE-bench Pro, более сложном варианте тестов, Opus 4.7 получает 64,3% против 54,2% у Gemini (и 58,6% у GPT 5.5). Эти данные показывают, что Opus 4.7 — на данный момент самая сильная модель для кодинга в мире. 

Посмотрим, как модели справляются с Terminal-Bench 2.0, который проверяет умение писать код в терминале. Opus 4.7 — 69,4%, Gemini Pro — 68,5%, а новый GPT 5.5 — 82,7%. В этом бенчмарке явный лидер — GPT-5.5, а наши две модели тут фактически на равных. 

Рассуждение и научные задачи 

Какая модель лучше для рассуждения и научных задач? Разберёмся. Я не буду использовать бенчмарк GPQA Diamond, потому что все модели проходят его на отлично. Вместо этого посмотрим на ARC-AGI-2, который оценивает «текучий интеллект», то есть способность модели решать новые абстрактные задачи рассуждения. 

Gemini 3.1 Pro набирает 77,1% против 75,8% у Opus 4.7 и 85,0% у GPT 5.5, что делает GPT 5.5 явным лидером, а за ним следует Gemini 3.1 Pro. 

В бенчмарке Humanity's Last Exam, который измеряет уровень рассуждения выпускников по наукам, математике и гуманитарным дисциплинам, Opus 4.7 опережает Gemini 3.1 Pro как с инструментами, так и без них:

  • Без инструментов: Opus 4.7 лидирует с 46,9%, за ним — Gemini 3.1 Pro (44,4%) и GPT 5.5 Pro (43,1%).
  • С инструментами: GPT 5.5 Pro лидирует с 57,2%, далее Opus 4.7 (54,7%) и Gemini 3.1 Pro (51,4%).

Стоимость и эффективность по токенам 

Opus 4.7 стоит $5 за миллион входных токенов и $25 за миллион выходных токенов, в то время как Gemini 3.1 Pro — $2 за миллион входных и $12 за миллион выходных. Gemini значительно дешевле, а с 50%-ной скидкой по пакетной тарификации модель очень выгодна для задач с большими объёмами токенов. 

Также важно отметить, что новый токенизатор в Opus 4.7 немного затрудняет сравнение стоимости с предыдущей моделью Opus. 

Окно контекста и объём вывода 

Обе модели принимают до 1 миллиона входных токенов, что позволяет им «съедать» целые кодовые базы и длинные исследовательские документы в одном запросе. 

По выходу Opus 4.7 поддерживает 128 тыс. токенов, а Gemini 3.1 Pro — 65 536. Это делает Opus лучшим выбором для процессов, где требуется генерировать больше выходных токенов. 

Сравнение Claude Opus 4.7 и Gemini 3.1 Pro — очное противостояние

Узнайте, как Opus 4.7 и GPT 5.4 соотносятся, в нашем руководстве «Opus 4.7 vs. GPT-5.4», где мы сравниваем их для кодинга, агентных процессов и задач с длинным контекстом и анализируем бенчмарки.  

Claude Opus 4.7 лучше, чем Gemini 3.1 Pro?

Это подводит нас к вопросу: какую из двух моделей выбрать?

Выберите Claude Opus 4.7, если... 

  • Вы строите агентные пайплайны для кодинга, где разница в 10 пунктов в SWE-bench Pro напрямую означает меньше неудачных запусков в продакшене.
  • Вам нужны бюджеты задач, чтобы сделать длинные автономные циклы более предсказуемыми без добавления внешней логики мониторинга.
  • Ваш пайплайн генерирует длинные ответы, и потолок в 128 тыс. токенов имеет значение — это почти вдвое больше, чем поддерживает Gemini 3.1 Pro.
  • Вам важен самый высокий показатель мультиинструментальной оркестрации в MCP Atlas для сложных агентных процессов.
  • Вы уже находитесь в экосистеме Anthropic через Claude Code, Amazon Bedrock или Claude API, и стоимость переключения перевешивает разницу в цене.

Выберите Gemini 3.1 Pro, если... 

  • Ваши объёмы токенов делают разницу в цене ввода 2,5 раза существенной: при 500 млн токенов в месяц это $1500 экономии ежемесячно.
  • Вам нужны нативные видео-, аудио- или PDF-входы в одном API-вызове без отдельного шага предобработки.
  • Вы строите решения на инфраструктуре Google и хотите работать с одним вендором через Vertex AI.
  • Абстрактное визуальное рассуждение — ваш основной сценарий. Opus отстаёт в ARC-AGI-2 с 75,8% против 77,1% у Gemini.

Заключение

И Claude Opus 4.7, и Gemini 3.1 Pro — сильные модели. Выбор зависит от вашего бюджета и решаемых задач. Opus выигрывает в агентных сценариях, но если он не укладывается в бюджет, Gemini 3.1 Pro — тоже сильный кандидат, особенно с более дешёвыми токенами и скидкой 50% по пакетной тарификации. 

Anthropic удерживает лидерство среди лучших моделей для кодинга, что делает их особенно подходящими для агентных задач, требующих сложного рассуждения и программирования. Google предлагает передовые модели рассуждения по значительно более низкой цене по сравнению с Anthropic. Борьба между обеими компаниями и другими крупными игроками, такими как OpenAI, идёт за то, чтобы предложить лучший агентный ИИ, который одновременно будет хорош и как универсальная модель.

С учётом высокой стоимости семейства Opus приятно видеть появление бюджетов задач. Не удивимся, если другие провайдеры внедрят это в будущих релизах. Это хорошее дополнение, которое сделает стоимость запуска долгих агентных задач более предсказуемой. 

Чтобы узнать больше о работе с ИИ-инструментами, рекомендуем посмотреть наш гид по лучшим бесплатным ИИ-инструментам. Для более широких навыков по ИИ-кодингу попробуйте курс AI-Assisted Coding for Developers, чтобы развить навыки, делающие ИИ-ассистентов более надёжными партнёрами в вашем процессе разработки. 

Наконец, вы также можете узнать, как создавать приложения на базе ИИ с использованием LLM, подсказок, чейнов и агентов в LangChain на нашем курсе Developing LLM Applications with LangChain.

Claude Opus 4.7 и Gemini 3.1 Pro: ответы на частые вопросы

Claude Opus 4.7 лучше, чем Gemini 3.1 Pro?

Зависит от сценария использования. Opus 4.7 лидирует в бенчмарках по кодингу (87,6% против 80,6% в SWE-bench Verified), в использовании агентных инструментов (MCP Atlas 77,3% против 73,9%) и по объёму вывода (128 тыс. против 65 тыс. токенов).

Что такое бюджет задачи в Claude Opus 4.7?

Бюджет задачи — это лимит токенов, который вы задаёте для всего агентного цикла, включая «мышление», вызовы инструментов, результаты инструментов и финальный ответ. Claude отслеживает, какая часть бюджета уже израсходована, и корректирует работу соответствующим образом.

Сколько стоит Gemini 3.1 Pro по сравнению с Claude Opus 4.7?

Gemini 3.1 Pro стоит $2 за миллион входных токенов и $12 за миллион выходных токенов. Claude Opus 4.7 стоит $5 за миллион входных и $25 за миллион выходных токенов, поэтому Gemini в 2,5 раза дешевле по входу. Gemini также предлагает пакетный API со скидкой 50%, снижая стоимость входа до $1 за миллион токенов для асинхронных задач.

Как Claude Opus 4.7 и Gemini 3.1 Pro сравниваются в бенчмарке SWE-bench?

Gemini 3.1 Pro набирает 80,6% в SWE-bench Verified и 54,2% в SWE-bench Pro. Claude Opus 4.7 набирает 87,6% в SWE-bench Verified и 64,3% в SWE-bench Pro. Разница в 10 пунктов в варианте Pro — наиболее существенное отличие между моделями в задачах кодинга.

У какой модели самое длинное окно контекста?

И Claude Opus 4.7, и Gemini 3.1 Pro поддерживают окно контекста в 1 миллион токенов для входа. По выходу Opus 4.7 поддерживает до 128 000 токенов — это вдвое больше, чем 65 536 у Gemini 3.1 Pro. Если вам нужно генерировать длинные документы или сложный многофайловый код за один проход, потолок вывода у Opus 4.7 выше.

Темы
Искусственный интеллект
Большие языковые модели

Лучшие курсы по ИИ

Course

Разработка с помощью ИИ: курс для разработчиков

1 ч 30 мин
9.6K
Ускорьте кодинг с ИИ — научите своего помощника писать, тестировать и документировать код эффективно.
ПодробнееRight Arrow
Начать Курс
Смотрите большеRight Arrow