courses
지금까지 2026년은 에이전트형 AI의 해였습니다. 모델이 발전하면서 개인용 AI 비서부터 코딩 에이전트까지 에이전트 작업을 위한 다양한 도구가 등장했습니다. 이 분야의 주요 플레이어는 Google의 Gemini, OpenAI의 GPT 시리즈, 그리고 개발자들이 선호하는 Anthropic 모델입니다.
이 글에서는 Claude Opus 4.7과 Gemini 3.1 Pro를 벤치마크와 가격을 포함해 비교합니다. 마지막에는 어떤 기준으로 자신의 워크플로에 가장 적합한 모델을 선택할 수 있을지 제시하겠습니다.
Claude Opus 4.7이란?
우리의 Opus 4.7 기사에서 다루었듯이, Claude Opus 4.7은 Anthropic의 최신 플래그십 모델로 전작 Claude Opus 4.6의 업데이트입니다. 복잡한 에이전트형 워크플로와 다단계 추론을 위해 설계되었으며, 에이전트형 코딩, 시각적 추론, 도구 사용에서 더 뛰어난 성능을 보입니다.
Claude Opus 4.7의 주요 기능과 역량
Opus 4.7의 핵심 기능 중 하나는 작업 예산(task budgets)으로, 에이전트가 작업마다 사용할 수 있는 토큰 수에 재정적 한도를 설정할 수 있게 해줍니다. 이는 에이전트가 자율적으로 실행될 때 최적화를 유도하고 예산 내에서 유지하도록 하여 예기치 않은 비용을 방지합니다.
Claude Opus 4.7은 100만 토큰의 컨텍스트 윈도우와 128K 출력 토큰을 지원합니다. 이는 전체 컨텍스트를 유지한 채 장시간 실행되는 작업을 처리할 수 있음을 의미합니다. 대규모 코드베이스를 탐색할 때 특히 유용합니다.
또한 비전 기능이 개선되어 최대 3.75메가픽셀 이미지를 지원합니다. 그 결과 Opus 4.6보다 시각적 추론 성능이 향상되어, 고해상도 차트에서 데이터 추출과 같은 작업에 적합한 모델이 되었습니다.
Opus 4.7에는 xhigh라는 새로운 추론 강도가 도입되어 high와 max 사이에서 코딩 및 에이전트 작업에 최적의 결과를 제공합니다. 약간 더 낮은 사고 강도를 원한다면 high를 사용할 수도 있습니다. Anthropic은 또한 Claude Code에 /ultrareview를 도입하여 코드 변경에 대한 코드 리뷰를 실행하고 버그를 잡을 수 있게 했습니다.

일부에게 놀라운 점은 Adaptive Thinking이 이제 기본적으로 사고 응답을 생략한다는 것입니다. thinking.display를 summarized로 설정하면 요약된 형태의 추론을 다시 볼 수 있습니다.
벤치마크 측면에서 Opus 4.7의 점수는 다음과 같습니다.
- SWE-bench Verified 87.6%
- 더 어려운 SWE-bench Pro 변형 64.3%
- 자율 컴퓨터 사용을 측정하는 OSWorld 78%
- 다중 도구 워크플로 오케스트레이션을 측정하는 MCP Atlas 77.3%
Claude Opus 4.7이 출시되었을 당시, fArtificial Analysis Intelligence Index에서 57점을 기록하며 최상위에 올랐습니다. 또한 GDPval-AA로 측정한 실제 에이전트형 작업에서도 1,753 Elo로 선두를 차지했습니다. 그 사이에 GPT-5.5가 두 지표 모두에서 이를 앞질렀습니다.
Streamlit 벤치마크 애플리케이션을 구축해 high, xhigh, max 사고 강도 수준 전반에서 Opus 4.7의 자기 비판 메모리가 실제로 코딩 성능을 향상시키는지 테스트하는 방법을 알아보려면 우리의 Claude Opus 4.7 Practical Benchmark tutorial을 확인하세요.
Claude Opus 4.7의 장단점
Anthropic의 모델은 코딩에 가장 강력한 모델로 알려져 있으며, Opus 4.7의 벤치마크가 이를 입증합니다. 다만 Opus 계열 모델은 가격이 저렴하지 않기 때문에, 특히 장시간의 에이전트형 워크플로를 운영하는 사용자에게 작업 예산 기능이 유용한 추가 요소가 됩니다.
또한 Amazon Bedrock, Google Vertex AI, Microsoft Foundry 등 다양한 클라우드 제공업체를 통해 이용할 수 있어 기존 공급자를 통해 쉽게 통합할 수 있습니다.
Opus 4.7에는 새로운 토크나이저가 탑재되어 이전 Opus 모델과 실제 비용을 직접 비교하기가 다소 어려워졌습니다. 그러나 Artificial Analysis Intelligence에 따르면, Opus 4.7은 인덱스를 실행하는 데 Opus 4.6보다 출력 토큰을 약 35% 적게 사용했습니다.

Anthropic의 최고 공개 모델인 Claude Opus 4.7의 역량을 익히고, 차트를 원시 데이터로 변환하는 데이터 사이언스 도구를 만들어 보세요. 자세한 내용은 우리의 Claude Opus 4.7 API Tutorial을 참고하세요.
Gemini 3.1 Pro란?
Gemini 3.1 Pro는 Transformer 기반 전문가 혼합(MoE) 아키텍처를 채택한 Google DeepMind의 현재 플래그십 추론 모델입니다. Gemini 3.1 Pro 출시 당시에는 Opus 4.6을 4점 차로 앞서며 Artificial Analysis Intelligence Index에서 1위를 기록했으며, 현재는 57점으로 Opus 4.7과 동률입니다.
Gemini 3.1 Pro에 대해 더 알아보려면, Gemini 3.1 Pro로 프로덕션 수준 앱을 구축하는 방법을 다루는 우리의 Building with Gemini 3.1 Pro 기사를 확인하세요.
Gemini 3.1 Pro의 주요 기능과 역량
두 가지 수준이 있었던 Gemini 3 Pro와 달리, Gemini 3.1 Pro는 세 가지 사고 수준(low, medium, high)을 제공합니다. low는 속도와 토큰 최적화에 유리합니다. medium은 균형 잡힌 접근을 제공합니다. high는 더 많은 사고 토큰을 생성하고 응답이 가장 느리므로, 복잡한 추론이 필요한 작업에 사용해야 합니다.
Gemini 3.1 Pro도 입력에 대해 100만 토큰 컨텍스트 윈도우를 제공하지만, 출력은 약 65K 토큰으로 더 작습니다. 오디오, PDF, 텍스트, 이미지를 모두 지원하는 멀티모달 모델입니다.
벤치마크를 살펴보겠습니다. Gemini 3.1 Pro가 두각을 나타내는 영역은 다음과 같습니다.
- Gemini 3.1 Pro는 ARC-AGI-2에서 77.1%로 선두입니다.
- Gemini 3.1 Pro는 다중 도구 워크플로 조정을 측정하는 MCP Atlas에서 73.9%를 기록합니다.

Artificial Analysis Intelligence에 따르면, Gemini 3.1 Pro Preview는 Opus 4.6과 비교해 인덱스를 실행하는 데 약 5,700만 토큰을 사용해 토큰 효율이 높습니다.
Gemini 3.1 Pro는 Artificial Analysis의 Coding Index에서는 Opus 4.7을 앞서지만, Agentic Index에서는 뒤처집니다.
Gemini 3.1 Pro의 장단점
Gemini 3.1 Pro의 가격은 특히 많은 토큰이 필요한 작업에 꽤 매력적입니다. Google은 배치 가격 모델로 50% 할인을 제공하므로, 실시간 결과가 필요하지 않은 경우 이상적인 선택입니다.
반면, Gemini 3.1 Pro의 65K 출력 윈도우는 Opus 4.7(128K)의 절반 수준에 불과합니다.
Claude Opus 4.7 vs Gemini 3.1 Pro 정면 비교
각 범주를 살펴보기 전에 빠르게 정리해 보겠습니다.
|
Claude Opus 4.7 |
Gemini 3.1 Pro |
|
|
출시일 |
2026년 4월 16일 |
2026년 2월 19일 |
|
컨텍스트 윈도우 |
100만 토큰 |
100만 토큰 |
|
최대 출력 |
128K 토큰 |
65K 토큰 |
|
SWE-bench Verified |
87.6% |
80.6% |
|
SWE-bench Pro |
64.3% |
54.2% |
|
ARC-AGI-2 |
75.8% |
77.1% |
|
GPQA Diamond |
94.2% (동률) |
94.3% (동률) |
|
MCP Atlas |
77.3% |
73.9% |
|
OSWorld |
78.0% |
공개 점수 없음 |
|
비전 |
2576px / 3.75MP |
멀티모달(비디오, 오디오, PDF) |
|
입력 가격 |
$5/백만 토큰 |
$2/백만 토큰 |
|
출력 가격 |
$25/백만 토큰 |
$12/백만 토큰 |
에이전트형 및 컴퓨터 사용 성능
Opus 4.7은 에이전트 작업에 매우 강력한 모델로, 특히 에이전트가 사용할 수 있는 토큰 수를 제어할 수 있다는 점이 큽니다. 이 시스템은 Gemini 3.1 Pro에는 없으며, 토큰 사용량 제어를 위해 사고 수준을 조절해야 합니다.
Opus 4.7은 OSWorld 자율 컴퓨터 사용 벤치마크에서 78%를 기록했습니다. 이는 GPT 5.5의 78.7%와 비슷한 강력한 결과이며, Gemini 3.1 Pro는 OSWorld 점수가 공개되어 있지 않습니다. MCP Atlas에서는 Opus 4.7이 77.3%로 Gemini의 73.9%를 앞섭니다. 이러한 수치는 Opus 4.7이 프로덕션 에이전트 시스템에 이상적인 선택임을 보여줍니다.
코딩 벤치마크
이제 이용 가능한 벤치마크, 특히 실제 GitHub 이슈를 테스트하는 SWE-bench Verified 기준으로 어떤 모델이 프로그래밍에서 더 뛰어난지 확인해 보겠습니다.
Opus 4.7은 87.6%를 기록했고, Gemini 3.1 Pro는 80.6%입니다. 더 어려운 테스트인 SWE-bench Pro에서는 Opus 4.7이 64.3%, Gemini는 54.2%(GPT 5.5는 58.6%)를 기록했습니다. 숫자가 보여주듯 현재 Opus 4.7이 세계에서 가장 강력한 코딩 모델입니다.
터미널에서의 코딩 능력을 테스트하는 Terminal-Bench 2.0에서의 성능을 보겠습니다. Opus 4.7은 69.4%, Gemini Pro는 68.5%, 새 GPT 5.5는 82.7%를 기록했습니다. 이 벤치마크에서는 GPT-5.5가 명확한 승자이며, 우리의 두 모델은 사실상 비슷한 수준입니다.
추론 및 과학 과제
어떤 모델이 추론 및 과학 관련 과제에 가장 적합할까요? 알아보겠습니다. 모든 모델이 만점을 받는 GPQA Diamond 대신, 유동 지능을 해결하는지(한 번도 본 적 없는 추상적 추론 문제를 해결하는 능력)를 측정하는 ARC-AGI-2를 보겠습니다.
Gemini 3.1 Pro는 77.1%, Opus 4.7은 75.8%, GPT 5.5는 85.0%로, 여기서는 GPT 5.5가 명확한 1위이며 그 뒤를 Gemini 3.1 Pro가 잇습니다.
과학, 수학, 인문학 전반의 대학원 수준 추론을 측정하는 Humanity's Last Exam에서는, 도구 사용 여부 모두에서 Opus 4.7이 Gemini 3.1 Pro를 앞섭니다.
- 도구 미사용: Opus 4.7이 46.9%로 선두이며, 그 뒤를 Gemini 3.1 Pro(44.4%), GPT 5.5 Pro(43.1%)가 잇습니다.
- 도구 사용: GPT 5.5 Pro가 57.2%로 선두이며, Opus 4.7(54.7%), Gemini 3.1 Pro(51.4%)가 뒤따릅니다.
비용과 토큰 효율
Opus 4.7은 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25이며, Gemini 3.1 Pro는 입력 100만 개당 $2, 출력 100만 개당 $12입니다. Gemini가 훨씬 저렴하며, 50% 배치 가격 할인을 적용하면 많은 토큰이 필요한 작업에 매우 경쟁력 있는 가격이 됩니다.
또한 Opus 4.7의 새로운 토크나이저로 인해 이전 Opus 모델과 비용을 비교하기가 다소 어려워졌다는 점도 언급할 필요가 있습니다.
컨텍스트 윈도우와 출력 용량
두 모델 모두 100만 입력 토큰을 수용하므로, 단일 프롬프트로 전체 코드베이스와 긴 연구 문서를 투입할 수 있습니다.
출력 토큰은 Opus 4.7이 128K 토큰, Gemini 3.1 Pro가 65,536 토큰을 지원합니다. 더 많은 출력 토큰 생성을 요구하는 워크플로에는 Opus가 더 좋은 선택입니다.

코딩, 에이전트형 워크플로, 장문 컨텍스트 작업을 기준으로 두 모델을 비교하고 벤치마크를 분석한 우리의 Opus 4.7 vs. GPT-5.4 튜토리얼도 확인해 보세요.
Claude Opus 4.7이 Gemini 3.1 Pro보다 더 좋을까요?
여기서 질문은 이것입니다. 두 모델 중 어떤 것을 선택해야 할까요?
다음과 같은 경우 Claude Opus 4.7을 선택하세요...
- 에이전트형 코딩 파이프라인을 구축 중이며, SWE-bench Pro에서 10포인트 격차가 곧바로 프로덕션 실패 실행 감소로 이어지는 경우
- 외부 모니터링 로직을 추가하지 않고도 긴 자율 루프를 더 예측 가능하게 만들기 위해 작업 예산이 필요한 경우
- 파이프라인이 긴 출력을 생성하며, Gemini 3.1 Pro의 거의 두 배에 달하는 128K 토큰 상한이 중요한 경우
- 복잡한 에이전트형 워크플로를 위한 MCP Atlas에서 가장 강력한 다중 도구 오케스트레이션 점수가 필요한 경우
- 이미 Claude Code, Amazon Bedrock, Claude API 등 Anthropic 생태계를 사용 중이며 전환 비용이 가격 차이를 상회하는 경우
다음과 같은 경우 Gemini 3.1 Pro를 선택하세요...
- 토큰 사용량이 커서 입력 비용 2.5배 차이가 의미 있는 경우. 월 5억 토큰이면 매달 $1,500의 차이가 납니다
- 별도의 전처리 없이 단일 API 호출에서 비디오, 오디오, PDF 입력을 네이티브로 처리해야 하는 경우
- Google 인프라 위에서 빌드하며 Vertex AI를 통한 단일 벤더 관계를 원할 경우
- 추상적 시각 추론이 주요 사용 사례인 경우. ARC-AGI-2에서 Opus는 75.8%로 Gemini의 77.1%에 뒤처집니다
마무리 생각
Claude Opus 4.7과 Gemini 3.1 Pro는 모두 강력한 모델입니다. 어떤 모델을 사용할지는 예산과 달성하려는 작업에 달려 있습니다. 에이전트형 작업에서는 Opus가 우세하지만, 예산을 초과한다면 더 저렴한 토큰과 50% 배치 할인 덕분에 Gemini 3.1 Pro도 유력한 대안입니다.
Anthropic은 최고의 코딩 모델 분야에서 우위를 유지해 왔으며, 복잡한 추론과 프로그래밍이 필요한 에이전트형 작업에 적합합니다. Google은 Anthropic에 비해 훨씬 낮은 가격으로 최전선 추론 모델을 제공합니다. 양사와 OpenAI 같은 다른 대형 업체 간 경쟁은, 범용성도 갖춘 최고의 에이전트형 모델을 제공하는 데 맞춰져 있습니다.
Opus 계열 모델의 높은 비용을 고려하면, 작업 예산 기능의 도입은 반가운 소식입니다. 다른 제공업체들도 향후 릴리스에서 이 기능을 통합할 가능성이 큽니다. 이는 장시간 실행되는 에이전트 작업의 비용을 더 예측 가능하게 만드는 좋은 추가 요소가 될 것입니다.
AI 도구 활용에 대해 더 알아보려면, 우리의 최고의 무료 AI 도구 가이드를 확인해 보세요. 더 폭넓은 AI 코딩 역량을 원하신다면, 개발 워크플로에서 AI 비서를 더 신뢰할 수 있는 파트너로 만드는 역량을 다지는 AI-Assisted Coding for Developers 코스를 수강해 보세요.
마지막으로, 우리의 Developing LLM Applications with LangChain 코스에서 LLM, 프롬프트, 체인, 에이전트를 활용해 AI 기반 애플리케이션을 만드는 방법을 알아보세요.
Claude Opus 4.7 vs Gemini 3.1 Pro FAQs
Claude Opus 4.7이 Gemini 3.1 Pro보다 더 좋나요?
용도에 따라 다릅니다. Opus 4.7은 코딩 벤치마크(SWE-bench Verified 87.6% vs 80.6%), 에이전트형 도구 사용(MCP Atlas 77.3% vs 73.9%), 출력 용량(128K vs 65K 토큰)에서 앞섭니다.
Claude Opus 4.7의 작업 예산이란 무엇인가요?
작업 예산(task budget)은 하나의 에이전트 루프 전체에 대해 설정하는 토큰 한도입니다. 사고, 도구 호출, 도구 결과, 최종 출력이 모두 포함됩니다. Claude는 소비된 예산을 추적하고 그에 맞춰 작업을 조정합니다.
Gemini 3.1 Pro의 비용은 Claude Opus 4.7과 비교해 어느 정도인가요?
Gemini 3.1 Pro는 입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $12입니다. Claude Opus 4.7은 입력 100만 개당 $5, 출력 100만 개당 $25이므로, 입력 기준으로 Gemini가 2.5배 저렴합니다. 또한 Gemini는 50% 할인 배치 API를 제공하여 비동기 작업의 입력 비용을 100만 토큰당 $1로 낮출 수 있습니다.
SWE-bench 벤치마크에서 Claude Opus 4.7과 Gemini 3.1 Pro는 어떻게 비교되나요?
Gemini 3.1 Pro는 SWE-bench Verified에서 80.6%, SWE-bench Pro에서 54.2%입니다. Claude Opus 4.7은 SWE-bench Verified에서 87.6%, SWE-bench Pro에서 64.3%입니다. Pro 변형에서의 10포인트 격차가 두 모델의 코딩 작업에서 가장 의미 있는 차이입니다.
컨텍스트 윈도우가 더 긴 모델은 무엇인가요?
Claude Opus 4.7과 Gemini 3.1 Pro 모두 입력에 대해 100만 토큰 컨텍스트 윈도우를 지원합니다. 출력은 Opus 4.7이 최대 128,000 토큰으로, Gemini 3.1 Pro의 65,536 토큰의 두 배입니다. 단일 패스로 긴 문서나 복잡한 다중 파일 코드를 생성해야 한다면, 두 모델 중 Opus 4.7의 출력 한도가 더 높습니다.