Anthropic은 Opus 5와 Sonnet 5를 직접 맞대놓고 비교한 벤치마크를 공개하지 않았습니다. 각 출시 글은 자기 전작과 Opus 4.8과만 비교합니다. 그래서 아래 수치들은 이야기의 일부만 전합니다. 나머지는 언제나의 Opus 대 Sonnet 선택 기준과 같습니다: 실제로 얼마나 높은 상한선이 필요하고, 그만한 비용을 지불할 의사가 있는가입니다.
Claude Opus 5란?
Opus 5는 Anthropic의 최상위 모델로, 2026년 7월 24일 출시되었으며 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25로 책정되어 있습니다. Anthropic은 이 모델이 Frontier-Bench와 GDPval-AA에서 최신(state-of-the-art) 성능을 보이며, 더 큰 Fable 5에 근접하면서도 가격은 절반이라고 설명합니다. Claude Max의 기본 모델이자 Claude Pro에서 가장 강력한 모델입니다.
가장 두드러진 특징은 자기 검증입니다. 스스로 결과를 점검하고, 데이터 피드가 없을 때 테스트 하네스를 구성하며, 잘못된 지시에 무작정 따르지 않고 반박합니다.
Claude Sonnet 5란?
Sonnet 5는 Anthropic의 중간급 모델로, 2026년 6월 30일 출시되었습니다. Anthropic은 이를 지금까지 가장 에이전트형(agentic) Sonnet으로 설명하며, 더 낮은 가격으로 Opus 4.8에 근접한 성능을 낸다고 합니다. Free와 Pro 요금제의 기본 모델이며, Max, Team, Enterprise, API에서도 사용할 수 있습니다.
요금: 2026년 8월 31일까지 입력 100만 토큰당 $2, 출력 100만 토큰당 $10, 이후 표준 가격은 $3/$15입니다.
계층 차이를 실무적으로 보면
출시 글에 명시되어 있지는 않지만, Anthropic의 전반적 라인업 구조상 당연한 내용입니다. 이 두 모델만의 특수한 얘기는 아닙니다.
Opus는 상한선 모델입니다
틀리면 대가가 큰 작업, 중간 점검 없이 길고 자율적으로 돌아가는 작업, 모델이 수없이 본 변형이 아니라 진짜로 새로운 문제일 때 선택합니다. 여러 파일에 걸친 깊은 리팩터링, 모호한 리서치 질문, 오류가 누적되기 쉬운 장시간의 에이전트 실행 — 이런 영역이 Opus의 무대입니다. 문제 되기 전에 스스로 실수를 잡아내도록 비용을 지불하는 셈입니다.
Sonnet은 일꾼입니다
상시로 돌릴 만큼 빠르고 저렴하게 설계되었습니다. 챗 어시스턴트, 대량 분류, 몇 단계마다 사람이 리뷰하는 반복 코딩, 지연 시간에 민감한 애플리케이션에 적합합니다. 판단의 상한선은 더 낮지만, 실제 업무의 상당 부분에서는 그 상한선에 닿지 않습니다. 대부분의 팀은 일상적 사용에서 Sonnet 비중이 커야 하며, 정말 필요한 작업에만 선별적으로 Opus를 호출하는 편이 좋습니다.
특히 Sonnet 5는 중간급 모델로서는 이 상한선을 평소보다 더 끌어올리려는 Anthropic의 시도입니다 — 그래서 "가장 에이전트형 Sonnet"이라는 설명과, 일부 작업에서 Opus 4.8에 근접한다는 주장으로 이어집니다. 아래 벤치마크를 읽을 때 이 맥락을 염두에 두세요: Sonnet 5는 단지 저렴하기만 한 것이 아니라, 이전 세대 Sonnet보다 Opus 급에 더 가까워졌다는 뜻입니다.
출시 수치가 실제로 말하는 것
가격
가장 명확하고 모호함이 적은 차이입니다. Sonnet 5는 $2/$10(8월 31일까지) 또는 $3/$15(표준)이고, Opus 5는 일괄 $5/$25입니다 — 기간에 따라 Sonnet 5는 Opus 5의 40–60% 비용입니다.
정렬(Alignment)
두 출시 글이 서로를 직접 언급한 유일한 부분입니다. Anthropic의 자동화 감사에 따르면, Opus 5는 "Opus 4.8, Sonnet 5, Fable 5보다 Claude의 헌법에 더 잘 부합"합니다 — 추정이 아닌 명시된 결과입니다. Opus 5는 해당 감사에서 2.3으로, 지금까지 가장 안전한 점수를 받았습니다. Sonnet 5도 전작 대비 개선(환각 감소, 아첨성 감소, 프롬프트 인젝션 하이잭에 대한 저항성 향상)을 보였지만, Opus 4.8보다 오조정(misaligned) 행동 비율이 여전히 높다고 Anthropic은 밝힙니다.
사이버보안
두 모델 모두 의도적인 사이버 훈련은 배제되었지만, 결과는 다르게 나타납니다.
Opus 5는 취약점 발견에서는 Mythos 5에 근접하지만, 이를 익스플로잇으로 전환하는 성능은 다소 뒤처집니다. Sonnet 5는 더 후방에 위치합니다. Anthropic은 Sonnet 5의 사이버 역량이 "Opus 4.8과 Mythos 5보다 현저히 낮다"고 명시했으며, Firefox 익스플로잇 개발 평가에서는 완전한 동작 익스플로잇을 한 번도 만들어내지 못했습니다(성공률 0.0%, 부분 시도에서는 Sonnet 4.6보다 약간 우세).
사용 사례가 사이버보안 인접 영역을 조금이라도 건드린다면, 이 격차는 실제이며 Opus 5 쪽에 분명한 우위가 있습니다.
코딩과 지식 작업
두 글이 사용하는 벤치마크 세트가 달라 깔끔한 점수 비교는 어렵습니다.
Opus 5는 Frontier-Bench v0.1에서 Opus 4.8의 성능을 두 배 이상 상회하고, CursorBench 3.2에서는 Fable 5와 0.5%포인트 이내로 따라붙으면서도 비용은 절반입니다. Sonnet 5는 BrowseComp과 OSWorld-Verified(고난도 설정)에서 Opus 4.8에 근접한다고 설명됩니다.
위의 계층 논리와 함께 읽으면: Sonnet 5는 Anthropic이 강조한 특정 과제들에서 가까이 붙지만, Opus 5의 우세는 더 크고 폭넓어 보입니다. 이 부분은 정량 비교라기보다 방향성 신호로 받아들이는 편이 좋겠습니다.
어떤 때 무엇을 고를까
다음과 같다면 Opus 5
작업의 중요도가 높거나, 장시간 자율적으로 실행되거나, 진정으로 새로운 문제일 때. 생명과학, 화학, 복잡한 다단계 에이전트 작업을 수행할 때. 사용 가능한 모델 중 가장 높은 정렬 수준이 필요할 때. 사이버보안 인접 영역이 범위에 포함될 때.
다음과 같다면 Sonnet 5
대량 트래픽을 처리하고 지연 시간이 중요하거나, 작업 범위가 명확해 Opus의 판단 상한선까지 필요하지 않을 때. 기본값인 Free나 Pro에서 운영할 때. 토큰당 비용이 가장 큰 제약일 때.
둘 다 아닌 경우
완화된 가드레일로 사이버보안 작업이 필요하다면요. Opus 5는 자동으로 Opus 4.8로 폴백하고, Sonnet 5는 처음부터 Opus 4.8 뒤에 위치합니다.
마무리
여기서의 핵심 판단은 언제나의 Opus 대 Sonnet 질문과 같습니다. 이 작업에 상한선이 필요한가, 아니면 규모 있게 안정적으로 끝내면 되는가? Sonnet 5는 과거 Sonnet들보다 그 상한선을 끌어올린 것이 출시의 핵심입니다. 하지만 두 모델을 함께 수치로 비교한 지점 — 정렬 감사 — 에서는 Opus 5가 우위였고, 사이버보안의 이야기도 같은 방향을 가리킵니다. 대량 처리에는 기본적으로 Sonnet 5를 쓰되, 틀릴 수 없는 작업에는 Opus 5를 선택하세요.