Anthropic는 Opus 5와 Sonnet 5를 직접 맞대어 비교한 벤치마크를 공개하지 않았습니다. 각 출시 글은 해당 모델을 전작 및 Opus 4.8과 비교합니다. 따라서 아래 수치는 이야기의 일부만 보여 줍니다. 나머지는 언제나 그랬듯 Opus와 Sonnet을 고를 때의 판단 기준과 같습니다. 필요한 성능 상한은 어느 정도이고, 그 대가로 얼마를 지불할 의향이 있는지입니다.
\nClaude Opus 5란?
\nOpus 5는 Anthropic의 최상위 모델로, 2026년 7월 24일에 출시되었으며 입력 100만 토큰당 $5, 출력 100만 토큰당 $25로 책정되었습니다. Anthropic는 이 모델이 Frontier-Bench와 GDPval-AA에서 최첨단이며, 더 큰 Fable 5에 근접하면서도 가격은 절반이라고 설명합니다. Claude Max의 기본 모델이며, Claude Pro에서 가장 강력한 모델입니다.
\n가장 두드러진 특징은 자가 검증입니다. 자체 결과를 점검하고, 데이터 피드가 없을 때 테스트 하니스(harness)를 구축하며, 잘못된 지시에 무작정 따르지 않고 반박합니다.
\nClaude Sonnet 5란?
\nSonnet 5는 Anthropic의 미드티어 모델로, 2026년 6월 30일 출시되었습니다. Anthropic는 이를 지금까지의 Sonnet 중 가장 에이전트적(agentic)이라고 설명하며, 더 저렴한 가격으로 Opus 4.8에 가까운 성능을 보인다고 밝힙니다. Free와 Pro 요금제의 기본 모델이며, Max, Team, Enterprise, API에서도 사용 가능합니다.
\n가격: 2026년 8월 31일까지 입력 100만 토큰당 $2, 출력 100만 토큰당 $10, 이후 표준 가격은 $3/$15입니다.
\n티어 차이를 실무적으로 보면
\n출시 글에서 직접적으로 설명하지 않은 부분입니다. 특정 모델 조합에 국한된 이야기가 아니라, Anthropic의 모델 라인업이 일반적으로 작동하는 방식이기 때문입니다.
\nOpus는 상한(cap) 모델입니다
\n오류의 비용이 클 때, 중간 점검 없이 길고 자율적으로 돌아가는 작업일 때, 또는 문제가 모델이 수없이 봤던 변주가 아니라 진정으로 새로운 유형일 때 Opus를 선택합니다. 다중 파일의 대규모 리팩터링, 모호한 연구 과제, 오류가 누적되기 쉬운 장시간 에이전트 실행 — 이런 영역이 Opus의 무대입니다. 비용을 지불하는 이유는, 문제가 되기 전에 모델이 스스로 실수를 잡아내도록 하기 위해서입니다.
\nSonnet은 일꾼(workhorse)입니다
\n항상 돌아가도 충분히 빠르고 저렴하도록 설계되었습니다. 예: 채팅 어시스턴트, 대량 분류 작업, 몇 단계마다 검토에 직접 참여하는 반복적 코딩, 지연 시간에 민감한 애플리케이션. 판단의 상한은 낮지만, 실제 업무의 큰 부분에서는 그 한계에 닿지 않습니다. 대부분의 팀은 일상 사용량이 Sonnet에 치우치고, 정말 필요한 작업에 한해 선택적으로 Opus를 호출하는 편이 좋습니다.
\n특히 Sonnet 5는 미드티어 모델 치고는 그 상한을 평소보다 더 끌어올리려는 Anthropic의 시도입니다 — 그래서 \"지금까지 중 가장 에이전트적인 Sonnet\"이라는 설명과 일부 작업에서 Opus 4.8에 근접한다는 주장이 나옵니다. 아래 벤치마크를 읽을 때 이 맥락을 염두에 두세요. Sonnet 5는 단지 저렴한 것이 아니라, 이전 Sonnet들보다 Opus 티어에 더 가까워졌습니다.
\n출시 수치가 실제로 보여 주는 것
\n가격
\n가장 명확하고 해석의 여지가 적은 차이입니다. Sonnet 5는 $2/$10(8월 31일까지) 또는 $3/$15(표준)로, Opus 5의 고정 $5/$25 대비 — 시점에 따라 Opus 5 비용의 40–60% 수준입니다.
\n정렬(Alignment)
\n두 출시 글이 서로를 직접 언급한 유일한 지점입니다. Anthropic의 자동화 감사 결과, Opus 5가 \"Claude의 헌법에 Opus 4.8, Sonnet 5, Fable 5보다 더 잘 부합한다\"고 밝혔습니다 — 추정이 아닌 명시된 결과입니다. Opus 5는 해당 감사에서 2.3점을 받아 지금까지 가장 안전한 점수를 기록했습니다. Sonnet 5도 전작 대비 개선되었으며(환각 감소, 아부 성향 감소, 프롬프트 인젝션 하이재킹에 대한 저항성 향상), Anthropic는 여전히 Opus 4.8보다 오정렬 행동률이 높다고 덧붙입니다.
\n사이버보안
\n두 모델 모두 의도적인 사이버 트레이닝은 피했지만, 결과는 다르게 나타났습니다.
\nOpus 5는 취약점 탐지에서 Mythos 5에 근접했지만, 이를 익스플로잇으로 전환하는 부분에서는 다소 뒤처집니다. Sonnet 5는 더 뒤에 위치합니다. Anthropic는 Sonnet 5가 \"Opus 4.8과 Mythos 5보다 사이버 역량이 상당히 떨어진다\"고 명시하며, Firefox 익스플로잇 개발 평가에서 완전한 동작 익스플로잇을 한 번도 생성하지 못했다고 밝혔습니다(성공률 0.0%, 부분 시도에서 Sonnet 4.6 대비 근소 우위).
\n사용 사례가 사이버 영역과 맞닿아 있다면, 이 격차는 분명하며 Opus 5에 유리합니다.
\n코딩과 지식 작업
\n두 출시 글이 서로 다른 벤치마크 세트를 사용해, 깔끔한 점수 비교는 어렵습니다.
\nOpus 5는 Frontier-Bench v0.1에서 Opus 4.8의 점수를 두 배 이상 끌어올리고, CursorBench 3.2에서는 Fable 5와 0.5% 이내에 도달하며 비용은 절반입니다. Sonnet 5는 높은 노력 설정에서 BrowseComp와 OSWorld-Verified에서 Opus 4.8에 접근한다고 설명됩니다.
\n위의 티어 논리와 함께 읽으면, Sonnet 5는 Anthropic가 강조한 특정 작업에서 가까워지지만, Opus 5의 우위는 더 크고 폭넓어 보입니다. 이 부분은 정량 비교라기보다 방향성 신호로 받아들이세요.
\n언제를 어떻게 고를까
\n다음이라면 Opus 5
\n작업의 위험도가 높거나, 장시간 자율적으로 진행되거나, 진정으로 새로운 유형인 경우. 생명과학, 화학, 복잡한 다단계 에이전트 작업을 수행하는 경우. 사용 가능한 모델 중 가장 높은 정렬을 원할 때. 사이버보안과 맞닿은 범위가 있을 때.
\n다음이라면 Sonnet 5
\n대량으로 실행하고, 지연 시간이 중요하거나, 작업 범위가 명확해 Opus의 판단 상한이 필요하지 않은 경우. Free 또는 Pro에서 이미 기본값인 경우. 토큰당 비용이 가장 큰 제약인 경우.
\n둘 다 아니라면
\n완화된 가드레일로 사이버보안 작업이 필요한 경우. Opus 5는 자동으로 Opus 4.8로 폴백하고, Sonnet 5는 아예 Opus 4.8 뒤에 위치합니다.
\n마무리
\n결정적인 요인은, 대체로 언제나 Opus 대 Sonnet을 고를 때와 같습니다. 이 작업에 상한급 성능이 필요한가, 아니면 규모 있게 안정적으로 끝내면 되는가? Sonnet 5는 과거 Sonnet들보다 그 상한을 더 끌어올렸다는 점이 출시의 핵심 뉴스입니다. 하지만 두 모델을 함께 수치로 다룬 지점(정렬 감사)에서는 Opus 5가 우위였고, 사이버보안 관련 내용도 같은 방향을 가리킵니다. 대량 처리에는 Sonnet 5를 기본으로, 오답을 감당할 수 없는 작업에는 Opus 5를 선택하세요.