2025년 2월, Claude 3.7 Sonnet이 SWE-bench Verified에서 62.3%를 기록했고, 커스텀 스캐폴드를 사용하면 70.3%였습니다. 같은 시기 최고의 오픈 웨이트 모델이던 DeepSeek-R1은 논문에서 49.2%를 보고했습니다.
스캐폴딩을 얼마나 관대하게 적용하느냐에 따라 13~21포인트의 격차가 있었습니다.
2026년 9월 기준, 독립 기관인 Vals AI의 SWE-bench Verified 보드는 Claude Opus 5를 97.0%, 오픈 웨이트인 DeepSeek V4 Pro 0813을 96.4%로 기록했고, 벤치마크가 포화되어 아카이브 처리했습니다.
프런티어는 SWE-bench Pro와 Terminal-Bench 4.0 같은 더 어려운 에이전트형 평가로 이동했고, 오픈 웨이트는 기존 벤치마크를 따라잡았습니다. 그 결과, “최고의 코딩 LLM” 질문은 “무엇을, 어떤 하드웨어에서, 얼마에”로 바뀌었습니다.
오늘 실제로 쓸 법한 9개 모델에 대해 그 질문에 답하겠습니다. 요약하면 대부분의 팀은 Claude Opus 5.5로 시작하는 것이 좋습니다.
순위에 앞서 한 가지: 이 글은 도구가 아니라 모델 자체에 관한 글입니다. Cursor, Copilot, Windsurf 비교가 필요하다면, 2026년 최고의 AI 코딩 어시스턴트 라운드업을 참고하세요.
한눈에 보기: 2026년 9월 최고의 코딩 LLM
Claude Opus 5.5는 대부분의 벤치마크에서 가장 강력한 코딩 모델이자, 대부분의 개발자가 기본값으로 선택해야 할 모델이 되었습니다. Claude Fable 5.1은 가장 긴 호라이즌 작업에 적합한 상향 모델이고, Qwen3.8-27B는 단일 GPU에서 실행할 오픈 웨이트 모델의 최선입니다. 목적별 추천은 다음과 같습니다.
- 종합 베스트(에이전트형 코딩): Claude Opus 5.5(Anthropic), SWE-bench Pro 89.9%, Terminal-Bench 4.0 66.4%, 100만 토큰당 입력 $4, 출력 $20.
- 가장 긴 호라이즌 작업용: Claude Fable 5.1(Anthropic), SWE-bench Pro 81.2%, Artificial Analysis의 Terminal-Bench 2.1 최고점(91.4%), 100만 토큰당 입력 $10, 출력 $50.
- OpenAI 최고의 코딩 모델: GPT-6 Astra(OpenAI), tbench.ai Terminal-Bench 4.0 에이전트 리더보드 58.2% 1위, Artificial Analysis 실행에서 Opus 5.5와 59.6%로 동률.
- 프런티어 연구소 가성비 최고: Gemini 3.8 Flash(Google), Terminal-Bench 2.1 89.4%, 2026년 12월 31일까지 100만 토큰당 입력 $0.75, 출력 $3.75.
- API로 쓰는 오픈 웨이트 최고: DeepSeek V4.1 Flash, MIT 라이선스, Terminal-Bench 2.1 90.6%, 비혼잡 시간 출력 100만 토큰당 $0.60.
- 집에서는 돌릴 수 없는 오픈 웨이트 최고: Kimi K3(Moonshot AI), 2.8조 파라미터, Terminal-Bench 2.1 88.3%.
- 24 GB GPU에서의 로컬 최고: Qwen3.8-27B(Alibaba), Apache 2.0, Terminal-Bench 2.1 73.0%, UD-Q4_K_M에서 16.5 GB.
- 128 GB 워크스테이션용 로컬 최고: Laguna S 2.1(Poolside), 118B 파라미터 중 활성 8B, 컨텍스트 100만.
- 구형 하드웨어용 빠른 로컬 모델 최고: Qwen3-Coder-Next, 총 80B 중 활성 3B, SWE-bench Verified 70.6%.
위 점수는 별도 표기가 없으면 모두 벤더 발표 수치입니다. 이하에서는 이 추천에 이른 과정과 각 모델의 한계를 설명합니다.
왜 이 목록은 코딩 어시스턴트가 아니라 모델에 관한가요?
코딩 LLM은 프롬프트를 읽고 토큰을 생성하는 모델이고, 코딩 어시스턴트는 파일을 제공하고 명령을 실행하며 diff를 보여주는 하네스입니다.
Claude Code, Codex, Cursor, GitHub Copilot, Windsurf는 하네스입니다. Claude Opus 5.5, GPT-6 Astra, Qwen3.8-27B는 모델이며, 하네스는 대부분의 사람이 예상하는 것보다 점수에 더 큰 영향을 미칩니다.
Anthropic의 Claude Opus 4.8 출시 글 각주가 이를 구체화합니다.
모든 모델의 Terminal-Bench 2.1 점수를 공개 Terminus-2 하네스에서 보고한 뒤, GPT-5.5의 점수가 OpenAI의 Codex CLI 내부에서는 83.4%로 상승한다고 밝힙니다. 동일한 웨이트, 다른 배관, 다른 결과입니다.
그래서 아래 순위에는 가능한 곳에 하네스를 함께 표기했습니다. 모델의 내부 작동 방식이 낯설다면, 대규모 언어 모델(LLM)이란 무엇인가에 대한 15분 가이드를 먼저 읽으면 이 글을 따라가기 쉬워집니다.
코딩 LLM에 실제로 중요한 벤치마크는 무엇인가요?
2026년 코딩 LLM에 중요한 벤치마크는 SWE-bench Pro, Terminal-Bench(2.1과 4.0), 그리고 아직 보고하는 오픈 웨이트 모델에 한해 LiveCodeBench v6입니다. SWE-bench Verified는 2년간 표준이었지만 이제 상위권 모델을 가르기에는 포화되었습니다.
순위를 매기기 전에, 모델 항목의 각 숫자가 의미하는 바를 설명합니다.
SWE-bench Verified는 포화됨
SWE-bench Verified는 인기 파이썬 저장소의 500개 인력 검증 GitHub 이슈로 구성됩니다. 모델은 저장소와 이슈 텍스트를 받고, 숨긴 유닛 테스트를 통과하는 패치를 만들어야 합니다.
OpenAI는 원본 SWE-bench에 명세가 불충분한 이슈나 깨진 테스트가 있어 2024년에 Verified 하위집합을 도입했습니다. 여전히 가장 자주 인용되는 코딩 수치인데, 그 점이 문제이기도 합니다.
Vals AI 리더보드는 모든 모델을 동일한 최소 bash 전용 에이전트로 실행해 2026년 9월 1일 업데이트에서 Claude Opus 5를 97.0%, DeepSeek V4 Pro 0813을 96.4%, GPT-5.6 Sol을 96.2%로 기록한 뒤 벤치마크를 아카이브 처리했습니다.
3개 연구소 모델이 서로 1포인트 이내, 천장과 4포인트 이내에 모이면, 그 지표는 변별력을 잃은 것입니다. 여전히 오래되거나 작은 모델에 대해서는 카드에 적힌 수치이므로 인용하지만, 순위 기준으로는 쓰지 않습니다.
SWE-bench Pro가 더 어려운 대체재
Scale AI가 관리하는 SWE-bench Pro는 41개 프로 리포지토리의 1,865개 작업으로 구성되며, 731개 공개 분할과 보류된 비공개 셋이 있습니다. 2026년 9월 22일, Scale은 SWE-Bench Pro V2를 발표해, 유효하지 않다고 판정한 89개를 제외하고 공개 셋을 642개로 줄였습니다. 점수가 어느 버전 기준인지 확인하세요.
평균 수정은 4.1개 파일에서 107.4줄을 건드리며, 리포지토리는 파이썬만이 아니라 다수 언어로 구성됩니다. SWE-bench Pro 논문이 2025년 9월에 나왔을 당시 최고 모델은 약 23%였습니다.
1년 뒤 Anthropic의 Fable 5.1 시스템 카드는 Fable 5.1이 81.2%, Opus 5가 79.2%를, OpenAI의 GPT-5.6 출시 표는 GPT-5.6 Sol이 64.6%를 보고합니다. Fable 카드 3주 후 Opus 5.5 시스템 카드가 최고점을 89.9%로 끌어올렸습니다.
이 수치는 벤더 런이며, Anthropic의 경우 최대 노력으로 5회 평균입니다. Scale의 공개 리더보드는 벤더 수치보다 수개월 늦게 따라오므로, 벤더 수치를 상한, 리더보드를 하한으로 봅니다.
Terminal-Bench 2.1과 4.0
Terminal-Bench는 컨테이너 내부의 라이브 셸을 모델에 제공하고, “이 모델을 학습시키세요”, “이 빌드를 고치세요”, “손상된 아카이브를 복구하세요” 같은 작업을 부여한 뒤 산출물을 채점합니다.
2.1 릴리스는 소프트웨어 엔지니어링, 시스템 관리, 데이터 처리, 보안을 아우르는 선별 89개 작업이며, Artificial Analysis가 Terminus 2 하네스로 3회 평균 pass@1로 점수를 매깁니다. 코딩 에이전트를 구축·사용하는 누구에게나 가장 비중 있게 보는 단일 지표입니다.
Stanford, Harbor, Laude Institute가 tbench.ai에서 호스팅하는 Terminal-Bench 4.0은 새 프런티어 셋입니다.
Anthropic의 Opus 5.5 시스템 카드는 이를 계산생물학, 물리 시뮬레이션, CAD, 형식적 증명, GPU 성능 작업 쪽으로 기운 66개 작업으로 설명하며, 타임아웃이 길어 하네스 영향이 덜하다고 합니다.
tbench.ai 에이전트 리더보드에서는 GPT-6 Astra가 58.2%로 여전히 1위이고 Claude Fable 5.1이 57.9%입니다. 다만 Claude Opus 5.5는 거기에 에이전트 항목이 아직 없습니다. 모델 레벨 실행에서 Artificial Analysis는 Opus 5.5와 Astra를 59.6%로 동률 처리했고, Vals AI는 Opus 5.5를 61.6%로 1위에 두었습니다. 다만 Vals는 안전장치가 대체 모델로 넘긴 작업을 실패로 간주하면 그 수치가 53.5%로 떨어진다고 명시합니다. 이 영역이 프런티어와 추격자의 분기점입니다.
LiveCodeBench v6는 암기 여부를 잡아낸다
LiveCodeBench는 Jain 외 2024년 논문에서 소개되었고, LeetCode, AtCoder, Codeforces의 문제를 지속적으로 수집해 타임스탬프를 남겨, 모델의 학습 컷오프 이후에 공개된 문제만으로 평가할 수 있게 합니다.
현재 공개 리더보드의 윈도는 버전 6이며 여기에서 볼 수 있습니다. 이는 저장소 규모의 엔지니어링보다는 알고리즘적 추론을 측정하므로, 면접 스타일과 자료구조 작업에 유용하게 남아 있습니다.
프런티어 연구소들은 2026년에 대체로 보고를 중단해, 보유 수치는 오픈 웨이트 모델에서 나옵니다. 4월 DeepSeek V4 Pro 프리뷰 93.5%, Qwen3.8-27B 90.3%, Kimi K2.6 89.6%입니다. Gemini 3.1 Pro는 관련 지표로 LiveCodeBench Pro Elo 2,887을 보고합니다.
벤더 벤치마크 표를 읽는 법
벤더의 벤치마크 표는 최상의 사례입니다. 그들의 하네스, 노력 설정, 시행 횟수이기 때문입니다. 3포인트 미만의 격차는 Artificial Analysis, Vals AI, tbench.ai 리더보드 같은 독립 재현이 있어야 신뢰합니다.
LLM 벤치마크와 비교 방법 안내서는 주요 리더보드를 정리하고, MMLU가 측정하는 것에 관한 글은 지식 벤치마크가 모델의 불안정 테스트 수정 능력을 거의 말해주지 않는다는 점을 상기시켜줍니다.
자체 평가 하네스를 구축하려면, LLM 평가 지표와 방법론 가이드를 주니어 동료에게 가장 먼저 권합니다.
이제 벤치마크를 정의했으니, 클라우드 프런티어부터 9개 모델의 성적을 살펴봅니다.
최고의 클라우드 프런티어 코딩 모델은?
2026년 9월 최고의 클라우드 프런티어 코딩 모델은 Claude Opus 5.5, Claude Fable 5.1, GPT-6 Astra, Gemini 3.8 Flash이며, 모두 대략 100만 토큰 컨텍스트 윈도를 제공합니다.
차이는 가격, 노력 설정, 각 연구소가 최적화한 벤치마크입니다.
어느 모델이든 감당 가능한 팀에 추천하는 순서로 나열합니다.
1. Claude Opus 5.5 (Anthropic)
Claude Opus 5.5는 2026년 9월 22일 출시된 Anthropic의 새로운 Opus 등급 플래그십으로, 지금은 거의 모든 이에게 추천할 코딩 모델입니다. Opus 5 출시 두 달 뒤 이렇게 쓸 줄은 몰랐습니다. Anthropic의 출시 글은 대부분의 작업에서 Fable 5.1 수준의 성능을 내면서 Opus 5보다 40% 저렴하다고 말하고, 모델 개요에서도 개발자에게 Opus 5.5로 시작하고 긴 호라이즌 또는 Opus 5.5가 부족한 평가에서 Fable 5.1을 쓰라고 권합니다.
Opus 5.5 시스템 카드는 SWE-bench Pro 89.9%, DeepSWE v1.1 74.2%, Terminal-Bench 4.0 66.4%(xhigh 노력)로, Anthropic이 공개한 모든 코딩 항목에서 Fable 5.1보다 앞섭니다. 독립 수치는 더 근접합니다. Artificial Analysis는 Terminal-Bench 4.0에서 GPT-6 Astra와 59.6% 동률, Vals AI는 Terminal-Bench 4.0 61.6%, Terminal-Bench 2.1 87.6%로 1위에 두었습니다. 두 Vals 수치는 안전장치 대체를 포함하며, 이를 실패로 간주하면 각각 53.5%와 79.8%로 내려갑니다.
주요 특징:
- 입력 100만 토큰당 $4, 출력 $20로 Opus 5 대비 20% 인하, 캐시 읽기 비용은 60% 내려가 100만 당 $0.20
- 컨텍스트 100만 토큰, 출력 128K, 끌 수 없는 적응형 사고, 기본 노력은 high가 아닌 medium
- CursorBench 4.0에서 최대 노력 57.8%로 Cursor 리더보드 1위; medium에서도 52.5%로 Fable 5.1 최대 노력보다 높음
- Claude API의
claude-opus-5-5로 제공, Amazon Bedrock, Google Cloud, Microsoft Foundry에서도 이용 가능
적합한 용도: 일상 코딩, 코드베이스 전반 마이그레이션, 코드 리뷰. 더 낮은 가격으로 Opus 5를 대체하며, Claude Code는 이제 Opus 기본 모델로 채택했습니다. Claude Opus 5.5 가이드와 GPT-6 Sol vs Claude Opus 5.5 비교에서 자세히 다룹니다.
트레이드오프: 40% 절감은 기본 노력에서 적용됩니다. 최대 노력에서는 Artificial Analysis가 Opus 5보다 훨씬 많은 토큰을 쓴다고 밝혔고, 그 결과 Intelligence Index 작업당 비용이 $5.98로 Opus 5의 $5.86과 거의 같아졌습니다. 또한 Fable 스타일의 안전장치를 탑재해 대부분의 보안 관련 작업을 Opus 4.8로 라우팅하며, 마이그레이션 시 주의가 필요합니다. 사고 비활성화나 강제 도구 사용 요청은 이제 오류를 반환합니다.
2. Claude Fable 5.1 (Anthropic)
Claude Fable 5.1은 2026년 9월 1일 출시된 Anthropic의 Mythos급 모델의 공개 버전으로, Opus 5.5가 한계에 부딪힐 때 상향하는 모델입니다. Anthropic의 런칭 페이지에 따르면 Fable 5.1과 Claude Mythos 5.1은 안전장치만 다른 동일 모델입니다.
Fable 5.1 시스템 카드는 SWE-bench Pro 81.2%, Terminal-Bench 4.0 55.8%를 보고합니다. Artificial Analysis는 최대 노력에서 Terminal-Bench 2.1 91.4%를 독립 측정했으며, 여전히 그 보드 최고점입니다.
주요 특징:
- 컨텍스트 100만 토큰, 출력 128K 토큰
- 적응형 사고는 항상 활성
- 5.1에서 프롬프트 캐시 읽기가 100만 당 $0.25로 75% 인하되어, Anthropic은 에이전트형 워크로드 비용을 최대 45% 절감한다고 추정
- 강력한 다파일 계획, 더 넓은 사고 범위, 향상된 도구 사용
적합한 용도: 프로덕션 에이전트 파이프라인, 수일 규모 리팩터링, 오답 비용이 토큰 비용보다 큰 작업에서, Opus 5.5가 부족하다고 자체 평가가 보여줄 때. Claude Fable 5.1 가이드와 Claude Fable 5 개요를 참고하세요.
트레이드오프: 입력 100만 당 $10, 출력 100만 당 $50로 Opus 5.5의 2.5배입니다. 또한 Anthropic 자체 표에서 Fable 5.1은 SWE-bench Pro, Terminal-Bench 4.0, CursorBench 4.0 모두에서 Opus 5.5에 뒤집니다. 실제 격차가 표보다 좁다고 Anthropic은 말하지만, 이제는 그 주장을 입증해야 합니다. 구버전 CursorBench 3.2.0에서는 Fable 5.1이 medium 노력에서 68.0%를 기록했고, 작업당 $3.53이 들었습니다.
3. GPT-6 Astra (OpenAI)
GPT-6 Astra는 2026년 9월 3일 출시된 OpenAI의 프런티어 모델로, Codex 하네스 최대 노력에서 tbench.ai Terminal-Bench 4.0 에이전트 리더보드 58.2%로 여전히 1위에 있습니다. 다만 Opus 5.5는 아직 그 보드에 에이전트 항목이 없습니다.
모델 페이지는 1,050,000 토큰 컨텍스트, 128,000 출력 토큰, 2026년 4월 30일 지식 컷오프, none부터 max까지 노력 레벨을 기재합니다. 가격은 입력 100만 당 $10(캐시된 입력 $1), 출력 100만 당 $50입니다.
OpenAI의 런칭 자료는 교차 연구실 벤치마크보다는 자체 평가와 시스템 카드에 무게를 둡니다. 그 평가가 강력하긴 하지만, Astra가 Opus 5.5나 Fable 5.1을 명확히 앞선다고 보긴 어렵습니다. 자세한 수치는 GPT-6 Astra 개요에서 다룹니다.
주요 특징:
- Responses API가
hosted_shell,apply_patch,computer_use,tool_search를 노출하며, Codex 자체가 사용하는 도구 세트입니다. - 캐시된 입력이 100만 당 $1로 기본의 10분의 1이어서, 동일 리포지토리를 반복 읽는 에이전트 루프에 중요합니다.
- Astra는 OpenAI Preparedness Framework의 최고 사이버보안 등급에 도달한 첫 모델로, 일부 보안 인접 프롬프트는 제한됩니다.
적합한 용도: 이미 Codex, GitHub Copilot, Microsoft 스택을 쓰는 팀, 과학·공학 비중이 큰 작업, 서드파티 도구 지원이 더 필요한 경우. 비용을 낮추고 대부분의 역량을 원한다면, GPT-6 Sol이 9월 22일 입력 $2, 출력 $10로 출시되어 GPT-5.6 Sol을 잇습니다. GPT-6 Terra가 없어 Terra의 가격대를 메웁니다. OpenAI의 표에서는 DeepSWE 1.1 68.8%, FrontierCode 49.3%지만, 최대 노력의 GPT-5.6 Sol이 DeepSWE에서는 더 높습니다.
트레이드오프: Fable급 가격입니다. Opus 5.5는 이제 Terminal-Bench 4.0에서 Astra와 동률이면서, Anthropic 기준 작업당 비용이 약 40% 저렴합니다. Artificial Analysis도 둘을 동률로 평가했습니다. Astra의 가장 뚜렷한 우위는 과학 중심 작업으로, Terminal-Bench-Science 64.6%, FrontierSWE v2 65.5%에서 Opus 5.5를 앞섭니다.
4. Gemini 3.8 Flash (Google)
Gemini 3.8 Flash는 2026년 9월 2일 출시된 Google의 주력 모델로, 프런티어 연구소급 에이전트 코딩 점수를 가장 저렴하게 얻는 방법 중 하나입니다(GPT-6 Luna가 토큰당 더 싸지만 에이전트 성적은 낮습니다). Google의 평가 보고서는 Terminal-Bench 2.1 89.4%, 장기 호라이즌 113개 작업으로 구성된 DeepSWE v1.1 73.7%를 보여줍니다(Fable 5.1은 67.4%). 같은 표에서 Opus 5는 74.0%로 약간 앞서고, Anthropic은 Opus 5.5를 74.2%로 보고합니다. Google 개발자 가이드는 SWE-bench Pro 61.6%도 추가합니다.
Gemini API 요금은 2026년 12월 31일까지 입력 100만 당 $0.75, 출력 $3.75이며, 2027년 1월 1일부터 각각 $1.50, $7.50입니다. 2027년 가격도 Opus 5.5 출력 요율의 3분의 1 조금 넘는 수준입니다. 컨텍스트는 입력 100만, 출력 64K입니다.
주요 특징:
- 네이티브 멀티모달 입력을 지원해, 아키텍처 다이어그램이나 실패한 UI 스크린샷을 코드와 함께 제공할 수 있습니다.
- Google은 대량 에이전트 작업용 모델로 포지셔닝하며 그에 맞춰 가격을 책정합니다.
- 보안 취약점 작업용 Cyber 변형이 별도 게이팅으로 존재하며, Gemini 3.8 Flash 및 Flash Cyber 개요에서 다룹니다.
적합한 용도: 대량 에이전트 루프, 비용 민감 팀, Vertex AI 사용자. 2026년 2월 19일 출시된 Gemini 3.1 Pro는 여전히 Google의 Pro 등급 모델로 SWE-bench Pro 54.2%를 입력 $2, 출력 $12에 제공합니다. 다만 코딩만 놓고 보면, 오늘은 3.1 Pro보다 3.8 Flash를 고르겠습니다.
트레이드오프: Terminal-Bench 4.0에서 19.1%. Flash는 범위가 명확한 터미널 작업에 강하고 프런티어 과학 작업에는 약하므로, 가장 어려운 티켓용으로 더 강한 모델을 대기시키세요.
클라우드 모델은 여기까지입니다. 나머지는 다운로드 가능한 모델입니다.
2026년 최고의 오픈 웨이트 코딩 LLM은?
2026년 최고의 오픈 웨이트 코딩 LLM은 두 부류로 나뉩니다. DeepSeek V4.1 Flash나 Kimi K3처럼 프런티어 점수에 근접하지만 서버급 하드웨어가 필요한 데이터센터급 모델, 그리고 Qwen3.8-27B나 Laguna S 2.1처럼 보유 하드웨어에서 돌릴 수 있는 120B 미만 모델입니다.
여기서 “오픈 웨이트”는 웨이트 다운로드 가능을 의미합니다. 실제 라이선스는 MIT, Apache 2.0부터 커스텀까지 다양합니다.
5. DeepSeek V4.1 Flash (DeepSeek)
DeepSeek V4.1 Flash는 2026년 9월 10일 출시되었고, 이름과 달리 이제 DeepSeek에서 제가 먼저 고를 모델입니다. DeepSeek은 자사 V4 Pro 0813 플래그십을 성능, 비용, 속도, 작업 완료 시간에서 능가한다고 말합니다. Vals AI의 독립 지수도 같은 방향으로 기울어, 오픈 웨이트 최고 모델로 57.9%를 기록했고, 8월의 V4 Pro 0813은 52.4%였습니다.
552B 파라미터 MoE 모델로, 입력 시 토큰당 약 8B, 출력 시 16B 활성 파라미터를 사용하며, 컨텍스트 100만, 네이티브 이미지 입력, MIT 라이선스 웨이트를 제공합니다. DeepSeek은 Terminal-Bench 2.1 90.6%, DeepSWE v1.1 74.2%를 보고하며, 둘 다 오픈 웨이트 중 벤더 보고 최고입니다. Vals AI의 자체 Terminal-Bench 2.1 실행은 74.5%로 덜 관대하며, 오픈 웨이트 중 2위입니다.
자세한 내용은 DeepSeek V4.1 Flash 개요에서 다룹니다.
주요 특징:
- DeepSeek 요금은 비혼잡 시간 입력 100만 당 $0.15, 출력 $0.60이며, 평일 혼잡 시간(UTC 01:00~04:00, 06:00~10:00)엔 두 배입니다. 캐시 히트는 비혼잡 100만 당 $0.003.
- OpenAI 호환 API에서
deepseek-flash로 제공되므로, 본문 후반의ask_coding_model.py는 베이스 URL만 바꾸면 됩니다. - V4 Flash 대비 약 1/4 크기의 KV 캐시로, 저가의 장문 컨텍스트 과금이 가능합니다.
적합한 용도: 저비용 프런티어 인접 터미널 코딩, 비혼잡 시간 예약 배치 코드 작업.
트레이드오프: DeepSeek 자체 보고에서 Terminal-Bench 4.0은 31.2%여서, 가장 어려운 장기 에이전트 작업은 여전히 프런티어 연구소 몫입니다. 체크포인트도 약 510 GB라서, 여기서 “오픈 웨이트”는 멀티 GPU 서버를 뜻합니다. V4 Pro 0813 사용자라면 DeepSeek은 9월 14일 해당 모델을 V4.1 Flash로 라우팅한다고 했다가 번복했으며, 공지가 있을 때까지 V4 Pro는 비혼잡 $0.66/$1.98로 계속 제공됩니다.
6. Kimi K3 (Moonshot AI)
Kimi K3는 2026년 7월 출시된 Moonshot AI의 2.8조 파라미터 오픈 웨이트 플래그십으로, Terminal-Bench 2.1에서 88.3%를 기록해 DeepSeek V4.1 Flash의 벤더 보고 90.6% 다음으로 높습니다.
허깅페이스 카드는 896 전문가(토큰당 16 라우팅 + 2 공유)에서 활성 104B 파라미터, 1,048,576 토큰 컨텍스트, MXFP4 웨이트를 기재합니다. Vals AI는 SWE-bench Verified 93.4%를 측정했습니다.
주요 특징:
- 네이티브 비전과 100만 토큰 컨텍스트.
- Kimi K3 라이선스(커스텀)로 제공되므로 상업적 사용 전에 반드시 검토하세요.
- 권장 추론 스택은 vLLM, SGLang, TokenSpeed이며, 일부 GPU 평가 작업은 H20 GPU에 맞춰 보정되었습니다.
적합한 용도: 사용 가능한 오픈 에이전트 코더 중 최강을 원하는 경우.
트레이드오프: 프런티어에 근접한 성능은 데이터센터 규모에서만 나옵니다. Terminal-Bench 2.1에서 Fable 5.1 대비 3포인트 격차는 가까워 보이지만, 동등 비교가 아닙니다. Moonshot은 자체 Kimi Code 하네스에서 88.3%를 측정했고, Fable의 91.4%는 Artificial Analysis의 Terminus 2 실행입니다. 실전에서는 호스팅 제공업체를 빌리거나 자체 클러스터가 필요하며, 커스텀 라이선스도 법무 검토가 필요합니다.
7. Qwen3.8-27B (Alibaba)
Qwen3.8-27B는 2026년 8월 출시된 270억 파라미터의 조밀(dense) 모델로 Apache 2.0 라이선스를 따르며, 단일 24 GB GPU에서 돌릴 수 있는 최고의 코딩 LLM입니다.
모델 카드는 SWE-bench Pro 61.7%, Terminal-Bench 2.1 73.0%, LiveCodeBench v6 90.3%, DeepSWE 1.1 42.2%를 보고합니다. 기본 컨텍스트는 262,144 토큰이며 YaRN으로 100만까지 확장 가능합니다. SWE-bench Pro와 Terminal-Bench 수치는 4배 큰 Laguna S 2.1을 앞서고, SWE-bench Pro에서는 Gemini 3.1 Pro도 능가합니다. 다만 SWE-bench Pro는 Qwen이 자체 수정 태스크 셋으로 돌렸으니 교차 연구소 비교는 방향성 정도로 보세요.
주요 특징:
- 커뮤니티 Unsloth의 UD-Q4_K_M GGUF는 단일 16.5 GB 파일이며, 24 GB 카드에서 32K 컨텍스트가 가능합니다. UD-Q4_K_XL은 17.6 GB.
- 조밀 아키텍처라 토큰당 속도는 3B 활성 MoE보다 느리지만, 다파일 수정에서 훨씬 더 안정적입니다.
- Apache 2.0으로 상업 제품에 사용 제한이 없습니다.
적합한 용도: 코드를 외부 API로 보낼 수 없는 개발자, RTX급 GPU 1장만 있는 1인 개발자, 비용 지불 전 자체 리포지토리에서 로컬과 Claude 비교를 해보고 싶은 경우.
트레이드오프: Terminal-Bench 2.1에서 73.0% 대 91.4%는 18포인트 격차이며, 장기 에이전트 작업에서 재시도 증가로 체감됩니다.
8. Laguna S 2.1 (Poolside)
Laguna S 2.1은 2026년 7월 21일 출시된 Poolside의 118B 파라미터 MoE 코딩 모델로, 활성 파라미터는 8B이며, Mac Studio, DGX Spark, 멀티 GPU 워크스테이션에 적합한 오픈 웨이트 선택지입니다.
Poolside의 출시 글은 SWE-bench Pro 공개 셋 59.4%, Terminal-Bench 2.1에서 최대 사고 모드 70.2%(사고 off 60.4%), SWE-bench Multilingual 78.5%, DeepSWE 40.4%를 보고합니다.
이 모델은 409,000개 환경(터미널 작업 83,000, 소프트웨어 엔지니어링 워크플로 168,000 포함)에서 학습되었고, H200 4,096장으로 9주 미만에 학습했습니다.
주요 특징:
- 이 크기에서는 이례적인 100만 토큰 컨텍스트.
- OpenMDW-1.1 라이선스(관대한 편이지만 법무 검토 권장).
- 사고 모드는 기본 on이며 Terminal-Bench 2.1에서 약 10포인트 향상을 줍니다. Poolside 실행에서 작업당 평균 완료 길이는 약 23K~249K 토큰이었으니 예산을 반영하세요.
적합한 용도: 96~128 GB 통합 메모리 머신에서 Claude Code 스타일 로컬 에이전트를 원하는 팀, 로컬에서도 100만 컨텍스트가 필요한 대형 리포지토리.
트레이드오프: 118B 파라미터를 4비트로도 웨이트만 60~70 GB 수준이며, KV 캐시까지 고려하면 24 GB GPU는 무리입니다. 원시 점수에서는 Qwen3.8-27B가 근소 우위지만, Laguna는 활성 8B로 웨이트가 맞아떨어지기만 하면 훨씬 빠르며, 이는 야간 에이전트의 요점입니다.
9. Qwen3-Coder-Next (Alibaba)
Qwen3-Coder-Next는 2026년 2월 3일 출시된 80B 파라미터 MoE 모델로, 토큰당 활성 파라미터는 3B에 불과합니다(Apache 2.0). 27B 조밀 모델을 빠르게 유지하며 담을 수 없는 하드웨어에서 가장 빠른 “쓸 만한” 로컬 코더입니다.
모델 카드는 SWE-bench Verified 70.6%, SWE-bench Pro 44.3%, Terminal-Bench 2.0 36.2%를 보고합니다. 전문가 512명(활성 10 + 공유 1), 컨텍스트 262,144 토큰이며, 비사고 모드만 지원합니다.
주요 특징:
- 공식 Q4_K_M GGUF는 약 48 GB로, 단일 소비자 GPU보다 64 GB Mac 또는 CPU 오프로드 환경에 더 적합합니다.
- 하이브리드 어텐션(표준 어텐션 1층당 3개의 Gated DeltaNet 층)으로 장문 컨텍스트 메모리 사용량을 낮춥니다.
- 카드에 따르면 vLLM, SGLang, Ollama, LM Studio, MLX-LM, llama.cpp, KTransformers에서 지원됩니다.
적합한 용도: 정확도 최고치보다 초당 토큰 속도가 중요한 장기 야간 작업, 64 GB 통합 메모리 노트북.
트레이드오프: SWE-bench Pro 44.3%는 Qwen3.8-27B보다 17포인트 낮아, 단일 어려운 버그에는 조밀 모델을 고르겠습니다.
살펴볼 가치가 있는 기타 오픈 웨이트 모델
다음 4개 모델도 거의 목록에 들었고, 이 중 2개는 특정 팀에는 제 추천보다 더 잘 맞을 수 있습니다.
- DeepSeek V4 Pro 0813(DeepSeek): 총 1.6T, 활성 49B, 컨텍스트 100만, MIT 라이선스, Vals AI 아카이브 SWE-bench Verified 96.4%. 여전히 비혼잡 시간 입력 $0.66, 출력 $1.98로 제공되지만, Vals는 Terminal-Bench 2.1에서 54.7%를 측정했고, DeepSeek은 87.9%를 보고합니다. DeepSeek은 이제 V4.1 Flash를 권장합니다. DeepSeek V4 해설에 아키텍처를 정리했습니다.
- Kimi K2.6(Moonshot): 총 1T, 활성 32B, 컨텍스트 256K, 수정 MIT 라이선스, SWE-bench Verified 80.2%, SWE-bench Pro 58.6%, LiveCodeBench v6 89.6%. 트릴리언급 모델 중 DeepSeek V4 Pro의 순수 MIT 다음으로 가장 깔끔한 라이선스.
- MiniMax M3: 총 428B, 활성 23B, 컨텍스트 100만, 네이티브 이미지·비디오 입력, SWE-bench Verified 80.5%, SWE-bench Pro 59%. 스크린샷과 코드가 섞인 작업에 적합한 오픈 선택지.
- Qwen3.8-Flash-Next: 총 125B, 활성 6B, SWE-bench Pro 62.5%, DeepSWE 58.7%, 더 제한적인 qwen-community-1.0 라이선스. DeepSWE에서는 Qwen3.8-27B보다 강하지만 라이선스 때문에 상위 9개에서 제외했습니다.
이 중 하나가 하드웨어에 잘 맞는다면, 다음 섹션에서 실행 방법을 설명합니다.
오픈 웨이트 코딩 모델을 로컬에서 실행하려면?
오픈 웨이트 코딩 모델을 로컬에서 실행하려면 3단계가 필요합니다. 양자화된 체크포인트를 다운로드하고, OpenAI 호환 엔드포인트 뒤에서 서비스하며, 클라이언트나 코딩 어시스턴트를 해당 엔드포인트로 가리키면 됩니다. 예시는 소비자급 하드웨어에 가장 쉽게 맞는 Qwen3.8-27B를 사용합니다.
먼저 다운로드입니다. huggingface_hub 라이브러리는 대용량 파일에 유용한 재개 가능 전송과 캐싱을 지원합니다.
"""Download a quantized coding model from Hugging Face.
Qwen3.8-27B at UD-Q4_K_M is a single 16.5 GB file, which leaves room for
a 32K context on a 24 GB GPU. Swap FILENAME for the UD-Q4_K_XL build if you
have the extra 1 GB to spare.
"""
from huggingface_hub import hf_hub_download
REPO_ID = "unsloth/Qwen3.8-27B-GGUF"
FILENAME = "Qwen3.8-27B-UD-Q4_K_M.gguf"
def fetch(repo_id: str = REPO_ID, filename: str = FILENAME) -> str:
"""Download one file from the Hub and return its local path."""
path = hf_hub_download(repo_id=repo_id, filename=filename)
print(f"Saved to {path}")
return path
if __name__ == "__main__":
fetch()
download_gguf.py로 저장하고 uv run --with huggingface_hub python download_gguf.py로 실행하세요. Windows에서는 개발자 모드가 꺼져 있으면 심볼릭 링크 경고가 뜹니다.
둘째, 서빙입니다.
llama.cpp의 llama-server, LM Studio, Ollama는 모두 OpenAI 호환 /v1 엔드포인트를 노출합니다. llama.cpp는 명령 한 줄로 충분하며, 두 플래그가 핵심입니다. -ngl 99는 모든 레이어를 GPU로 오프로딩하고, -c 32768은 32K 컨텍스트를 설정합니다.
llama-server -m Qwen3.8-27B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080
셋째, 클라이언트입니다. 저는 평가하는 각 모델마다 스크립트 하나를 두고, 환경 변수 3개로 대상만 바꿉니다. 같은 파일이 위 로컬 서버, DeepSeek API, OpenAI 모두에 전송합니다.
"""Send one coding prompt to any OpenAI-compatible endpoint.
The same script talks to a local llama.cpp or vLLM server, to DeepSeek's
API, or to OpenAI itself. Only three environment variables change:
LLM_BASE_URL e.g. http://localhost:8080/v1 or https://api.deepseek.com
LLM_MODEL e.g. qwen3.8-27b or deepseek-flash
LLM_API_KEY anything non-empty for a local server
"""
import os
from openai import OpenAI
PROMPT = (
"Write a Python function top_n(df, col, n) that returns the n largest "
"rows of a pandas DataFrame by column col, with a docstring and a "
"ValueError if col is missing."
)
def ask(prompt: str = PROMPT) -> str:
"""Return the model's reply for a single-turn coding request."""
client = OpenAI(
base_url=os.environ["LLM_BASE_URL"],
api_key=os.environ.get("LLM_API_KEY", "local"),
)
response = client.chat.completions.create(
model=os.environ["LLM_MODEL"],
messages=[{"role": "user", "content": prompt}],
temperature=0.2, # keep code generation close to deterministic
)
return response.choices[0].message.content
if __name__ == "__main__":
print(ask())
ask_coding_model.py로 저장하고 LLM_BASE_URL=http://localhost:8080/v1 LLM_MODEL=qwen3.8-27b uv run --with openai python ask_coding_model.py로 실행하세요.
라우팅, 재시도, 도구 호출까지 여러 엔드포인트를 애플리케이션에 연결하려면, LangChain으로 LLM 애플리케이션 개발 강좌에서 if 문의 덩어리가 되지 않게 하는 추상화를 다룹니다.
최고의 코딩 LLM을 어떻게 선택해야 하나요?
최고의 코딩 LLM 선택은 네 가지 제약으로 귀결됩니다. 코드가 머신 밖으로 나갈 수 있는지, 메모리가 얼마인지, 출력 100만 토큰당 지불액이 얼마인지, 단일 작업에 필요한 컨텍스트가 얼마나 긴지입니다. 아래 표는 신뢰하는 수치로 9개 모델을 나란히 비교하며, 이후 결정 가이드는 제약을 추천으로 매핑합니다.
| Model | Type | Terminal-Bench 2.1 | SWE-bench Pro | Context | Price (per 1M output) or memory | Best for |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 | Cloud | 87.6% (Vals AI) | 89.9% | 1M | $20 | 대부분의 코딩 작업 기본값 |
| Claude Fable 5.1 | Cloud | 91.4% (Artificial Analysis) | 81.2% | 1M | $50 | 가장 긴 호라이즌 에이전트 작업 |
| GPT-6 Astra | Cloud | 미공개(Terminal-Bench 4.0에서 tbench.ai 58.2% / Artificial Analysis 59.6%) | 미공개 | 1.05M | $50 | Codex 사용자, 프런티어 과학 작업 |
| Gemini 3.8 Flash | Cloud | 89.4% | 61.6% | 1M | 2026년까지 $3.75 | 대량, 비용 민감 에이전트 |
| DeepSeek V4.1 Flash | Open (MIT) | 90.6% (vendor); 74.5% (Vals AI) | 미공개 | 1M | 비혼잡 $0.60 | API로 쓰는 최저가 유능 오픈 웨이트 |
| Kimi K3 | Open (custom) | 88.3% (Kimi Code 하네스) | 미공개 | 1M | 2.8T params, 클러스터 전용 | 최강 자기 호스팅 에이전트 |
| Qwen3.8-27B | Open (Apache 2.0) | 73.0% | 61.7% | 262K | UD-Q4_K_M에서 16.5 GB | 단일 24 GB GPU |
| Laguna S 2.1 | Open (OpenMDW-1.1) | 70.2% | 59.4% | 1M | Q4에서 60~70 GB | 128 GB 워크스테이션, 로컬 에이전트 |
| Qwen3-Coder-Next | Open (Apache 2.0) | 36.2% (2.0) | 44.3% | 262K | Q4에서 약 48 GB | 빠른 로컬 모델, 64 GB Mac |
결정 가이드
네 가지 제약을 순위에 대입하면 다음과 같습니다.
- 정확성이 비용보다 중요한 에이전트형 코딩 파이프라인: Claude Opus 5.5를 high 또는 xhigh 노력으로, Opus 5.5가 부족하다고 평가된 장기 작업은 Fable 5.1 대기.
- 합리적 가격의 일상 AI 지원 코딩: Claude Opus 5.5를 기본 medium 노력으로 우선, Codex 생태계라면 GPT-6 Sol을 차선.
- 프런티어 과학, 시뮬레이션, GPU 커널 작업: GPT-6 Astra 또는 Claude Opus 5.5. 과학 전용에선 Astra가, Terminal-Bench 4.0에선 Opus 5.5가 앞섭니다.
- 초대형 코드베이스, 100만 토큰 프롬프트, 빠듯한 예산: Gemini 3.8 Flash를 기본으로, Flash 답변이 흐트러질 땐 Opus 5.5.
- API로 쓰는 오픈 웨이트: 비혼잡 시간의 DeepSeek V4.1 Flash.
- 단일 24 GB GPU에서 로컬·프라이빗: Qwen3.8-27B(UD-Q4_K_M).
- 96~128 GB 머신에서 로컬·프라이빗: Laguna S 2.1, “머신”이 클러스터라면 Kimi K3.
- 64 GB 노트북에서 로컬·고속: Qwen3-Coder-Next.
코딩을 넘어 모델-애플리케이션 매칭 프레임워크(호스팅 옵션, 라이선싱 포함)가 필요하다면, 애플리케이션에 최적 LLM을 선정하는 법 가이드를 참고하세요.
그리고 어떤 모델을 고르든, 가치를 뽑아내는 기술은 같습니다. 소프트웨어 엔지니어링을 위한 AI 스킬 트랙과 개발자를 위한 AI 보조 코딩 강좌에서 91% 벤치마크를 머지된 PR로 바꾸는 프롬프트, 테스트, 리뷰 습관을 배울 수 있습니다.
마무리 생각
Claude Opus 5.5는 2026년 9월 최고의 코딩 LLM이며, 드물게 팀의 결제 수단에도 올릴 1순위입니다. 가장 긴 작업의 상향 경로는 Claude Fable 5.1이고, Qwen3.8-27B는 24 GB GPU를 작년 프런티어를 SWE-bench Pro에서 능가하는 프라이빗 코딩 어시스턴트로 바꿔주는 오픈 웨이트 모델입니다. 나머지는 제약의 문제이고, 위 결정 가이드가 그 해법입니다.
더 큰 변화는 2년간 이 분야를 규정했던 SWE-bench Verified가, 같은 12개월 동안 오픈 웨이트가 이를 따라잡자 의미가 줄었다는 점입니다.
우연이 아닙니다.
포화된 테스트에서 Opus 5와 DeepSeek V4 Pro가 0.6포인트 차에 불과하고, 100만 토큰당 $20인 모델이 Anthropic의 $50 모델을 SWE-bench Pro에서 이기는 지금, 가치는 하네스 설계, 노력 예산, 자체 리포지토리 평가로 이동했습니다. 이는 벤더 표가 대신해줄 수 없는 일입니다.
그러니 직접 하세요. ask_coding_model.py 스크립트를 2~3개 모델에 연결하고, 실제 백로그의 티켓 20개를 당신이 실제로 지불할 노력 레벨에서 돌려보세요. 그리고 그 결과가 제가 쓴 모든 말을 덮도록 하세요. 평가 하네스보다 “바이브 코딩”이 체질이라면, 바이브 코딩이란 무엇이며 어디서 한계가 오는가에서 트레이드오프를 솔직히 다뤘고, 동일한 모델 순위가 적용됩니다.
FAQs
What is SWE-bench Verified and why does it matter for evaluating coding LLMs?
SWE-bench Verified는 SWE-bench의 500개 하위셋으로, 사람 주석자가 각 GitHub 이슈가 해결 가능하며 테스트가 공정함을 확인했습니다. 모델은 숨겨진 테스트를 통과하는 패치를 만들어야 합니다. 장난감 함수 작성이 아니라 실제 리포지토리 수정을 신뢰할 수 있게 처음 보여준 테스트라 중요했습니다. 2026년에는 상위 모델이 96% 이상을 기록하므로, 상위권 구분을 위해 SWE-bench Pro와 Terminal-Bench를 사용합니다.
Can open-weight models compete with Claude and GPT for real coding tasks in 2026?
가능합니다. 구형 벤치마크에서는 물론이고, 에이전트형에서도 거의 따라갑니다. Kimi K3는 Terminal-Bench 2.1에서 88.3%, DeepSeek V4 Pro 0813은 87.9%를 기록했고, Fable 5.1은 91.4%입니다. 또한 Vals AI는 SWE-bench Verified에서 DeepSeek이 Opus 5에 0.6포인트 차로 근접했다고 측정했습니다. 단, 크기가 문제입니다. 해당 오픈 모델은 1.6~2.8조 파라미터로, “오픈”이 “내 노트북에서 실행”을 의미하진 않습니다. “API로 저렴하게 사용”에 가깝습니다.
What is the best LLM for coding if I cannot share my code with an external API?
외부 API로 코드를 보낼 수 없다면, 단일 24 GB GPU에서 Qwen3.8-27B가 최선입니다. Terminal-Bench 2.1 73.0%, SWE-bench Pro 61.7%, Apache 2.0 라이선스입니다. 통합 메모리 96~128 GB가 있다면 Laguna S 2.1이 100만 토큰 컨텍스트와 8B 활성 파라미터로 빠른 로컬 에이전트를 제공합니다. 64 GB 노트북이라면 Qwen3-Coder-Next의 3B 활성 파라미터가 가장 빠른 실용 옵션입니다.
What is the difference between a coding LLM and an AI coding assistant like Cursor or GitHub Copilot?
코딩 LLM은 코드를 생성하는 모델이고, 코딩 어시스턴트는 파일을 읽고, 명령을 실행하며, diff를 보여주는 하네스입니다. Cursor, Copilot, Windsurf, Claude Code, Codex는 모두 기본 모델을 교체할 수 있으며, 동일 모델이라도 하네스에 따라 점수가 몇 포인트씩 달라집니다. 벤치마크와 가격으로 모델을 고르고, 워크플로로 어시스턴트를 고르세요.
How often does the best coding LLM change, and how should I keep up?
2026년 5월 28일부터 9월 24일까지 Anthropic과 OpenAI만 합쳐도 프런티어급 모델 7개(Opus 4.8, Fable 5, Sonnet 5, GPT-5.6, Opus 5와 5.5, Fable 5.1, GPT-6 Astra)를 출시했습니다. 즉 4~8주마다 선두가 바뀔 수 있습니다. 출시 글보다 Artificial Analysis, Vals AI, tbench.ai 세 독립 보드를 보면서, 사용하는 모델이 새 버전이 나올 때마다 실제 지불할 노력 레벨로 자체 20개 작업 평가를 재실행하세요.