В феврале 2025 года Claude 3.7 Sonnet показала 62,3% на SWE-bench Verified, или 70,3% с пользовательским каркасом (scaffold), тогда как лучшая на тот момент открытая модель DeepSeek-R1 заявила в своей статье 49,2%.
Разрыв составлял от 13 до 21 пунктов — в зависимости от того, насколько щедро вы подходили к скелетированию задач.
К сентябрю 2026 года независимый совет Vals AI по SWE-bench Verified зафиксировал 97,0% у Claude Opus 5 и 96,4% у открытой DeepSeek V4 Pro 0813, после чего Vals заархивировал бенчмарк как насыщенный.
Фронтир сместился к более сложным агентным оценкам, таким как SWE-bench Pro и Terminal-Bench 4.0; открытые веса догнали старые наборы, а вопрос «лучшая LLM для кодинга» превратился в «лучшая для чего, на каком железе и по какой цене».
Ниже — ответ на этот вопрос для 9 моделей, которые я действительно стал бы рассматривать сегодня. Коротко: Claude Opus 5.5 — та, с которой большинству команд стоит начать.
Примечание перед рейтингом: этот материал — о самих моделях, а не о тулзинге вокруг них. Если нужен разбор Cursor, Copilot и Windsurf, смотрите наш обзор лучших AI-ассистентов для кодинга в 2026 году.
Коротко: лучшие LLM для кодинга в сентябре 2026 года
Claude Opus 5.5 — одновременно и сильнейшая модель на большинстве бенчмарков, и та, что по умолчанию подойдёт большинству разработчиков; Claude Fable 5.1 — для задач с самым длинным горизонтом; Qwen3.8-27B — открытая модель для запуска на одном GPU. Вот лучшие варианты по назначению:
- Лучшая в целом для агентного кодинга: Claude Opus 5.5 (Anthropic), 89,9% на SWE-bench Pro и 66,4% на Terminal-Bench 4.0, $4 за ввод и $20 за вывод на миллион токенов.
- Лучшая для задач с самым длинным горизонтом: Claude Fable 5.1 (Anthropic), 81,2% на SWE-bench Pro и топ на Terminal-Bench 2.1 по Artificial Analysis (91,4%), $10 за ввод и $50 за вывод на миллион токенов.
- Лучшая модель OpenAI для кодинга: GPT-6 Astra (OpenAI), первая на агентном лидерборде tbench.ai для Terminal-Bench 4.0 с 58,2% и на уровне с Opus 5.5 с 59,6% по прогону Artificial Analysis.
- Лучшая ценность от фронтир-лаба: Gemini 3.8 Flash (Google), 89,4% на Terminal-Bench 2.1 при $0,75 за ввод и $3,75 за вывод на миллион токенов до 31 декабря 2026 года.
- Лучшие открытые веса через API: DeepSeek V4.1 Flash, лицензия MIT, 90,6% на Terminal-Bench 2.1, $0,60 за миллион выходных токенов вне пиковых часов.
- Лучшие открытые веса, которые нельзя запустить дома: Kimi K3 (Moonshot AI), 2,8 трлн параметров, 88,3% на Terminal-Bench 2.1.
- Лучшая локальная модель на GPU 24 ГБ: Qwen3.8-27B (Alibaba), Apache 2.0, 73,0% на Terminal-Bench 2.1, 16,5 ГБ в UD-Q4_K_M.
- Лучшая локальная модель для рабочей станции 128 ГБ: Laguna S 2.1 (Poolside), 118B параметров с 8B активными, контекст 1M.
- Лучшая быстрая локальная модель для старого железа: Qwen3-Coder-Next, всего 80B, но 3B активных, 70,6% на SWE-bench Verified.
Все приведённые выше показатели — из публикаций вендоров, если не указано иное. Далее — почему именно эти модели и где у каждой границы.
Почему этот список — о моделях, а не о кодинг-ассистентах?
Кодинговая LLM — это модель, которая читает ваш промпт и пишет токены; кодинг-ассистент — это обвязка, которая подаёт ей файлы, запускает команды и показывает диффы.
Claude Code, Codex, Cursor, GitHub Copilot и Windsurf — это обвязки. Claude Opus 5.5, GPT-6 Astra и Qwen3.8-27B — модели, и обвязка меняет результат сильнее, чем многие ожидают.
У Anthropic в записи о запуске Claude Opus 4.8 это явно отмечено в сноске.
Они приводят баллы всех моделей на Terminal-Bench 2.1 в публичной обвязке Terminus-2, а затем замечают, что у GPT-5.5 показатель растёт до 83,4% внутри Codex CLI от OpenAI. Те же веса, другая «сантехника» — другой результат.
Поэтому в рейтингах ниже везде, где возможно, указана и обвязка. Если вы только знакомитесь с тем, как модели работают «под капотом», наш гид что такое LLM за 15 минут упростит чтение остального.
Какие бенчмарки действительно важны для кодинговых LLM?
В 2026 году важны SWE-bench Pro, Terminal-Bench (версии 2.1 и 4.0) и, для открытых моделей, которые ещё его публикуют, LiveCodeBench v6. SWE-bench Verified был стандартом 2 года, сейчас он перенасыщен и не разделяет топовые модели.
Прежде чем ранжировать, поясню, что значит каждая цифра в карточках моделей.
SWE-bench Verified перенасыщен
SWE-bench Verified — это набор из 500 проверенных людьми задач GitHub из популярных Python-репозиториев; модель получает репозиторий и текст issue и должна выдать патч, проходящий скрытые юнит-тесты.
OpenAI выделила Verified-подмножество в 2024 году, потому что в оригинальном SWE-bench встречались недоопределённые issues и сломанные тесты. Это до сих пор самая цитируемая метрика для кодинга — и в этом проблема.
Лидерборд Vals AI, который прогоняет все модели через одного и того же минимального bash-only агента, в обновлении от 1 сентября 2026 поставил Claude Opus 5 на 97,0%, DeepSeek V4 Pro 0813 на 96,4% и GPT-5.6 Sol на 96,2%, после чего пометил бенчмарк архивным.
Когда 3 модели из 3 лабораторий лежат в пределах одного пункта друг от друга и в 4 пунктах от потолка, метрика перестаёт различать. Я всё ещё привожу её для старших и меньших моделей, потому что это число у них на карточках, но не ранжирую по нему.
SWE-bench Pro — более сложная замена
SWE-bench Pro, поддерживаемый Scale AI, содержит 1 865 задач в 41 профессиональном репозитории, с публичным сплитом на 731 задачу и закрытыми наборами. 22 сентября 2026 года Scale выпустила SWE-bench Pro V2, сократив публичный набор до 642 задач после исключения 89 некорректных — проверяйте, на какой версии считался результат.
В среднем фикс затрагивает 107,4 строки в 4,1 файла, а репозитории покрывают несколько языков, а не только Python. Когда в сентябре 2025 вышла статья про SWE-bench Pro, лучшие модели набирали около 23%.
Год спустя в системной карточке Fable 5.1 заявлено 81,2% для Fable 5.1 и 79,2% для Opus 5, а в таблице запуска GPT-5.6 — 64,6% для GPT-5.6 Sol. Спустя три недели карточка Opus 5.5 подняла топ до 89,9%.
Это прогоны вендоров, у Anthropic усреднённые по 5 попыткам с максимальным усилием. Публичный лидерборд Scale по этим цифрам отстаёт на месяцы, поэтому я считаю вендорскую оценку потолком, а лидерборд — полом.
Terminal-Bench 2.1 и 4.0
Terminal-Bench даёт модели живую оболочку в контейнере и задачу вроде «обучите эту модель», «почините этот билд» или «восстановите этот повреждённый архив», а затем оценивает полученные артефакты.
Версия 2.1 — это 89 отобранных задач по разработке ПО, администрированию, обработке данных и безопасности; Artificial Analysis считает pass@1, усредняя по 3 прогонам в обвязке Terminus 2. Это единственная цифра, которую я сильнее всего учитываю для тех, кто строит или использует кодинговых агентов.
Terminal-Bench 4.0, размещённый Стэнфордом, Harbor и институтом Laude на tbench.ai, — новый фронтирный набор.
В карточке Opus 5.5 от Anthropic он описан как 66 задач с уклоном в вычислительную биологию, физическое моделирование, CAD, формальные доказательства и работу с производительностью на GPU, с более длинными тайм-аутами — обвязка влияет меньше.
На агентном лидерборде tbench.ai GPT-6 Astra всё ещё лидирует с 58,2%, Claude Fable 5.1 — 57,9%, но у Claude Opus 5.5 там пока нет агентной записи. На уровне моделей Artificial Analysis фиксирует паритет Opus 5.5 и Astra на 59,6%, а Vals AI ставит Opus 5.5 первым с 61,6%, хотя отмечает: если считать задачи, которые его «сейфгарды» отдали запасной модели, как провалы, то это падает до 53,5%. Здесь фронтир отделяется от остального поля.
LiveCodeBench v6 ловит запоминание
LiveCodeBench, представленный в статье Джайна и соавторов 2024 года, непрерывно собирает задачи с LeetCode, AtCoder и Codeforces, ставит на каждую временную метку, чтобы оценивать модель только на задачах, опубликованных после её среза обучения.
Актуальная версия — шестая — на публичном лидерборде. Она меряет алгоритмическое рассуждение, а не инженерные задачи уровня репозитория, поэтому полезна для собеседований и структур данных.
Фронтир-лабы в 2026 году в основном перестали её публиковать, так что цифры — по открытым моделям: превью DeepSeek V4 Pro за апрель — 93,5%, Qwen3.8-27B — 90,3%, Kimi K2.6 — 89,6%. Gemini 3.1 Pro приводит смежную метрику — LiveCodeBench Pro Elo 2 887.
Как я читаю таблицу бенчмарков от вендора
Таблица вендора — это лучший случай: их обвязка, их уровень усилия, их число прогонов. Я ищу независимую репликацию на Artificial Analysis, Vals AI или tbench.ai, прежде чем верить отрыву менее 3 пунктов.
Наш ликбез по LLM-бенчмаркам и сравнению моделей разбирает основные лидерборды, а материал что измеряет MMLU напоминает: знаниевый бенчмарк почти ничего не говорит о том, сможет ли модель починить «флапающий» тест.
Если строите свою обвязку для оценок, наш гид по метрикам и методологиям оценки LLM — первый, на который я направляю младших коллег.
С бенчмарками разобрались — далее, как 9 моделей на них выглядят, начиная с облачного фронтира.
Какие лучшие облачные фронтир-модели для кодинга?
Лучшие облачные фронтир-модели для кодинга в сентябре 2026 — Claude Opus 5.5, Claude Fable 5.1, GPT-6 Astra и Gemini 3.8 Flash; у всех около 1M токенов контекста.
Различия — в цене, уровнях усилия и том, под какие бенчмарки оптимизировал каждый лаб.
Ниже — в порядке рекомендаций команде без ограничений бюджета.
1. Claude Opus 5.5 (Anthropic)
Claude Opus 5.5 — новый флагман уровня Opus от Anthropic, релиз 22 сентября 2026, и сейчас это модель для кодинга, которую я порекомендую почти всем. Не ожидал написать это через 2 месяца после Opus 5. В посте запуска сказано, что она работает на уровне Fable 5.1 по большей части задач при себестоимости на 40% ниже Opus 5, а в обзоре моделей теперь советуют начинать с Opus 5.5 и переходить к Fable 5.1 для самых длинных задач или когда эвалы на Opus 5.5 не дотягивают.
Системная карточка Opus 5.5 сообщает 89,9% на SWE-bench Pro, 74,2% на DeepSWE v1.1 и 66,4% на Terminal-Bench 4.0 при xhigh, впереди Fable 5.1 по всем опубликованным у Anthropic строчкам для кодинга. Независимые замеры ближе: Artificial Analysis фиксирует паритет с GPT-6 Astra на 59,6% для Terminal-Bench 4.0, а Vals AI ставит его первым с 61,6% на Terminal-Bench 4.0 и 87,6% на Terminal-Bench 2.1. В обоих случаях Vals считает «сейфгард»-фолбэки; если считать их провалами, цифры падают до 53,5% и 79,8%.
Ключевые особенности:
- $4 за миллион входных токенов и $20 за миллион выходных, на 20% ниже Opus 5; чтение из кэша подешевело на 60% — до $0,20 за миллион
- Контекст 1M токенов, вывод 128K, адаптивное «мышление» всегда включено, дефолтный effort — medium, а не high
- 57,8% на CursorBench 4.0 при max effort — топ на лидерборде Cursor; при medium — 52,5%, всё ещё выше Fable 5.1 на max
- Доступна в Claude API как
claude-opus-5-5, а также на Amazon Bedrock, Google Cloud и Microsoft Foundry
Лучше всего подходит: повседневный кодинг, миграции по всему коду и code review. Полностью заменяет Opus 5 по более низкой цене, а Claude Code теперь использует её как дефолтную Opus-модель. Наши гид по Claude Opus 5.5 и сравнение GPT-6 Sol и Claude Opus 5.5 — с практическими тестами.
Компромисс: экономия 40% — на дефолтном effort. На max Artificial Analysis обнаружил, что она тратит существенно больше токенов, и стоимость на задачу Intelligence Index ($5,98) почти сравнялась с Opus 5 ($5,86). Также поставляется с «фэйбловскими» сейфгардами, которые перенаправляют большинство кибербезопасностных задач на Opus 4.8; миграции кода требуют внимания — запросы с выключенным «мышлением» или принудительным tool use теперь возвращают ошибки.
2. Claude Fable 5.1 (Anthropic)
Claude Fable 5.1 — публичная версия модели класса Mythos от Anthropic, релиз 1 сентября 2026, и это модель для эскалации, когда Opus 5.5 перестаёт хватать. На странице запуска сказано, что Fable 5.1 и Claude Mythos 5.1 — одна и та же модель с разными сейфгардами.
Цифры из карточки Fable 5.1: 81,2% на SWE-bench Pro и 55,8% на Terminal-Bench 4.0. Artificial Analysis независимо измерил 91,4% на Terminal-Bench 2.1 при max effort — это до сих пор топ на том борде.
Ключевые особенности:
- Окно контекста 1M токенов и 128K на вывод
- Адаптивное «мышление» всегда включено
- Чтения из prompt-кэша подешевели на 75% — до $0,25 за миллион токенов с версией 5.1; у Anthropic расчёт — до 45% экономии на агентных нагрузках
- Сильное многодоковое планирование и более широкое рассуждение с лучшим использованием инструментов
Лучше всего подходит: продакшн-агенты, многодневные рефакторинги и любые задачи, где неправильный ответ дороже токенов — как только ваши эвалы показывают, что Opus 5.5 тут не дотягивает. Наши гид по Claude Fable 5.1 и обзор июньского релиза Fable 5 — в помощь.
Компромисс: $10 за миллион входных и $50 за миллион выходных токенов — в 2,5 раза дороже Opus 5.5, и в таблице самого Anthropic Fable 5.1 теперь уступает Opus 5.5 на SWE-bench Pro, Terminal-Bench 4.0 и CursorBench 4.0. Anthropic утверждает, что в реальности разрыв уже, чем говорят эти цифры, но бремя доказательства теперь на их стороне. На старом CursorBench 3.2.0 Fable 5.1 при medium effort показал 68,0% за $3,53 на задачу.
3. GPT-6 Astra (OpenAI)
GPT-6 Astra — фронтир-модель OpenAI, релиз 3 сентября 2026, и она всё ещё первая на агентном лидерборде tbench.ai для Terminal-Bench 4.0 с 58,2% в обвязке Codex при max effort, хотя у Opus 5.5 там пока нет агентной записи.
Страница модели указывает окно контекста 1 050 000 токенов, вывод 128 000 токенов, срез знаний 30 апреля 2026 и уровни усилия от none до max. Цена — $10 за миллион входных токенов, $1 за кэшированный вход и $50 за миллион выходных.
Материалы запуска OpenAI опираются на собственные оценки и системную карточку, а не на кросс-лабораторные бенчмарки. Оценки сильные, но я бы не назвал Astra явным победителем над Opus 5.5 или Fable 5.1. Запуск разбираем в обзоре GPT-6 Astra.
Ключевые особенности:
- Responses API раскрывает
hosted_shell,apply_patch,computer_useиtool_search— тот же набор инструментов, на котором работает Codex. - Кэшированный вход по $1 за миллион токенов — десятая часть базовой цены, важно для агентных циклов, перечитывающих один репозиторий.
- Astra — первая модель OpenAI, достигшая верхнего кибербезопасностного уровня в Preparedness Framework, так что некоторые запросы, связанные с безопасностью, ограничены.
Лучше всего подходит: командам на Codex, GitHub Copilot или стеке Microsoft; задачам с уклоном в науку и инженерию; тем, кому нужна лучшая поддержка сторонних инструментов. Если хотите большую часть возможностей дешевле, GPT-6 Sol, релиз 22 сентября по $2 за ввод и $10 за вывод на миллион токенов, сменил GPT-5.6 Sol и теперь занял старую ценовую нишу Terra (поскольку GPT-6 Terra нет). По графикам OpenAI — 68,8% на DeepSWE 1.1 и 49,3% на FrontierCode, хотя GPT-5.6 Sol при max effort всё ещё выше на DeepSWE.
Компромисс: цены уровня Fable, а Opus 5.5 теперь сопоставим с Astra на Terminal-Bench 4.0 примерно за 40% стоимости на задачу по подсчётам Anthropic, при этом Artificial Analysis считает их равными. Самые явные преимущества Astra — в научных задачах: 64,6% на Terminal-Bench-Science и 65,5% на FrontierSWE v2 — обе выше, чем у Opus 5.5.
4. Gemini 3.8 Flash (Google)
Gemini 3.8 Flash — «рабочая лошадка» Google, релиз 2 сентября 2026, один из самых дешёвых способов получить агентный фронтир-результат (GPT-6 Luna дешевле по токену, но показывает ниже на агентных наборах). В отчёте об оценке у Google — 89,4% на Terminal-Bench 2.1 и 73,7% на DeepSWE v1.1 — длинногоризонтном наборе из 113 задач, где Fable 5.1 набрала 67,4%. В той же таблице Opus 5 — чуть впереди с 74,0%, Anthropic сообщает 74,2% для Opus 5.5, а в руководстве разработчика у Google — 61,6% на SWE-bench Pro.
Цены на странице Gemini API — $0,75 за миллион входных и $3,75 за миллион выходных токенов до 31 декабря 2026, затем $1,50 и $7,50 с 1 января 2027. Даже по ценам 2027 это чуть больше трети ставки вывода у Opus 5.5. Окно контекста — 1M входных токенов и 64K на вывод.
Ключевые особенности:
- Нативный мультимодальный вход — можно дать диаграмму архитектуры или скриншот упавшего UI рядом с кодом.
- Google позиционирует модель для высокообъёмной агентной работы и соответствующе ценообразует.
- Есть Cyber-вариант для уязвимостей, отдельно ограниченный; см. наш обзор Gemini 3.8 Flash и Flash Cyber.
Лучше всего подходит: высокообъёмные агентные циклы, команды с жёстким бюджетом и пользователи Vertex AI. Gemini 3.1 Pro (релиз 19 февраля 2026) остаётся Pro-моделью Google с 54,2% SWE-bench Pro при $2 за ввод и $12 за вывод, но для кодинга сегодня я бы выбрал 3.8 Flash вместо 3.1 Pro.
Компромисс: 19,1% на Terminal-Bench 4.0. Flash силён в хорошо сформулированных терминальных задачах и слаб на фронтирной «науке», поэтому держите более сильную модель на подхвате для самых сложных тикетов.
С облаком всё. Дальше — модели, которые можно скачать.
Какие лучшие открытые LLM для кодинга в 2026 году?
Лучшие открытые LLM для кодинга в 2026 делятся на 2 группы: датацентровые модели вроде DeepSeek V4.1 Flash и Kimi K3 с фронтирными результатами, но требующие серьёзного железа, и модели до 120B параметров, вроде Qwen3.8-27B и Laguna S 2.1, которые можно запускать на своей машине.
«Открытые веса» здесь значит, что веса доступны для скачивания. Лицензии — от MIT и Apache 2.0 до кастомных.
5. DeepSeek V4.1 Flash (DeepSeek)
DeepSeek V4.1 Flash — релиз DeepSeek от 10 сентября 2026, и несмотря на слово Flash, это теперь первая модель DeepSeek, к которой я бы обратился. DeepSeek заявляет, что она превосходит их флагман V4 Pro 0813 по качеству, цене, скорости и времени завершения задач. Независимый индекс Vals AI согласуется, ставя её топовой среди открытых весов с 57,9% против 52,4% у V4 Pro 0813 в августе.
Это MoE-модель на 552B параметров с около 8B активными на вход и 16B на выход, контекстом 1M токенов, нативным входом изображений и MIT-лицензией весов. DeepSeek сообщает 90,6% на Terminal-Bench 2.1 и 74,2% на DeepSWE v1.1 — высшие вендорские цифры среди открытых. Собственный прогон Vals AI на Terminal-Bench 2.1 менее щедр — 74,5%, второе место среди открытых.
Подробнее — в нашем обзоре DeepSeek V4.1 Flash.
Ключевые особенности:
- Цены API на странице DeepSeek: $0,15 за миллион входных и $0,60 за миллион выходных токенов вне пиков, удваиваются до $0,30 и $1,20 в пике по будням (01:00–04:00 и 06:00–10:00 UTC). Попадание в кэш — $0,003 за миллион вне пика.
- Отдаётся как
deepseek-flashпо OpenAI-совместимому API, так что скриптask_coding_model.pyниже заработает после смены base URL. - KV-кэш примерно четверти размера V4 Flash — так DeepSeek добился низкой цены на длинный контекст.
Лучше всего подходит: фронтирный терминальный кодинг за копейки и пакетные задачи, которые можно пускать вне пиков.
Компромисс: 31,2% на Terminal-Bench 4.0 в отчёте самого DeepSeek — самые сложные длинногоризонтные агентные задачи всё ещё за фронтир-лабами. Чекпоинт — около 510 ГБ, так что «открытые веса» тут — это сервер с несколькими GPU. Если вы на V4 Pro 0813, DeepSeek объявлял, что 14 сентября переведёт тот маршрут на V4.1 Flash, затем передумал, и V4 Pro пока отдают по $0,66/$1,98 вне пика до особого уведомления.
6. Kimi K3 (Moonshot AI)
Kimi K3 — флагман Moonshot AI на 2,8 трлн параметров с открытыми весами, релиз июль 2026, показывает 88,3% на Terminal-Bench 2.1 — второе место среди открытых после заявленных 90,6% у DeepSeek V4.1 Flash.
Карточка на Hugging Face указывает 104B активных параметров среди 896 экспертов (16 маршрутизируемых + 2 общих на токен), контекст 1 048 576 токенов и веса MXFP4. Vals AI измерил 93,4% на SWE-bench Verified.
Ключевые особенности:
- Контекст 1M токенов с нативным зрением.
- Лицензия Kimi K3 — кастомная, а не MIT/Apache; читайте перед коммерческим использованием.
- Рекомендованные стеки инференса — vLLM, SGLang и TokenSpeed; Moonshot откалибровал часть GPU-задач оценки под H20.
Лучше всего подходит: тем, кому нужен самый сильный открытый агентный кодер.
Компромисс: почти фронтирная мощность — только в масштабе датацентра. Разрыв в 3 пункта до Fable 5.1 на Terminal-Bench 2.1 выглядит небольшим, но это не одно и то же: у Moonshot 88,3% в собственной обвязке Kimi Code, у Fable 91,4% — по прогону Artificial Analysis в Terminus 2. На практике вы арендуете хостинг или поднимаете кластер, плюс кастомная лицензия — согласуйте с юристами.
7. Qwen3.8-27B (Alibaba)
Qwen3.8-27B — плотная модель на 27B параметров, релиз август 2026 под Apache 2.0, лучшая LLM для кодинга, которую можно запустить на одном GPU 24 ГБ.
Карточка модели сообщает 61,7% на SWE-bench Pro, 73,0% на Terminal-Bench 2.1, 90,3% на LiveCodeBench v6 и 42,2% на DeepSWE 1.1, с нативным контекстом 262 144 токена, расширяемым до 1M с YaRN. Эти показатели SWE-bench Pro и Terminal-Bench превосходят Laguna S 2.1 — модель в 4 раза больше — и превосходят Gemini 3.1 Pro по SWE-bench Pro. Правда, Qwen гонял SWE-bench Pro на своём исправленном наборе задач, так что межлабораторные сравнения — скорее ориентир.
Ключевые особенности:
- Сообщество предлагает UD-Q4_K_M GGUF от Unsloth — это один файл 16,5 ГБ, что оставляет место для контекста 32K на карте 24 ГБ. UD-Q4_K_XL — 17,6 ГБ.
- Плотная архитектура: медленнее по токену, чем MoE с 3B активных, но заметно стабильнее на многофайловых правках.
- Apache 2.0 — без ограничений на коммерческое использование.
Лучше всего подходит: тем, кто не может отправлять код во внешний API; соло-практикам с одним RTX-классом; всем, кто хочет локально сравнить с Claude на своём репозитории перед оплатой облака.
Компромисс: 73,0% против 91,4% на Terminal-Bench 2.1 — всё ещё разрыв в 18 пунктов, и это выливается в большее число ретраев на длинных агентных задачах.
8. Laguna S 2.1 (Poolside)
Laguna S 2.1 — кодинговая MoE-модель Poolside на 118B параметров с 8B активными, релиз 21 июля 2026, открытый выбор для Mac Studio, DGX Spark или рабочей станции с несколькими GPU.
В посте запуска Poolside сообщает 59,4% на публичном сете SWE-bench Pro, 70,2% на Terminal-Bench 2.1 с включённым «мышлением» (60,4% с выключенным), 78,5% на SWE-bench Multilingual и 40,4% на DeepSWE.
Модель обучали на 409 000 окружений, включая 83 000 терминальных задач и 168 000 инженерных пайплайнов, на 4 096 H200 менее чем за 9 недель.
Ключевые особенности:
- Контекст 1M токенов — необычно для такого размера.
- Лицензия OpenMDW-1.1 — либеральная, но юристам стоит прочесть.
- Режим «мышления» включён по умолчанию и даёт около +10 пунктов на Terminal-Bench 2.1; средняя длина завершения в прогонах Poolside — от ~23K до ~249K токенов на задачу — закладывайте бюджет.
Лучше всего подходит: командам, которым нужен локальный агент à la Claude Code на машине с 96–128 ГБ объединённой памяти, и репозиториям, которым нужен локальный контекст 1M.
Компромисс: 118B параметров в 4 бита — это примерно 60–70 ГБ весов до выделения KV-кэша, так что 24 ГБ GPU не подойдёт. По «сырым» баллам Qwen3.8-27B чуть сильнее, но у Laguna 8B активных — она значительно быстрее, когда веса помещаются, а это и есть смысл ночного агента.
9. Qwen3-Coder-Next (Alibaba)
Qwen3-Coder-Next — MoE на 80B параметров, активирует лишь 3B на токен, релиз 3 февраля 2026 под Apache 2.0; самый быстрый полезный локальный кодер для железа, которое не тянет плотные 27B на скорости.
Карточка модели сообщает 70,6% на SWE-bench Verified, 44,3% на SWE-bench Pro и 36,2% на Terminal-Bench 2.0, с 512 экспертами (10 активных + 1 общий) и контекстом 262 144 токена. Работает только в режиме без «мышления».
Ключевые особенности:
- Официальный Q4_K_M GGUF весит около 48 ГБ — под 64-ГБ Mac или CPU-offload лучше, чем под одиночный потребительский GPU.
- Гибридное внимание (3 слоя Gated DeltaNet на слой стандартного внимания) держит память на длинном контексте низкой.
- Поддерживается vLLM, SGLang, Ollama, LM Studio, MLX-LM, llama.cpp и KTransformers (по карточке).
Лучше всего подходит: длинные ночные задачи, где важнее токенов в секунду, чем пиковая точность, и ноутбуки с 64 ГБ объединённой памяти.
Компромисс: 44,3% на SWE-bench Pro — на 17 пунктов ниже Qwen3.8-27B, так что для одного сложного бага лучше взять плотную модель.
Другие открытые модели, на которые стоит посмотреть
Ещё четыре модели почти попали в список, и две из них могут подойти отдельным командам лучше моих выборов:
- DeepSeek V4 Pro 0813 (DeepSeek): 1,6T всего, 49B активных, контекст 1M, MIT, 96,4% на архивированном SWE-bench Verified у Vals AI. По-прежнему отдаётся по $0,66 за ввод и $1,98 за вывод вне пика, но Vals измерил 54,7% на Terminal-Bench 2.1 против 87,9% у DeepSeek; теперь DeepSeek рекомендует V4.1 Flash. Наш разбор DeepSeek V4 — об архитектуре.
- Kimi K2.6 (Moonshot): 1T всего, 32B активных, контекст 256K, модифицированная MIT, 80,2% SWE-bench Verified, 58,6% SWE-bench Pro и 89,6% LiveCodeBench v6. Самая «чистая» лицензия среди триллионных моделей после MIT у DeepSeek V4 Pro.
- MiniMax M3: 428B всего, 23B активных, контекст 1M, нативный вход изображений и видео, 80,5% SWE-bench Verified и 59% SWE-bench Pro. Открытый выбор, если задачи смешивают код и скриншоты.
- Qwen3.8-Flash-Next: 125B всего с 6B активных, 62,5% SWE-bench Pro и 58,7% DeepSWE, лицензия qwen-community-1.0 (более ограничительная). Сильнее Qwen3.8-27B на DeepSWE, но из-за лицензии не попал в мой топ-9.
Если один из этих открытых вариантов подходит под ваше железо, в следующем разделе — как его запустить.
Как запустить открытую модель для кодинга локально?
Локальный запуск открытой модели для кодинга — 3 шага: скачать квантованный чекпоинт, поднять его за OpenAI-совместимым эндпоинтом и направить туда клиент или кодинг-ассистент. В примере возьму Qwen3.8-27B — её проще всего уместить на потребительском железе.
Сначала — скачивание. Библиотека huggingface_hub поддерживает возобновляемые загрузки и кэширование — удобно для больших файлов:
"""Download a quantized coding model from Hugging Face.
Qwen3.8-27B at UD-Q4_K_M is a single 16.5 GB file, which leaves room for
a 32K context on a 24 GB GPU. Swap FILENAME for the UD-Q4_K_XL build if you
have the extra 1 GB to spare.
"""
from huggingface_hub import hf_hub_download
REPO_ID = "unsloth/Qwen3.8-27B-GGUF"
FILENAME = "Qwen3.8-27B-UD-Q4_K_M.gguf"
def fetch(repo_id: str = REPO_ID, filename: str = FILENAME) -> str:
"""Download one file from the Hub and return its local path."""
path = hf_hub_download(repo_id=repo_id, filename=filename)
print(f"Saved to {path}")
return path
if __name__ == "__main__":
fetch()
Сохраните как download_gguf.py и запустите uv run --with huggingface_hub python download_gguf.py. В Windows увидите предупреждение о симлинках, если не включён Режим разработчика.
Второе — сервис.
Любой из llama-server в llama.cpp, LM Studio или Ollama поднимет OpenAI-совместимый эндпоинт /v1. В llama.cpp это одна команда, и решают 2 флага: -ngl 99 выносит все слои на GPU, а -c 32768 задаёт контекст 32K.
llama-server -m Qwen3.8-27B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080
Третье — клиент. Я держу по скрипту на каждую модель (локальную или хостед) и переключаю цели тремя переменными окружения. Один и тот же файл говорит с локальным сервером выше, с API DeepSeek или с OpenAI:
"""Send one coding prompt to any OpenAI-compatible endpoint.
The same script talks to a local llama.cpp or vLLM server, to DeepSeek's
API, or to OpenAI itself. Only three environment variables change:
LLM_BASE_URL e.g. http://localhost:8080/v1 or https://api.deepseek.com
LLM_MODEL e.g. qwen3.8-27b or deepseek-flash
LLM_API_KEY anything non-empty for a local server
"""
import os
from openai import OpenAI
PROMPT = (
"Write a Python function top_n(df, col, n) that returns the n largest "
"rows of a pandas DataFrame by column col, with a docstring and a "
"ValueError if col is missing."
)
def ask(prompt: str = PROMPT) -> str:
"""Return the model's reply for a single-turn coding request."""
client = OpenAI(
base_url=os.environ["LLM_BASE_URL"],
api_key=os.environ.get("LLM_API_KEY", "local"),
)
response = client.chat.completions.create(
model=os.environ["LLM_MODEL"],
messages=[{"role": "user", "content": prompt}],
temperature=0.2, # keep code generation close to deterministic
)
return response.choices[0].message.content
if __name__ == "__main__":
print(ask())
Сохраните как ask_coding_model.py и запустите с LLM_BASE_URL=http://localhost:8080/v1 LLM_MODEL=qwen3.8-27b uv run --with openai python ask_coding_model.py.
Если дальше вы подключаете несколько таких эндпоинтов в приложение с роутингом, ретраями и tool calls, наш курс разработка LLM-приложений с LangChain покрывает абстракции, которые спасают от груды if.
Как выбрать лучшую LLM для кодинга?
Выбор лучшей LLM для кодинга упирается в 4 ограничения: может ли ваш код покидать машину, сколько у вас памяти, сколько вы готовы платить за миллион выходных токенов и сколько контекста требует одна задача. Таблица ниже ставит 9 ранжированных моделей рядом по главным для меня числам, а затем — гид по выбору.
| Model | Type | Terminal-Bench 2.1 | SWE-bench Pro | Context | Price (per 1M output) or memory | Best for |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 | Cloud | 87.6% (Vals AI) | 89.9% | 1M | $20 | Default for most coding work |
| Claude Fable 5.1 | Cloud | 91.4% (Artificial Analysis) | 81.2% | 1M | $50 | Longest-horizon agentic work |
| GPT-6 Astra | Cloud | Not published (58.2% tbench.ai / 59.6% Artificial Analysis on Terminal-Bench 4.0) | Not published | 1.05M | $50 | Codex users, frontier science tasks |
| Gemini 3.8 Flash | Cloud | 89.4% | 61.6% | 1M | $3.75 through 2026 | High-volume, cost-sensitive agents |
| DeepSeek V4.1 Flash | Open (MIT) | 90.6% (vendor); 74.5% (Vals AI) | Not published | 1M | $0.60 off-peak | Cheapest capable open weights via API |
| Kimi K3 | Open (custom) | 88.3% (Kimi Code harness) | Not published | 1M | 2.8T params, cluster only | Strongest self-hosted agent |
| Qwen3.8-27B | Open (Apache 2.0) | 73.0% | 61.7% | 262K | 16.5 GB at UD-Q4_K_M | Single 24 GB GPU |
| Laguna S 2.1 | Open (OpenMDW-1.1) | 70.2% | 59.4% | 1M | 60 to 70 GB at Q4 | 128 GB workstation, local agents |
| Qwen3-Coder-Next | Open (Apache 2.0) | 36.2% (2.0) | 44.3% | 262K | About 48 GB at Q4 | Fast local model, 64 GB Mac |
Гид по выбору
Вот как я сопоставляю 4 ограничения и рекомендации:
- Агентные пайплайны, где корректность важнее цены: Claude Opus 5.5 на high или xhigh, с Fable 5.1 «на подхвате» для длинных задач, где ваши эвалы показывают, что Opus 5.5 не дотягивает.
- Ежедневный AI-кодинг по разумной цене: сначала Claude Opus 5.5 на дефолтном medium, вторым — GPT-6 Sol, если живёте в Codex.
- Фронтирная наука, симуляции, GPU-ядра: GPT-6 Astra или Claude Opus 5.5. Astra лидирует на Terminal-Bench-Science, Opus 5.5 — на Terminal-Bench 4.0.
- Огромный кодбейс, 1M-контекст, жёсткий бюджет: Gemini 3.8 Flash по цене, Opus 5.5 — когда ответы Flash начинают «плыть».
- Открытые веса через API: DeepSeek V4.1 Flash вне пиков.
- Локально и приватно на одном GPU 24 ГБ: Qwen3.8-27B в UD-Q4_K_M.
- Локально и приватно на машине 96–128 ГБ: Laguna S 2.1, или Kimi K3, если «машина» = «кластер».
- Локально и быстро на ноутбуке 64 ГБ: Qwen3-Coder-Next.
Если нужен более общий фреймворк подбора модели под приложение (включая хостинг и лицензии), смотрите наш гид как выбрать лучшую LLM для вашего приложения.
И какую бы модель вы ни выбрали, навыки, которые приносят пользу, одинаковы: наш трек «ИИ для разработки ПО» и курс AI-кодинг для разработчиков учат промптингу, тестированию и ревью — тем привычкам, которые превращают 91% на бенчмарке в слитый pull request.
Итоги
Claude Opus 5.5 — лучшая LLM для кодинга в сентябре 2026 и, что необычно, та, которую стоит поставить в счёт вашей команды. Claude Fable 5.1 — путь эскалации для самых длинных задач, а Qwen3.8-27B — открытая модель, превращающая GPU 24 ГБ в приватного кодинг-ассистента, который обходит прошлогодний фронтир на SWE-bench Pro. Остальное — вопрос ограничений, и гид выше — как я бы их разрешал.
Более крупный сдвиг в том, что бенчмарк, определявший категорию 2 года — SWE-bench Verified — перестал иметь значение в те же 12 месяцев, когда открытые веса его догнали.
Это не совпадение.
Когда Opus 5 и DeepSeek V4 Pro разделяют 0,6 пункта на насыщенном тесте, а модель за $20 за миллион теперь обходит собственную $50-модель Anthropic на SWE-bench Pro, ценность сместилась к дизайну обвязки, бюджетам усилия и вашим собственным эвалам на репозитории — именно к той работе, которую таблица вендора за вас не сделает.
Так и сделайте. Возьмите скрипт ask_coding_model.py, направьте его на 2–3 из этих моделей, прогоните на 20 реальных тикетах из вашего бэклога на том effort, за который вы реально заплатите, и позвольте этому результату переиграть всё, что я здесь написал. Если «vibe coding» вам ближе, чем обвязки для оценок, наш материал что такое vibe coding и где он ломается честно разбирает компромиссы — и те же рейтинги моделей к нему применимы.
FAQs
Что такое SWE-bench Verified и почему он важен для оценки LLM для кодинга?
SWE-bench Verified — это подмножество из 500 задач SWE-bench, в котором аннотаторы подтвердили, что каждый GitHub-issue решаем, а тесты — корректны; модель должна выдать патч, проходящий скрытые тесты. Он был важен как первый широко признанный тест починки реальных репозиториев, а не написания «игрушечных» функций. В 2026 году топовые модели набирают на нём выше 96%, поэтому для различия я использую SWE-bench Pro и Terminal-Bench.
Могут ли модели с открытыми весами конкурировать с Claude и GPT в реальных задачах кодинга в 2026 году?
Да, на старых бенчмарках — и почти на агентных. Kimi K3 набирает 88,3%, а DeepSeek V4 Pro 0813 — 87,9% на Terminal-Bench 2.1, против 91,4% у Claude Fable 5.1, а Vals AI измерил отставание DeepSeek от Opus 5 на SWE-bench Verified всего на 0,6 пункта. Подвох — в размере: у этих открытых моделей 1,6–2,8 трлн параметров, так что «открыто» здесь значит «дёшево через API», а не «запускается на моём ноутбуке».
Какая LLM лучше для кодинга, если я не могу делиться кодом с внешним API?
Qwen3.8-27B — лучший выбор на одном GPU 24 ГБ, с 73,0% на Terminal-Bench 2.1 и 61,7% на SWE-bench Pro под лицензией Apache 2.0. Если у вас 96–128 ГБ объединённой памяти, Laguna S 2.1 даёт контекст 1M токенов и 8B активных параметров для быстрого локального агента. Для ноутбука 64 ГБ самые быстрые, но всё ещё полезные 3B активных — у Qwen3-Coder-Next.
В чём разница между LLM для кодинга и AI-ассистентом, таким как Cursor или GitHub Copilot?
Кодинговая LLM — это модель, которая генерирует код; кодинг-ассистент — это обвязка вокруг неё, которая читает ваши файлы, запускает команды и показывает диффы. В Cursor, Copilot, Windsurf, Claude Code и Codex можно менять базовую модель, и одна и та же модель может дать разницу в несколько пунктов в разных обвязках. Сначала выбирайте модель по бенчмаркам и цене, затем — ассистента по рабочему процессу.
Как часто меняется лучшая LLM для кодинга и как за этим следить?
Только Anthropic и OpenAI выпустили 7 фронтирных моделей между 28 мая и 24 сентября 2026 года (Opus 4.8, Fable 5, Sonnet 5, GPT-5.6, Opus 5 и 5.5, Fable 5.1 и GPT-6 Astra), так что лидер меняется каждые 4–8 недель. Следите не за постами о запуске, а за тремя независимыми досками — Artificial Analysis, Vals AI и tbench.ai — и перегоняйте свой 20-задачный тест на том effort, за который вы платите, как только выходит новая версия используемой модели.