Перейти к основному контенту

Лучшие LLM для программирования в 2026 году: 9 моделей, рейтинг

Мы оцениваем 9 лучших LLM для кодинга в сентябре 2026 года — от Claude Opus 5.5 до открытых моделей для локального запуска — по SWE-bench Pro и Terminal-Bench.
Обновлено 25 сент. 2026 г.  · 15 мин читать

Изучить с помощью AI

ChatGPTClaudePerplexity

В феврале 2025 года Claude 3.7 Sonnet показала 62,3% на SWE-bench Verified, или 70,3% с пользовательским каркасом (scaffold), тогда как лучшая на тот момент открытая модель DeepSeek-R1 заявила в своей статье 49,2%.

Разрыв составлял от 13 до 21 пунктов — в зависимости от того, насколько щедро вы подходили к скелетированию задач.

К сентябрю 2026 года независимый совет Vals AI по SWE-bench Verified зафиксировал 97,0% у Claude Opus 5 и 96,4% у открытой DeepSeek V4 Pro 0813, после чего Vals заархивировал бенчмарк как насыщенный.

Фронтир сместился к более сложным агентным оценкам, таким как SWE-bench Pro и Terminal-Bench 4.0; открытые веса догнали старые наборы, а вопрос «лучшая LLM для кодинга» превратился в «лучшая для чего, на каком железе и по какой цене».

Ниже — ответ на этот вопрос для 9 моделей, которые я действительно стал бы рассматривать сегодня. Коротко: Claude Opus 5.5 — та, с которой большинству команд стоит начать.

Примечание перед рейтингом: этот материал — о самих моделях, а не о тулзинге вокруг них. Если нужен разбор Cursor, Copilot и Windsurf, смотрите наш обзор лучших AI-ассистентов для кодинга в 2026 году.

Коротко: лучшие LLM для кодинга в сентябре 2026 года

Claude Opus 5.5 — одновременно и сильнейшая модель на большинстве бенчмарков, и та, что по умолчанию подойдёт большинству разработчиков; Claude Fable 5.1 — для задач с самым длинным горизонтом; Qwen3.8-27B — открытая модель для запуска на одном GPU. Вот лучшие варианты по назначению:

  • Лучшая в целом для агентного кодинга: Claude Opus 5.5 (Anthropic), 89,9% на SWE-bench Pro и 66,4% на Terminal-Bench 4.0, $4 за ввод и $20 за вывод на миллион токенов.
  • Лучшая для задач с самым длинным горизонтом: Claude Fable 5.1 (Anthropic), 81,2% на SWE-bench Pro и топ на Terminal-Bench 2.1 по Artificial Analysis (91,4%), $10 за ввод и $50 за вывод на миллион токенов.
  • Лучшая модель OpenAI для кодинга: GPT-6 Astra (OpenAI), первая на агентном лидерборде tbench.ai для Terminal-Bench 4.0 с 58,2% и на уровне с Opus 5.5 с 59,6% по прогону Artificial Analysis.
  • Лучшая ценность от фронтир-лаба: Gemini 3.8 Flash (Google), 89,4% на Terminal-Bench 2.1 при $0,75 за ввод и $3,75 за вывод на миллион токенов до 31 декабря 2026 года.
  • Лучшие открытые веса через API: DeepSeek V4.1 Flash, лицензия MIT, 90,6% на Terminal-Bench 2.1, $0,60 за миллион выходных токенов вне пиковых часов.
  • Лучшие открытые веса, которые нельзя запустить дома: Kimi K3 (Moonshot AI), 2,8 трлн параметров, 88,3% на Terminal-Bench 2.1.
  • Лучшая локальная модель на GPU 24 ГБ: Qwen3.8-27B (Alibaba), Apache 2.0, 73,0% на Terminal-Bench 2.1, 16,5 ГБ в UD-Q4_K_M.
  • Лучшая локальная модель для рабочей станции 128 ГБ: Laguna S 2.1 (Poolside), 118B параметров с 8B активными, контекст 1M.
  • Лучшая быстрая локальная модель для старого железа: Qwen3-Coder-Next, всего 80B, но 3B активных, 70,6% на SWE-bench Verified.

Все приведённые выше показатели — из публикаций вендоров, если не указано иное. Далее — почему именно эти модели и где у каждой границы.

Почему этот список — о моделях, а не о кодинг-ассистентах?

Кодинговая LLM — это модель, которая читает ваш промпт и пишет токены; кодинг-ассистент — это обвязка, которая подаёт ей файлы, запускает команды и показывает диффы.

Claude Code, Codex, Cursor, GitHub Copilot и Windsurf — это обвязки. Claude Opus 5.5, GPT-6 Astra и Qwen3.8-27B — модели, и обвязка меняет результат сильнее, чем многие ожидают.

У Anthropic в записи о запуске Claude Opus 4.8 это явно отмечено в сноске.

Они приводят баллы всех моделей на Terminal-Bench 2.1 в публичной обвязке Terminus-2, а затем замечают, что у GPT-5.5 показатель растёт до 83,4% внутри Codex CLI от OpenAI. Те же веса, другая «сантехника» — другой результат.

Поэтому в рейтингах ниже везде, где возможно, указана и обвязка. Если вы только знакомитесь с тем, как модели работают «под капотом», наш гид что такое LLM за 15 минут упростит чтение остального.

Какие бенчмарки действительно важны для кодинговых LLM?

В 2026 году важны SWE-bench Pro, Terminal-Bench (версии 2.1 и 4.0) и, для открытых моделей, которые ещё его публикуют, LiveCodeBench v6. SWE-bench Verified был стандартом 2 года, сейчас он перенасыщен и не разделяет топовые модели.

Прежде чем ранжировать, поясню, что значит каждая цифра в карточках моделей.

SWE-bench Verified перенасыщен

SWE-bench Verified — это набор из 500 проверенных людьми задач GitHub из популярных Python-репозиториев; модель получает репозиторий и текст issue и должна выдать патч, проходящий скрытые юнит-тесты.

OpenAI выделила Verified-подмножество в 2024 году, потому что в оригинальном SWE-bench встречались недоопределённые issues и сломанные тесты. Это до сих пор самая цитируемая метрика для кодинга — и в этом проблема.

Лидерборд Vals AI, который прогоняет все модели через одного и того же минимального bash-only агента, в обновлении от 1 сентября 2026 поставил Claude Opus 5 на 97,0%, DeepSeek V4 Pro 0813 на 96,4% и GPT-5.6 Sol на 96,2%, после чего пометил бенчмарк архивным.

Когда 3 модели из 3 лабораторий лежат в пределах одного пункта друг от друга и в 4 пунктах от потолка, метрика перестаёт различать. Я всё ещё привожу её для старших и меньших моделей, потому что это число у них на карточках, но не ранжирую по нему.

SWE-bench Pro — более сложная замена

SWE-bench Pro, поддерживаемый Scale AI, содержит 1 865 задач в 41 профессиональном репозитории, с публичным сплитом на 731 задачу и закрытыми наборами. 22 сентября 2026 года Scale выпустила SWE-bench Pro V2, сократив публичный набор до 642 задач после исключения 89 некорректных — проверяйте, на какой версии считался результат.

В среднем фикс затрагивает 107,4 строки в 4,1 файла, а репозитории покрывают несколько языков, а не только Python. Когда в сентябре 2025 вышла статья про SWE-bench Pro, лучшие модели набирали около 23%.

Год спустя в системной карточке Fable 5.1 заявлено 81,2% для Fable 5.1 и 79,2% для Opus 5, а в таблице запуска GPT-5.6 — 64,6% для GPT-5.6 Sol. Спустя три недели карточка Opus 5.5 подняла топ до 89,9%.

Это прогоны вендоров, у Anthropic усреднённые по 5 попыткам с максимальным усилием. Публичный лидерборд Scale по этим цифрам отстаёт на месяцы, поэтому я считаю вендорскую оценку потолком, а лидерборд — полом.

Terminal-Bench 2.1 и 4.0

Terminal-Bench даёт модели живую оболочку в контейнере и задачу вроде «обучите эту модель», «почините этот билд» или «восстановите этот повреждённый архив», а затем оценивает полученные артефакты.

Версия 2.1 — это 89 отобранных задач по разработке ПО, администрированию, обработке данных и безопасности; Artificial Analysis считает pass@1, усредняя по 3 прогонам в обвязке Terminus 2. Это единственная цифра, которую я сильнее всего учитываю для тех, кто строит или использует кодинговых агентов.

Terminal-Bench 4.0, размещённый Стэнфордом, Harbor и институтом Laude на tbench.ai, — новый фронтирный набор.

В карточке Opus 5.5 от Anthropic он описан как 66 задач с уклоном в вычислительную биологию, физическое моделирование, CAD, формальные доказательства и работу с производительностью на GPU, с более длинными тайм-аутами — обвязка влияет меньше.

На агентном лидерборде tbench.ai GPT-6 Astra всё ещё лидирует с 58,2%, Claude Fable 5.1 — 57,9%, но у Claude Opus 5.5 там пока нет агентной записи. На уровне моделей Artificial Analysis фиксирует паритет Opus 5.5 и Astra на 59,6%, а Vals AI ставит Opus 5.5 первым с 61,6%, хотя отмечает: если считать задачи, которые его «сейфгарды» отдали запасной модели, как провалы, то это падает до 53,5%. Здесь фронтир отделяется от остального поля.

LiveCodeBench v6 ловит запоминание

LiveCodeBench, представленный в статье Джайна и соавторов 2024 года, непрерывно собирает задачи с LeetCode, AtCoder и Codeforces, ставит на каждую временную метку, чтобы оценивать модель только на задачах, опубликованных после её среза обучения.

Актуальная версия — шестая — на публичном лидерборде. Она меряет алгоритмическое рассуждение, а не инженерные задачи уровня репозитория, поэтому полезна для собеседований и структур данных.

Фронтир-лабы в 2026 году в основном перестали её публиковать, так что цифры — по открытым моделям: превью DeepSeek V4 Pro за апрель — 93,5%, Qwen3.8-27B — 90,3%, Kimi K2.6 — 89,6%. Gemini 3.1 Pro приводит смежную метрику — LiveCodeBench Pro Elo 2 887.

Как я читаю таблицу бенчмарков от вендора

Таблица вендора — это лучший случай: их обвязка, их уровень усилия, их число прогонов. Я ищу независимую репликацию на Artificial Analysis, Vals AI или tbench.ai, прежде чем верить отрыву менее 3 пунктов.

Наш ликбез по LLM-бенчмаркам и сравнению моделей разбирает основные лидерборды, а материал что измеряет MMLU напоминает: знаниевый бенчмарк почти ничего не говорит о том, сможет ли модель починить «флапающий» тест.

Если строите свою обвязку для оценок, наш гид по метрикам и методологиям оценки LLM — первый, на который я направляю младших коллег.

С бенчмарками разобрались — далее, как 9 моделей на них выглядят, начиная с облачного фронтира.

Какие лучшие облачные фронтир-модели для кодинга?

Лучшие облачные фронтир-модели для кодинга в сентябре 2026 — Claude Opus 5.5, Claude Fable 5.1, GPT-6 Astra и Gemini 3.8 Flash; у всех около 1M токенов контекста.

Различия — в цене, уровнях усилия и том, под какие бенчмарки оптимизировал каждый лаб.

Ниже — в порядке рекомендаций команде без ограничений бюджета.

1. Claude Opus 5.5 (Anthropic)

Claude Opus 5.5 — новый флагман уровня Opus от Anthropic, релиз 22 сентября 2026, и сейчас это модель для кодинга, которую я порекомендую почти всем. Не ожидал написать это через 2 месяца после Opus 5. В посте запуска сказано, что она работает на уровне Fable 5.1 по большей части задач при себестоимости на 40% ниже Opus 5, а в обзоре моделей теперь советуют начинать с Opus 5.5 и переходить к Fable 5.1 для самых длинных задач или когда эвалы на Opus 5.5 не дотягивают.

Системная карточка Opus 5.5 сообщает 89,9% на SWE-bench Pro, 74,2% на DeepSWE v1.1 и 66,4% на Terminal-Bench 4.0 при xhigh, впереди Fable 5.1 по всем опубликованным у Anthropic строчкам для кодинга. Независимые замеры ближе: Artificial Analysis фиксирует паритет с GPT-6 Astra на 59,6% для Terminal-Bench 4.0, а Vals AI ставит его первым с 61,6% на Terminal-Bench 4.0 и 87,6% на Terminal-Bench 2.1. В обоих случаях Vals считает «сейфгард»-фолбэки; если считать их провалами, цифры падают до 53,5% и 79,8%.

Ключевые особенности:

  • $4 за миллион входных токенов и $20 за миллион выходных, на 20% ниже Opus 5; чтение из кэша подешевело на 60% — до $0,20 за миллион
  • Контекст 1M токенов, вывод 128K, адаптивное «мышление» всегда включено, дефолтный effort — medium, а не high
  • 57,8% на CursorBench 4.0 при max effort — топ на лидерборде Cursor; при medium — 52,5%, всё ещё выше Fable 5.1 на max
  • Доступна в Claude API как claude-opus-5-5, а также на Amazon Bedrock, Google Cloud и Microsoft Foundry

Лучше всего подходит: повседневный кодинг, миграции по всему коду и code review. Полностью заменяет Opus 5 по более низкой цене, а Claude Code теперь использует её как дефолтную Opus-модель. Наши гид по Claude Opus 5.5 и сравнение GPT-6 Sol и Claude Opus 5.5 — с практическими тестами.

Компромисс: экономия 40% — на дефолтном effort. На max Artificial Analysis обнаружил, что она тратит существенно больше токенов, и стоимость на задачу Intelligence Index ($5,98) почти сравнялась с Opus 5 ($5,86). Также поставляется с «фэйбловскими» сейфгардами, которые перенаправляют большинство кибербезопасностных задач на Opus 4.8; миграции кода требуют внимания — запросы с выключенным «мышлением» или принудительным tool use теперь возвращают ошибки.

2. Claude Fable 5.1 (Anthropic)

Claude Fable 5.1 — публичная версия модели класса Mythos от Anthropic, релиз 1 сентября 2026, и это модель для эскалации, когда Opus 5.5 перестаёт хватать. На странице запуска сказано, что Fable 5.1 и Claude Mythos 5.1 — одна и та же модель с разными сейфгардами.

Цифры из карточки Fable 5.1: 81,2% на SWE-bench Pro и 55,8% на Terminal-Bench 4.0. Artificial Analysis независимо измерил 91,4% на Terminal-Bench 2.1 при max effort — это до сих пор топ на том борде.

Ключевые особенности:

  • Окно контекста 1M токенов и 128K на вывод
  • Адаптивное «мышление» всегда включено
  • Чтения из prompt-кэша подешевели на 75% — до $0,25 за миллион токенов с версией 5.1; у Anthropic расчёт — до 45% экономии на агентных нагрузках
  • Сильное многодоковое планирование и более широкое рассуждение с лучшим использованием инструментов

Лучше всего подходит: продакшн-агенты, многодневные рефакторинги и любые задачи, где неправильный ответ дороже токенов — как только ваши эвалы показывают, что Opus 5.5 тут не дотягивает. Наши гид по Claude Fable 5.1 и обзор июньского релиза Fable 5 — в помощь.

Компромисс: $10 за миллион входных и $50 за миллион выходных токенов — в 2,5 раза дороже Opus 5.5, и в таблице самого Anthropic Fable 5.1 теперь уступает Opus 5.5 на SWE-bench Pro, Terminal-Bench 4.0 и CursorBench 4.0. Anthropic утверждает, что в реальности разрыв уже, чем говорят эти цифры, но бремя доказательства теперь на их стороне. На старом CursorBench 3.2.0 Fable 5.1 при medium effort показал 68,0% за $3,53 на задачу.

3. GPT-6 Astra (OpenAI)

GPT-6 Astra — фронтир-модель OpenAI, релиз 3 сентября 2026, и она всё ещё первая на агентном лидерборде tbench.ai для Terminal-Bench 4.0 с 58,2% в обвязке Codex при max effort, хотя у Opus 5.5 там пока нет агентной записи.

Страница модели указывает окно контекста 1 050 000 токенов, вывод 128 000 токенов, срез знаний 30 апреля 2026 и уровни усилия от none до max. Цена — $10 за миллион входных токенов, $1 за кэшированный вход и $50 за миллион выходных.

Материалы запуска OpenAI опираются на собственные оценки и системную карточку, а не на кросс-лабораторные бенчмарки. Оценки сильные, но я бы не назвал Astra явным победителем над Opus 5.5 или Fable 5.1. Запуск разбираем в обзоре GPT-6 Astra.

Ключевые особенности:

  • Responses API раскрывает hosted_shell, apply_patch, computer_use и tool_search — тот же набор инструментов, на котором работает Codex.
  • Кэшированный вход по $1 за миллион токенов — десятая часть базовой цены, важно для агентных циклов, перечитывающих один репозиторий.
  • Astra — первая модель OpenAI, достигшая верхнего кибербезопасностного уровня в Preparedness Framework, так что некоторые запросы, связанные с безопасностью, ограничены.

Лучше всего подходит: командам на Codex, GitHub Copilot или стеке Microsoft; задачам с уклоном в науку и инженерию; тем, кому нужна лучшая поддержка сторонних инструментов. Если хотите большую часть возможностей дешевле, GPT-6 Sol, релиз 22 сентября по $2 за ввод и $10 за вывод на миллион токенов, сменил GPT-5.6 Sol и теперь занял старую ценовую нишу Terra (поскольку GPT-6 Terra нет). По графикам OpenAI — 68,8% на DeepSWE 1.1 и 49,3% на FrontierCode, хотя GPT-5.6 Sol при max effort всё ещё выше на DeepSWE.

Компромисс: цены уровня Fable, а Opus 5.5 теперь сопоставим с Astra на Terminal-Bench 4.0 примерно за 40% стоимости на задачу по подсчётам Anthropic, при этом Artificial Analysis считает их равными. Самые явные преимущества Astra — в научных задачах: 64,6% на Terminal-Bench-Science и 65,5% на FrontierSWE v2 — обе выше, чем у Opus 5.5.

4. Gemini 3.8 Flash (Google)

Gemini 3.8 Flash — «рабочая лошадка» Google, релиз 2 сентября 2026, один из самых дешёвых способов получить агентный фронтир-результат (GPT-6 Luna дешевле по токену, но показывает ниже на агентных наборах). В отчёте об оценке у Google — 89,4% на Terminal-Bench 2.1 и 73,7% на DeepSWE v1.1 — длинногоризонтном наборе из 113 задач, где Fable 5.1 набрала 67,4%. В той же таблице Opus 5 — чуть впереди с 74,0%, Anthropic сообщает 74,2% для Opus 5.5, а в руководстве разработчика у Google — 61,6% на SWE-bench Pro.

Цены на странице Gemini API — $0,75 за миллион входных и $3,75 за миллион выходных токенов до 31 декабря 2026, затем $1,50 и $7,50 с 1 января 2027. Даже по ценам 2027 это чуть больше трети ставки вывода у Opus 5.5. Окно контекста — 1M входных токенов и 64K на вывод.

Ключевые особенности:

  • Нативный мультимодальный вход — можно дать диаграмму архитектуры или скриншот упавшего UI рядом с кодом.
  • Google позиционирует модель для высокообъёмной агентной работы и соответствующе ценообразует.
  • Есть Cyber-вариант для уязвимостей, отдельно ограниченный; см. наш обзор Gemini 3.8 Flash и Flash Cyber.

Лучше всего подходит: высокообъёмные агентные циклы, команды с жёстким бюджетом и пользователи Vertex AI. Gemini 3.1 Pro (релиз 19 февраля 2026) остаётся Pro-моделью Google с 54,2% SWE-bench Pro при $2 за ввод и $12 за вывод, но для кодинга сегодня я бы выбрал 3.8 Flash вместо 3.1 Pro.

Компромисс: 19,1% на Terminal-Bench 4.0. Flash силён в хорошо сформулированных терминальных задачах и слаб на фронтирной «науке», поэтому держите более сильную модель на подхвате для самых сложных тикетов.

С облаком всё. Дальше — модели, которые можно скачать.

Какие лучшие открытые LLM для кодинга в 2026 году?

Лучшие открытые LLM для кодинга в 2026 делятся на 2 группы: датацентровые модели вроде DeepSeek V4.1 Flash и Kimi K3 с фронтирными результатами, но требующие серьёзного железа, и модели до 120B параметров, вроде Qwen3.8-27B и Laguna S 2.1, которые можно запускать на своей машине.

«Открытые веса» здесь значит, что веса доступны для скачивания. Лицензии — от MIT и Apache 2.0 до кастомных.

5. DeepSeek V4.1 Flash (DeepSeek)

DeepSeek V4.1 Flash — релиз DeepSeek от 10 сентября 2026, и несмотря на слово Flash, это теперь первая модель DeepSeek, к которой я бы обратился. DeepSeek заявляет, что она превосходит их флагман V4 Pro 0813 по качеству, цене, скорости и времени завершения задач. Независимый индекс Vals AI согласуется, ставя её топовой среди открытых весов с 57,9% против 52,4% у V4 Pro 0813 в августе.

Это MoE-модель на 552B параметров с около 8B активными на вход и 16B на выход, контекстом 1M токенов, нативным входом изображений и MIT-лицензией весов. DeepSeek сообщает 90,6% на Terminal-Bench 2.1 и 74,2% на DeepSWE v1.1 — высшие вендорские цифры среди открытых. Собственный прогон Vals AI на Terminal-Bench 2.1 менее щедр — 74,5%, второе место среди открытых.

Подробнее — в нашем обзоре DeepSeek V4.1 Flash.

Ключевые особенности:

  • Цены API на странице DeepSeek: $0,15 за миллион входных и $0,60 за миллион выходных токенов вне пиков, удваиваются до $0,30 и $1,20 в пике по будням (01:00–04:00 и 06:00–10:00 UTC). Попадание в кэш — $0,003 за миллион вне пика.
  • Отдаётся как deepseek-flash по OpenAI-совместимому API, так что скрипт ask_coding_model.py ниже заработает после смены base URL.
  • KV-кэш примерно четверти размера V4 Flash — так DeepSeek добился низкой цены на длинный контекст.

Лучше всего подходит: фронтирный терминальный кодинг за копейки и пакетные задачи, которые можно пускать вне пиков.

Компромисс: 31,2% на Terminal-Bench 4.0 в отчёте самого DeepSeek — самые сложные длинногоризонтные агентные задачи всё ещё за фронтир-лабами. Чекпоинт — около 510 ГБ, так что «открытые веса» тут — это сервер с несколькими GPU. Если вы на V4 Pro 0813, DeepSeek объявлял, что 14 сентября переведёт тот маршрут на V4.1 Flash, затем передумал, и V4 Pro пока отдают по $0,66/$1,98 вне пика до особого уведомления.

6. Kimi K3 (Moonshot AI)

Kimi K3 — флагман Moonshot AI на 2,8 трлн параметров с открытыми весами, релиз июль 2026, показывает 88,3% на Terminal-Bench 2.1 — второе место среди открытых после заявленных 90,6% у DeepSeek V4.1 Flash.

Карточка на Hugging Face указывает 104B активных параметров среди 896 экспертов (16 маршрутизируемых + 2 общих на токен), контекст 1 048 576 токенов и веса MXFP4. Vals AI измерил 93,4% на SWE-bench Verified.

Ключевые особенности:

  • Контекст 1M токенов с нативным зрением.
  • Лицензия Kimi K3 — кастомная, а не MIT/Apache; читайте перед коммерческим использованием.
  • Рекомендованные стеки инференса — vLLM, SGLang и TokenSpeed; Moonshot откалибровал часть GPU-задач оценки под H20.

Лучше всего подходит: тем, кому нужен самый сильный открытый агентный кодер.

Компромисс: почти фронтирная мощность — только в масштабе датацентра. Разрыв в 3 пункта до Fable 5.1 на Terminal-Bench 2.1 выглядит небольшим, но это не одно и то же: у Moonshot 88,3% в собственной обвязке Kimi Code, у Fable 91,4% — по прогону Artificial Analysis в Terminus 2. На практике вы арендуете хостинг или поднимаете кластер, плюс кастомная лицензия — согласуйте с юристами.

7. Qwen3.8-27B (Alibaba)

Qwen3.8-27B — плотная модель на 27B параметров, релиз август 2026 под Apache 2.0, лучшая LLM для кодинга, которую можно запустить на одном GPU 24 ГБ.

Карточка модели сообщает 61,7% на SWE-bench Pro, 73,0% на Terminal-Bench 2.1, 90,3% на LiveCodeBench v6 и 42,2% на DeepSWE 1.1, с нативным контекстом 262 144 токена, расширяемым до 1M с YaRN. Эти показатели SWE-bench Pro и Terminal-Bench превосходят Laguna S 2.1 — модель в 4 раза больше — и превосходят Gemini 3.1 Pro по SWE-bench Pro. Правда, Qwen гонял SWE-bench Pro на своём исправленном наборе задач, так что межлабораторные сравнения — скорее ориентир.

Ключевые особенности:

  • Сообщество предлагает UD-Q4_K_M GGUF от Unsloth — это один файл 16,5 ГБ, что оставляет место для контекста 32K на карте 24 ГБ. UD-Q4_K_XL — 17,6 ГБ.
  • Плотная архитектура: медленнее по токену, чем MoE с 3B активных, но заметно стабильнее на многофайловых правках.
  • Apache 2.0 — без ограничений на коммерческое использование.

Лучше всего подходит: тем, кто не может отправлять код во внешний API; соло-практикам с одним RTX-классом; всем, кто хочет локально сравнить с Claude на своём репозитории перед оплатой облака.

Компромисс: 73,0% против 91,4% на Terminal-Bench 2.1 — всё ещё разрыв в 18 пунктов, и это выливается в большее число ретраев на длинных агентных задачах.

8. Laguna S 2.1 (Poolside)

Laguna S 2.1 — кодинговая MoE-модель Poolside на 118B параметров с 8B активными, релиз 21 июля 2026, открытый выбор для Mac Studio, DGX Spark или рабочей станции с несколькими GPU.

В посте запуска Poolside сообщает 59,4% на публичном сете SWE-bench Pro, 70,2% на Terminal-Bench 2.1 с включённым «мышлением» (60,4% с выключенным), 78,5% на SWE-bench Multilingual и 40,4% на DeepSWE.

Модель обучали на 409 000 окружений, включая 83 000 терминальных задач и 168 000 инженерных пайплайнов, на 4 096 H200 менее чем за 9 недель.

Ключевые особенности:

  • Контекст 1M токенов — необычно для такого размера.
  • Лицензия OpenMDW-1.1 — либеральная, но юристам стоит прочесть.
  • Режим «мышления» включён по умолчанию и даёт около +10 пунктов на Terminal-Bench 2.1; средняя длина завершения в прогонах Poolside — от ~23K до ~249K токенов на задачу — закладывайте бюджет.

Лучше всего подходит: командам, которым нужен локальный агент à la Claude Code на машине с 96–128 ГБ объединённой памяти, и репозиториям, которым нужен локальный контекст 1M.

Компромисс: 118B параметров в 4 бита — это примерно 60–70 ГБ весов до выделения KV-кэша, так что 24 ГБ GPU не подойдёт. По «сырым» баллам Qwen3.8-27B чуть сильнее, но у Laguna 8B активных — она значительно быстрее, когда веса помещаются, а это и есть смысл ночного агента.

9. Qwen3-Coder-Next (Alibaba)

Qwen3-Coder-Next — MoE на 80B параметров, активирует лишь 3B на токен, релиз 3 февраля 2026 под Apache 2.0; самый быстрый полезный локальный кодер для железа, которое не тянет плотные 27B на скорости.

Карточка модели сообщает 70,6% на SWE-bench Verified, 44,3% на SWE-bench Pro и 36,2% на Terminal-Bench 2.0, с 512 экспертами (10 активных + 1 общий) и контекстом 262 144 токена. Работает только в режиме без «мышления».

Ключевые особенности:

  • Официальный Q4_K_M GGUF весит около 48 ГБ — под 64-ГБ Mac или CPU-offload лучше, чем под одиночный потребительский GPU.
  • Гибридное внимание (3 слоя Gated DeltaNet на слой стандартного внимания) держит память на длинном контексте низкой.
  • Поддерживается vLLM, SGLang, Ollama, LM Studio, MLX-LM, llama.cpp и KTransformers (по карточке).

Лучше всего подходит: длинные ночные задачи, где важнее токенов в секунду, чем пиковая точность, и ноутбуки с 64 ГБ объединённой памяти.

Компромисс: 44,3% на SWE-bench Pro — на 17 пунктов ниже Qwen3.8-27B, так что для одного сложного бага лучше взять плотную модель.

Другие открытые модели, на которые стоит посмотреть

Ещё четыре модели почти попали в список, и две из них могут подойти отдельным командам лучше моих выборов:

  • DeepSeek V4 Pro 0813 (DeepSeek): 1,6T всего, 49B активных, контекст 1M, MIT, 96,4% на архивированном SWE-bench Verified у Vals AI. По-прежнему отдаётся по $0,66 за ввод и $1,98 за вывод вне пика, но Vals измерил 54,7% на Terminal-Bench 2.1 против 87,9% у DeepSeek; теперь DeepSeek рекомендует V4.1 Flash. Наш разбор DeepSeek V4 — об архитектуре.
  • Kimi K2.6 (Moonshot): 1T всего, 32B активных, контекст 256K, модифицированная MIT, 80,2% SWE-bench Verified, 58,6% SWE-bench Pro и 89,6% LiveCodeBench v6. Самая «чистая» лицензия среди триллионных моделей после MIT у DeepSeek V4 Pro.
  • MiniMax M3: 428B всего, 23B активных, контекст 1M, нативный вход изображений и видео, 80,5% SWE-bench Verified и 59% SWE-bench Pro. Открытый выбор, если задачи смешивают код и скриншоты.
  • Qwen3.8-Flash-Next: 125B всего с 6B активных, 62,5% SWE-bench Pro и 58,7% DeepSWE, лицензия qwen-community-1.0 (более ограничительная). Сильнее Qwen3.8-27B на DeepSWE, но из-за лицензии не попал в мой топ-9.

Если один из этих открытых вариантов подходит под ваше железо, в следующем разделе — как его запустить.

Как запустить открытую модель для кодинга локально?

Локальный запуск открытой модели для кодинга — 3 шага: скачать квантованный чекпоинт, поднять его за OpenAI-совместимым эндпоинтом и направить туда клиент или кодинг-ассистент. В примере возьму Qwen3.8-27B — её проще всего уместить на потребительском железе.

Сначала — скачивание. Библиотека huggingface_hub поддерживает возобновляемые загрузки и кэширование — удобно для больших файлов:

"""Download a quantized coding model from Hugging Face.
 
Qwen3.8-27B at UD-Q4_K_M is a single 16.5 GB file, which leaves room for
a 32K context on a 24 GB GPU. Swap FILENAME for the UD-Q4_K_XL build if you
have the extra 1 GB to spare.
"""
 
from huggingface_hub import hf_hub_download
 
REPO_ID = "unsloth/Qwen3.8-27B-GGUF"
FILENAME = "Qwen3.8-27B-UD-Q4_K_M.gguf"
 
 
def fetch(repo_id: str = REPO_ID, filename: str = FILENAME) -> str:
    """Download one file from the Hub and return its local path."""
    path = hf_hub_download(repo_id=repo_id, filename=filename)
    print(f"Saved to {path}")
    return path
 
 
if __name__ == "__main__":
    fetch()

Сохраните как download_gguf.py и запустите uv run --with huggingface_hub python download_gguf.py. В Windows увидите предупреждение о симлинках, если не включён Режим разработчика.

Второе — сервис.

Любой из llama-server в llama.cpp, LM Studio или Ollama поднимет OpenAI-совместимый эндпоинт /v1. В llama.cpp это одна команда, и решают 2 флага: -ngl 99 выносит все слои на GPU, а -c 32768 задаёт контекст 32K.

llama-server -m Qwen3.8-27B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080

Третье — клиент. Я держу по скрипту на каждую модель (локальную или хостед) и переключаю цели тремя переменными окружения. Один и тот же файл говорит с локальным сервером выше, с API DeepSeek или с OpenAI:

"""Send one coding prompt to any OpenAI-compatible endpoint.
 
The same script talks to a local llama.cpp or vLLM server, to DeepSeek's
API, or to OpenAI itself. Only three environment variables change:
 
    LLM_BASE_URL   e.g. http://localhost:8080/v1  or  https://api.deepseek.com
    LLM_MODEL      e.g. qwen3.8-27b  or  deepseek-flash
    LLM_API_KEY    anything non-empty for a local server
"""
 
import os
 
from openai import OpenAI
 
PROMPT = (
    "Write a Python function top_n(df, col, n) that returns the n largest "
    "rows of a pandas DataFrame by column col, with a docstring and a "
    "ValueError if col is missing."
)
 
 
def ask(prompt: str = PROMPT) -> str:
    """Return the model's reply for a single-turn coding request."""
    client = OpenAI(
        base_url=os.environ["LLM_BASE_URL"],
        api_key=os.environ.get("LLM_API_KEY", "local"),
    )
    response = client.chat.completions.create(
        model=os.environ["LLM_MODEL"],
        messages=[{"role": "user", "content": prompt}],
        temperature=0.2,  # keep code generation close to deterministic
    )
    return response.choices[0].message.content
 
 
if __name__ == "__main__":
    print(ask())

Сохраните как ask_coding_model.py и запустите с LLM_BASE_URL=http://localhost:8080/v1 LLM_MODEL=qwen3.8-27b uv run --with openai python ask_coding_model.py.

Если дальше вы подключаете несколько таких эндпоинтов в приложение с роутингом, ретраями и tool calls, наш курс разработка LLM-приложений с LangChain покрывает абстракции, которые спасают от груды if.

Как выбрать лучшую LLM для кодинга?

Выбор лучшей LLM для кодинга упирается в 4 ограничения: может ли ваш код покидать машину, сколько у вас памяти, сколько вы готовы платить за миллион выходных токенов и сколько контекста требует одна задача. Таблица ниже ставит 9 ранжированных моделей рядом по главным для меня числам, а затем — гид по выбору.

Model Type Terminal-Bench 2.1 SWE-bench Pro Context Price (per 1M output) or memory Best for
Claude Opus 5.5 Cloud 87.6% (Vals AI) 89.9% 1M $20 Default for most coding work
Claude Fable 5.1 Cloud 91.4% (Artificial Analysis) 81.2% 1M $50 Longest-horizon agentic work
GPT-6 Astra Cloud Not published (58.2% tbench.ai / 59.6% Artificial Analysis on Terminal-Bench 4.0) Not published 1.05M $50 Codex users, frontier science tasks
Gemini 3.8 Flash Cloud 89.4% 61.6% 1M $3.75 through 2026 High-volume, cost-sensitive agents
DeepSeek V4.1 Flash Open (MIT) 90.6% (vendor); 74.5% (Vals AI) Not published 1M $0.60 off-peak Cheapest capable open weights via API
Kimi K3 Open (custom) 88.3% (Kimi Code harness) Not published 1M 2.8T params, cluster only Strongest self-hosted agent
Qwen3.8-27B Open (Apache 2.0) 73.0% 61.7% 262K 16.5 GB at UD-Q4_K_M Single 24 GB GPU
Laguna S 2.1 Open (OpenMDW-1.1) 70.2% 59.4% 1M 60 to 70 GB at Q4 128 GB workstation, local agents
Qwen3-Coder-Next Open (Apache 2.0) 36.2% (2.0) 44.3% 262K About 48 GB at Q4 Fast local model, 64 GB Mac

Гид по выбору

Вот как я сопоставляю 4 ограничения и рекомендации:

  • Агентные пайплайны, где корректность важнее цены: Claude Opus 5.5 на high или xhigh, с Fable 5.1 «на подхвате» для длинных задач, где ваши эвалы показывают, что Opus 5.5 не дотягивает.
  • Ежедневный AI-кодинг по разумной цене: сначала Claude Opus 5.5 на дефолтном medium, вторым — GPT-6 Sol, если живёте в Codex.
  • Фронтирная наука, симуляции, GPU-ядра: GPT-6 Astra или Claude Opus 5.5. Astra лидирует на Terminal-Bench-Science, Opus 5.5 — на Terminal-Bench 4.0.
  • Огромный кодбейс, 1M-контекст, жёсткий бюджет: Gemini 3.8 Flash по цене, Opus 5.5 — когда ответы Flash начинают «плыть».
  • Открытые веса через API: DeepSeek V4.1 Flash вне пиков.
  • Локально и приватно на одном GPU 24 ГБ: Qwen3.8-27B в UD-Q4_K_M.
  • Локально и приватно на машине 96–128 ГБ: Laguna S 2.1, или Kimi K3, если «машина» = «кластер».
  • Локально и быстро на ноутбуке 64 ГБ: Qwen3-Coder-Next.

Если нужен более общий фреймворк подбора модели под приложение (включая хостинг и лицензии), смотрите наш гид как выбрать лучшую LLM для вашего приложения.

И какую бы модель вы ни выбрали, навыки, которые приносят пользу, одинаковы: наш трек «ИИ для разработки ПО» и курс AI-кодинг для разработчиков учат промптингу, тестированию и ревью — тем привычкам, которые превращают 91% на бенчмарке в слитый pull request.

Итоги

Claude Opus 5.5 — лучшая LLM для кодинга в сентябре 2026 и, что необычно, та, которую стоит поставить в счёт вашей команды. Claude Fable 5.1 — путь эскалации для самых длинных задач, а Qwen3.8-27B — открытая модель, превращающая GPU 24 ГБ в приватного кодинг-ассистента, который обходит прошлогодний фронтир на SWE-bench Pro. Остальное — вопрос ограничений, и гид выше — как я бы их разрешал.

Более крупный сдвиг в том, что бенчмарк, определявший категорию 2 года — SWE-bench Verified — перестал иметь значение в те же 12 месяцев, когда открытые веса его догнали.

Это не совпадение.

Когда Opus 5 и DeepSeek V4 Pro разделяют 0,6 пункта на насыщенном тесте, а модель за $20 за миллион теперь обходит собственную $50-модель Anthropic на SWE-bench Pro, ценность сместилась к дизайну обвязки, бюджетам усилия и вашим собственным эвалам на репозитории — именно к той работе, которую таблица вендора за вас не сделает.

Так и сделайте. Возьмите скрипт ask_coding_model.py, направьте его на 2–3 из этих моделей, прогоните на 20 реальных тикетах из вашего бэклога на том effort, за который вы реально заплатите, и позвольте этому результату переиграть всё, что я здесь написал. Если «vibe coding» вам ближе, чем обвязки для оценок, наш материал что такое vibe coding и где он ломается честно разбирает компромиссы — и те же рейтинги моделей к нему применимы.

FAQs

Что такое SWE-bench Verified и почему он важен для оценки LLM для кодинга?

SWE-bench Verified — это подмножество из 500 задач SWE-bench, в котором аннотаторы подтвердили, что каждый GitHub-issue решаем, а тесты — корректны; модель должна выдать патч, проходящий скрытые тесты. Он был важен как первый широко признанный тест починки реальных репозиториев, а не написания «игрушечных» функций. В 2026 году топовые модели набирают на нём выше 96%, поэтому для различия я использую SWE-bench Pro и Terminal-Bench.

Могут ли модели с открытыми весами конкурировать с Claude и GPT в реальных задачах кодинга в 2026 году?

Да, на старых бенчмарках — и почти на агентных. Kimi K3 набирает 88,3%, а DeepSeek V4 Pro 0813 — 87,9% на Terminal-Bench 2.1, против 91,4% у Claude Fable 5.1, а Vals AI измерил отставание DeepSeek от Opus 5 на SWE-bench Verified всего на 0,6 пункта. Подвох — в размере: у этих открытых моделей 1,6–2,8 трлн параметров, так что «открыто» здесь значит «дёшево через API», а не «запускается на моём ноутбуке».

Какая LLM лучше для кодинга, если я не могу делиться кодом с внешним API?

Qwen3.8-27B — лучший выбор на одном GPU 24 ГБ, с 73,0% на Terminal-Bench 2.1 и 61,7% на SWE-bench Pro под лицензией Apache 2.0. Если у вас 96–128 ГБ объединённой памяти, Laguna S 2.1 даёт контекст 1M токенов и 8B активных параметров для быстрого локального агента. Для ноутбука 64 ГБ самые быстрые, но всё ещё полезные 3B активных — у Qwen3-Coder-Next.

В чём разница между LLM для кодинга и AI-ассистентом, таким как Cursor или GitHub Copilot?

Кодинговая LLM — это модель, которая генерирует код; кодинг-ассистент — это обвязка вокруг неё, которая читает ваши файлы, запускает команды и показывает диффы. В Cursor, Copilot, Windsurf, Claude Code и Codex можно менять базовую модель, и одна и та же модель может дать разницу в несколько пунктов в разных обвязках. Сначала выбирайте модель по бенчмаркам и цене, затем — ассистента по рабочему процессу.

Как часто меняется лучшая LLM для кодинга и как за этим следить?

Только Anthropic и OpenAI выпустили 7 фронтирных моделей между 28 мая и 24 сентября 2026 года (Opus 4.8, Fable 5, Sonnet 5, GPT-5.6, Opus 5 и 5.5, Fable 5.1 и GPT-6 Astra), так что лидер меняется каждые 4–8 недель. Следите не за постами о запуске, а за тремя независимыми досками — Artificial Analysis, Vals AI и tbench.ai — и перегоняйте свой 20-задачный тест на том effort, за который вы платите, как только выходит новая версия используемой модели.

Темы
Искусственный интеллект
Большие языковые модели