Vai al contenuto principale

Il miglior LLM per programmare nel 2026: classifica di 9 modelli

Classifichiamo i 9 migliori LLM per coding di settembre 2026, da Claude Opus 5.5 ai modelli open-weight eseguibili in locale, usando SWE-bench Pro e Terminal-Bench.
Aggiornato 25 set 2026  · 15 min leggi

Esplora con l'AI

ChatGPTClaudePerplexity

A febbraio 2025, Claude 3.7 Sonnet ha ottenuto il 62,3% su SWE-bench Verified, o il 70,3% con uno scaffold personalizzato, mentre il miglior modello open-weight del momento, DeepSeek-R1, riportava nel suo paper il 49,2%.

All’epoca il distacco era tra 13 e 21 punti, a seconda di quanto fossi generoso con lo scaffolding.

A settembre 2026, l’organo indipendente Vals AI per SWE-bench Verified riporta Claude Opus 5 al 97,0% e l’open-weight DeepSeek V4 Pro 0813 al 96,4%, e Vals ha archiviato il benchmark perché diventato saturo.

Il fronte si è spostato verso valutazioni agentiche più difficili come SWE-bench Pro e Terminal-Bench 4.0, i pesi open hanno colmato il gap sui test vecchi, e la domanda "miglior LLM per programmare" è diventata "migliore per cosa, su quale hardware, a quale prezzo".

Risponderò a quella domanda per i 9 modelli che prenderei davvero in considerazione oggi, e la versione breve è che Claude Opus 5.5 è quello da cui la maggior parte dei team dovrebbe partire.

Una nota prima della classifica: questo articolo parla dei modelli in sé, non degli strumenti che li avvolgono. Se vuoi il confronto tra Cursor, Copilot e Windsurf, il nostro roundup dei migliori assistenti AI per il coding nel 2026 lo copre.

In breve: i migliori LLM per coding a settembre 2026

Claude Opus 5.5 è ora sia il modello per coding più forte sulla maggior parte dei benchmark, sia quello su cui la maggior parte degli sviluppatori dovrebbe impostare il default; Claude Fable 5.1 è quello su cui salire di livello per i lavori a orizzonte più lungo, e Qwen3.8-27B è il modello open-weight da eseguire su una sola GPU. Ecco le scelte migliori per scopo:

  • Migliore in assoluto per coding agentico: Claude Opus 5.5 (Anthropic), 89,9% SWE-bench Pro e 66,4% Terminal-Bench 4.0, a $4 input e $20 output per milione di token.
  • Migliore per lavori a orizzonte più lungo: Claude Fable 5.1 (Anthropic), 81,2% SWE-bench Pro e miglior punteggio Terminal-Bench 2.1 su Artificial Analysis (91,4%), a $10 input e $50 output per milione di token.
  • Miglior modello OpenAI per coding: GPT-6 Astra (OpenAI), primo sulla classifica agent di Terminal-Bench 4.0 di tbench.ai al 58,2%, e alla pari con Opus 5.5 al 59,6% nella run di Artificial Analysis.
  • Miglior valore da un laboratorio di frontiera: Gemini 3.8 Flash (Google), 89,4% Terminal-Bench 2.1 a $0,75 input e $3,75 output per milione di token fino al 31 dicembre 2026.
  • Migliori open weights via API: DeepSeek V4.1 Flash, licenza MIT, 90,6% Terminal-Bench 2.1, $0,60 per milione di token output in fascia off-peak.
  • Migliori open weights che non puoi eseguire a casa: Kimi K3 (Moonshot AI), 2,8 trilioni di parametri, 88,3% Terminal-Bench 2.1.
  • Miglior modello locale su una GPU da 24 GB: Qwen3.8-27B (Alibaba), Apache 2.0, 73,0% Terminal-Bench 2.1, 16,5 GB a UD-Q4_K_M.
  • Miglior modello locale per una workstation da 128 GB: Laguna S 2.1 (Poolside), 118B parametri con solo 8B attivi, contesto da 1M.
  • Miglior modello locale veloce per hardware datato: Qwen3-Coder-Next, 80B totali ma 3B attivi, 70,6% SWE-bench Verified.

Tutti i punteggi sopra sono pubblicati dai vendor salvo diversa indicazione. Il resto dell’articolo spiega come sono arrivato a queste scelte e dove ognuna mostra i suoi limiti.

Perché questa lista parla di modelli e non di coding assistant?

Un LLM per coding è il modello che legge il tuo prompt e genera token, mentre un coding assistant è l’harness che gli passa i file, esegue i suoi comandi e ti mostra i diff.

Claude Code, Codex, Cursor, GitHub Copilot e Windsurf sono harness. Claude Opus 5.5, GPT-6 Astra e Qwen3.8-27B sono modelli, e l’harness cambia il punteggio più di quanto molti si aspettino.

Il post di lancio di Claude Opus 4.8 di Anthropic lo rende concreto in una nota a piè di pagina.

Riporta il punteggio Terminal-Bench 2.1 di ogni modello sull’harness pubblico Terminus-2, poi osserva che il numero di GPT-5.5 sale all’83,4% all’interno della CLI di Codex di OpenAI. Stessi pesi, idraulica diversa, risultato diverso.

Ecco perché le classifiche sotto arrivano con l’harness allegato dove ho potuto trovarlo. Se sei alle prime armi con il funzionamento di questi modelli sotto il cofano, la nostra guida su cos’è un large language model (LLM) si legge in 15 minuti e rende il resto dell’articolo più facile da seguire.

Quali benchmark contano davvero per i coding LLM?

I benchmark che contano per i coding LLM nel 2026 sono SWE-bench Pro, Terminal-Bench (versioni 2.1 e 4.0) e, per i modelli open-weight che ancora lo riportano, LiveCodeBench v6. SWE-bench Verified è stato lo standard per 2 anni ed è ora troppo saturo per separare i top.

Prima di classificare, ecco cosa significa ogni numero nelle schede dei modelli.

SWE-bench Verified è saturo

SWE-bench Verified è un set di 500 issue GitHub convalidati da umani da repository Python popolari; il modello riceve il repository e il testo dell’issue e deve produrre una patch che superi i test nascosti.

OpenAI ha introdotto il subset Verified nel 2024 perché l’SWE-bench originale conteneva task con issue sotto-specificate o test rotti. È ancora il numero più citato per il coding, ed è proprio questo il problema.

La classifica Vals AI, che fa girare ogni modello attraverso lo stesso agente minimale solo bash, ha messo a settembre 1, 2026 Claude Opus 5 al 97,0%, DeepSeek V4 Pro 0813 al 96,4% e GPT-5.6 Sol al 96,2%, poi ha marcato il benchmark come archiviato.

Quando 3 modelli di 3 laboratori stanno entro un punto l’uno dall’altro e a 4 punti dal soffitto, la metrica ha smesso di discriminare. Lo cito ancora per i modelli più vecchi e piccoli perché è il numero riportato sulle loro schede, ma non lo uso per classificare.

SWE-bench Pro è il sostituto più difficile

SWE-bench Pro, mantenuto da Scale AI, contiene 1.865 task su 41 repository professionali, con uno split pubblico da 731 task e set privati mantenuti separati. Il 22 settembre 2026, Scale ha rilasciato SWE-Bench Pro V2, che taglia il set pubblico a 642 task dopo averne esclusi 89 ritenuti invalidi, quindi controlla su quale versione è stato eseguito un punteggio.

La correzione media tocca 107,4 righe su 4,1 file, e i repository coprono più linguaggi invece del solo Python. Quando il paper su SWE-bench Pro è uscito a settembre 2025, i migliori modelli segnavano circa il 23%.

Un anno più tardi, la system card di Fable 5.1 riporta l’81,2% per Fable 5.1 e il 79,2% per Opus 5, e la tabella di lancio di GPT-5.6 riporta il 64,6% per GPT-5.6 Sol. Tre settimane dopo la card di Fable, la system card di Opus 5.5 ha spinto il top all’89,9%.

Quelli sono run dei vendor, mediati su 5 prove a massimo sforzo nel caso di Anthropic. La classifica pubblica di Scale è in ritardo di mesi rispetto ai numeri dei vendor, quindi tratto la cifra del vendor come il soffitto e la classifica come il pavimento.

Terminal-Bench 2.1 e 4.0

Terminal-Bench dà a un modello una shell live dentro un container e un task come "addestra questo modello", "ripara questo build" o "recupera questo archivio corrotto", poi valuta gli artefatti prodotti.

La release 2.1 è composta da 89 task curati tra ingegneria del software, amministrazione di sistema, data processing e sicurezza, e Artificial Analysis la misura con l’harness Terminus 2 come pass@1 mediato su 3 run. È il singolo numero che peso di più per chi costruisce o usa agenti di coding.

Terminal-Bench 4.0, ospitato da Stanford, Harbor e il Laude Institute su tbench.ai, è il nuovo set di frontiera.

La system card di Opus 5.5 di Anthropic lo descrive come 66 task sbilanciati verso biologia computazionale, simulazione fisica, CAD, dimostrazioni formali e lavoro sulle prestazioni GPU, con timeout più lunghi cosicché l’harness conti meno.

Sulla classifica agent di tbench.ai, GPT-6 Astra è ancora in testa al 58,2% con l’harness Codex a massimo sforzo, con Claude Fable 5.1 al 57,9%, ma Claude Opus 5.5 non ha ancora una voce agent lì. Nelle run a livello di modello, Artificial Analysis ha Opus 5.5 e Astra appaiati al 59,6%, e Vals AI mette Opus 5.5 primo al 61,6%, anche se Vals nota che quella cifra scende al 53,5% se conti come fallimenti i task che le sue salvaguardie hanno passato a un modello di fallback. È qui che la frontiera si separa dal gruppo.

LiveCodeBench v6 intercetta la memorizzazione

LiveCodeBench, introdotto nel paper del 2024 di Jain e colleghi, raccoglie continuamente problemi da LeetCode, AtCoder e Codeforces e data ogni esercizio così da poter valutare un modello solo su problemi pubblicati dopo il suo cutoff di training.

La versione 6 è la finestra attuale sulla classifica pubblica. Misura il ragionamento algoritmico piuttosto che l’ingegneria a scala di repository, ed è per questo che è rimasto utile per colloqui e lavoro su strutture dati.

I laboratori di frontiera hanno in gran parte smesso di riportarlo nel 2026, quindi i numeri che ho sono dai modelli open-weight: l’anteprima di aprile DeepSeek V4 Pro al 93,5%, Qwen3.8-27B al 90,3% e Kimi K2.6 all’89,6%. Gemini 3.1 Pro riporta una metrica correlata, un LiveCodeBench Pro Elo di 2.887.

Come leggo una tabella benchmark di un vendor

Una tabella benchmark di un vendor è un caso migliore: il suo harness, la sua impostazione di sforzo, il suo numero di prove. Cerco una replica indipendente su Artificial Analysis, Vals AI o sulla classifica tbench.ai prima di credere a un gap inferiore a 3 punti.

La nostra introduzione ai benchmark LLM e come confrontare i modelli illustra le principali classifiche, e il nostro pezzo su cosa misura MMLU è un buon promemoria che un benchmark di conoscenza ti dice ben poco se un modello sa correggere un test flaky.

Per costruire un tuo harness di valutazione, la nostra guida a metriche e metodologie di valutazione LLM è quella che indico per prima ai colleghi junior.

Definiti questi benchmark, ecco come i 9 modelli vi ottengono punteggi, a partire dalla frontiera cloud.

Quali sono i migliori modelli cloud di frontiera per il coding?

I migliori modelli cloud di frontiera per il coding a settembre 2026 sono Claude Opus 5.5, Claude Fable 5.1, GPT-6 Astra e Gemini 3.8 Flash, e tutti e 4 offrono una finestra di contesto di circa 1M token.

Le differenze sono prezzo, impostazioni di sforzo e a quale benchmark ciascun laboratorio ha ottimizzato.

Li elenco nell’ordine in cui li consiglierei a un team che può permetterseli tutti.

1. Claude Opus 5.5 (Anthropic)

Claude Opus 5.5 è il nuovo flagship di fascia Opus di Anthropic, rilasciato il 22 settembre 2026, ed è ora il modello per coding che consiglierei quasi a tutti. Non mi aspettavo di scriverlo 2 mesi dopo Opus 5. Il post di lancio di Anthropic afferma che performa al livello di Fable 5.1 sulla maggior parte dei lavori pur costando il 40% in meno da eseguire rispetto a Opus 5, e la sua panoramica modelli dice ora agli sviluppatori di iniziare con Opus 5.5 e passare a Fable 5.1 per lavori a lungo orizzonte o quando le eval su Opus 5.5 non bastano.

La system card di Opus 5.5 riporta l’89,9% su SWE-bench Pro, il 74,2% su DeepSWE v1.1 e il 66,4% su Terminal-Bench 4.0 a sforzo xhigh, davanti a Fable 5.1 in ogni riga di coding pubblicata da Anthropic. I numeri indipendenti sono più vicini: Artificial Analysis lo ha alla pari con GPT-6 Astra al 59,6% su Terminal-Bench 4.0, e Vals AI lo mette primo al 61,6% su Terminal-Bench 4.0 e all’87,6% su Terminal-Bench 2.1. Entrambi i numeri Vals includono fallback di salvaguardia; contarli come fallimenti li porta al 53,5% e 79,8%.

Caratteristiche chiave:

  • $4 per milione di token in input e $20 per milione in output, 20% sotto Opus 5, con letture cache giù del 60% a $0,20 per milione
  • Contesto da 1M di token, 128K in output, pensiero adattivo che non può essere disattivato, e sforzo predefinito medium invece di high
  • 57,8% su CursorBench 4.0 a sforzo massimo, miglior punteggio sulla classifica di Cursor; a medium segna 52,5%, ancora sopra Fable 5.1 a massimo
  • Disponibile sulla Claude API come claude-opus-5-5, oltre che su Amazon Bedrock, Google Cloud e Microsoft Foundry

Ideale per: coding quotidiano, migrazioni a livello di codebase e code review. Sostituisce direttamente Opus 5 a un prezzo inferiore, e Claude Code ora lo usa come modello Opus di default. La nostra guida a Claude Opus 5.5 copre il lancio, e il nostro confronto GPT-6 Sol vs Claude Opus 5.5 include un test pratico.

Compromesso: il risparmio del 40% si applica a sforzo predefinito. A sforzo massimo, Artificial Analysis ha riscontrato che usa molti più token di Opus 5, quindi il costo per task dell’Intelligence Index ($5,98) è finito quasi al livello di quello di Opus 5 ($5,86). Inoltre, viene fornito con salvaguardie in stile Fable che instradano la maggior parte dei task di cybersecurity a Opus 4.8, e le migrazioni di codice richiedono attenzione, perché richieste con pensiero disattivato o uso strumenti forzato ora restituiscono errori.

2. Claude Fable 5.1 (Anthropic)

Claude Fable 5.1 è la versione pubblicamente disponibile del modello di classe Mythos di Anthropic, rilasciata il 1° settembre 2026, ed è il modello a cui passo quando Opus 5.5 finisce la strada. La pagina di lancio di Anthropic afferma che Fable 5.1 e Claude Mythos 5.1 sono lo stesso modello con salvaguardie diverse.

I numeri dalla system card di Fable 5.1 sono 81,2% su SWE-bench Pro e 55,8% su Terminal-Bench 4.0. Artificial Analysis ha misurato in modo indipendente il 91,4% su Terminal-Bench 2.1 a sforzo massimo, ancora il punteggio più alto su quella board.

Caratteristiche chiave:

  • Finestra di contesto da 1M di token e 128K token di output
  • Il pensiero adattivo è sempre attivo
  • Le letture della prompt-cache sono scese del 75% a $0,25 per milione di token con la 5.1, che Anthropic stima riduca i carichi agentici fino al 45%
  • Robusta pianificazione multi-file e pensiero più ampio con migliore uso degli strumenti

Ideale per: pipeline agentiche in produzione, refactor multi-day e qualsiasi task in cui una risposta sbagliata costa più dei token, una volta che le tue eval mostrano che Opus 5.5 non basta. La nostra guida a Claude Fable 5.1 copre questo rilascio, e la nostra panoramica di Claude Fable 5 copre l’originale di giugno.

Compromesso: $10 per milione di token in input e $50 per milione in output è 2,5 volte la tariffa di Opus 5.5, e sulla stessa tabella di Anthropic Fable 5.1 ora è dietro a Opus 5.5 su SWE-bench Pro, Terminal-Bench 4.0 e CursorBench 4.0. Anthropic dice che il gap nel mondo reale è più stretto di quanto suggeriscano quei punteggi, ma l’onere della prova si è ribaltato. Sul più vecchio CursorBench 3.2.0, Fable 5.1 a sforzo medio ha segnato 68,0% per $3,53 per task.

3. GPT-6 Astra (OpenAI)

GPT-6 Astra è il modello di frontiera di OpenAI, rilasciato il 3 settembre 2026, e siede ancora primo sulla classifica agent di Terminal-Bench 4.0 di tbench.ai al 58,2% con l’harness Codex a sforzo massimo, anche se Opus 5.5 non ha ancora una voce agent lì.

La pagina del modello elenca una finestra di contesto da 1.050.000 token, 128.000 token di output, un cutoff di conoscenza al 30 aprile 2026 e livelli di sforzo da none a max. I prezzi sono $10 per milione di token in input, $1 per input in cache e $50 per milione di token in output.

I materiali di lancio di OpenAI puntano sulle proprie valutazioni e sulla system card più che sui benchmark cross-lab. Le loro valutazioni sono solide, ma non definirei Astra un vincitore netto su Opus 5.5 o Fable 5.1. Copriamo i numeri di lancio nella nostra panoramica di GPT-6 Astra.

Caratteristiche chiave:

  • La Responses API espone hosted_shell, apply_patch, computer_use e tool_search, ossia il set di strumenti su cui gira lo stesso Codex.
  • Input in cache a $1 per milione di token, un decimo del prezzo base, che conta per i loop agent che rileggono lo stesso repository.
  • Astra è il primo modello OpenAI a raggiungere il top tier cybersecurity del suo Preparedness Framework, quindi alcuni prompt adiacenti alla sicurezza sono regolati.

Ideale per: team già su Codex, GitHub Copilot o stack Microsoft, task ricchi di scienza e ingegneria, e chiunque abbia bisogno di migliore supporto a tool di terze parti. Se vuoi gran parte delle capacità a meno, GPT-6 Sol, rilasciato il 22 settembre a $2 input e $10 output per milione di token, succede a GPT-5.6 Sol, e senza GPT-6 Terra ora copre la vecchia fascia di prezzo di Terra. Sui grafici di OpenAI segna 68,8% su DeepSWE 1.1 e 49,3% su FrontierCode, anche se GPT-5.6 Sol a sforzo massimo segna ancora di più su DeepSWE.

Compromesso: prezzi da fascia Fable, e Opus 5.5 ora eguaglia Astra su Terminal-Bench 4.0 a circa il 40% del costo per task secondo i conteggi di Anthropic, con Artificial Analysis che li misura alla pari. I vantaggi più chiari di Astra sono nei lavori heavy-science, con 64,6% su Terminal-Bench-Science e 65,5% su FrontierSWE v2, entrambi sopra Opus 5.5.

4. Gemini 3.8 Flash (Google)

Gemini 3.8 Flash è il modello da lavoro di Google, rilasciato il 2 settembre 2026, e uno dei modi più economici per ottenere un punteggio agentico di frontiera (GPT-6 Luna costa meno per token, ma segna meno sui test agentici). Il rapporto di valutazione di Google mostra l’89,4% su Terminal-Bench 2.1 e il 73,7% su DeepSWE v1.1, una suite a lungo orizzonte da 113 task dove Fable 5.1 ha segnato 67,4%. La stessa tabella ha Opus 5 leggermente avanti al 74,0%, Anthropic riporta 74,2% per Opus 5.5, e la guida per sviluppatori di Google aggiunge 61,6% su SWE-bench Pro.

I prezzi sulla pagina pricing della Gemini API sono $0,75 per milione di token in input e $3,75 per milione di output fino al 31 dicembre 2026, poi $1,50 e $7,50 dal 1° gennaio 2027. Anche al prezzo 2027, è poco più di un terzo della tariffa output di Opus 5.5. La finestra di contesto è 1M in input con 64K in output.

Caratteristiche chiave:

  • Input multimodale nativo, così puoi passargli un diagramma architetturale o uno screenshot di una UI fallita accanto al codice.
  • Google lo posiziona come il modello per lavoro agentico ad alto volume e lo prezza di conseguenza.
  • Esiste una variante Cyber per il lavoro sulle vulnerabilità, regolata separatamente, che copriamo nella nostra panoramica su Gemini 3.8 Flash e Flash Cyber.

Ideale per: loop agent ad alto volume, team sensibili ai costi e realtà su Vertex AI. Gemini 3.1 Pro, rilasciato il 19 febbraio 2026, resta il modello di fascia Pro di Google con 54,2% su SWE-bench Pro a $2 input e $12 output per milione di token, ma per il coding oggi sceglierei 3.8 Flash rispetto a 3.1 Pro.

Compromesso: 19,1% su Terminal-Bench 4.0. Flash è forte sui lavori da terminal ben delimitati e debole sui task scientifici di frontiera, quindi tieni un modello più forte a portata per i ticket più duri.

Coperti i modelli cloud, il resto della lista sono modelli che puoi scaricare.

Quali sono i migliori LLM open-weight per coding nel 2026?

I migliori LLM open-weight per coding nel 2026 si dividono in 2 gruppi: modelli da datacenter come DeepSeek V4.1 Flash e Kimi K3 che eguagliano i punteggi di frontiera ma richiedono hardware server serio, e modelli sotto i 120B come Qwen3.8-27B e Laguna S 2.1 che puoi eseguire su hardware di tua proprietà.

"Open weight" qui significa che i pesi sono scaricabili. Le licenze reali vanno da MIT e Apache 2.0 a termini personalizzati.

5. DeepSeek V4.1 Flash (DeepSeek)

DeepSeek V4.1 Flash è il rilascio del 10 settembre 2026 di DeepSeek e, nonostante il nome Flash, è ora il modello DeepSeek a cui punterei per primo. DeepSeek afferma che batte il suo stesso V4 Pro 0813 di punta in prestazioni, costo, velocità e tempo di completamento dei task. L’indice indipendente di Vals AI va nella stessa direzione, classificandolo come il miglior open-weight al 57,9%, contro il 52,4% registrato da Vals per V4 Pro 0813 in agosto.

È un modello MoE da 552B parametri con circa 8B parametri attivi per token in input e 16B in output, contesto da 1M token, input immagine nativo e pesi con licenza MIT. DeepSeek riporta 90,6% su Terminal-Bench 2.1 e 74,2% su DeepSWE v1.1, i massimi punteggi open-weight riportati dal vendor su entrambi. La run di Vals AI su Terminal-Bench 2.1 è meno generosa al 74,5%, seconda tra gli open-weight.

Copriamo il rilascio in maggiore dettaglio nella nostra panoramica su DeepSeek V4.1 Flash.

Caratteristiche chiave:

  • I prezzi API sulla pagina pricing di DeepSeek sono $0,15 per milione di token in input e $0,60 per milione in output in off-peak, che raddoppiano a $0,30 e $1,20 durante le ore di punta feriali (01:00–04:00 e 06:00–10:00 UTC). I cache hit costano $0,003 per milione in off-peak.
  • Servito come deepseek-flash su un’API compatibile con OpenAI, quindi lo script ask_coding_model.py più avanti funziona con un cambio di base URL.
  • Una KV cache circa un quarto della dimensione di quella di V4 Flash, che è come DeepSeek prezza così basso il contesto lungo.

Ideale per: coding da terminale vicino alla frontiera a pochi centesimi, e job di codice in batch che puoi pianificare in off-peak.

Compromesso: segna 31,2% su Terminal-Bench 4.0 nel report di DeepSeek stesso, quindi il lavoro agentico più duro e a lungo orizzonte resta ai laboratori di frontiera. Il checkpoint è anche di circa 510 GB, quindi qui "open weights" significa un server multi-GPU. Se sei su V4 Pro 0813, DeepSeek aveva annunciato che avrebbe instradato quel modello a V4.1 Flash il 14 settembre, poi ha cambiato rotta, e V4 Pro è ancora servito a $0,66/$1,98 in off-peak fino a nuovo avviso.

6. Kimi K3 (Moonshot AI)

Kimi K3 è il flagship open-weight da 2,8 trilioni di parametri di Moonshot AI, rilasciato a luglio 2026, e segna 88,3% su Terminal-Bench 2.1, secondo tra i modelli open dietro al 90,6% riportato da DeepSeek V4.1 Flash.

La scheda su Hugging Face elenca 104B parametri attivi su 896 esperti (16 instradati più 2 condivisi per token), contesto da 1.048.576 token e pesi MXFP4. Vals AI ha misurato 93,4% su SWE-bench Verified.

Caratteristiche chiave:

  • Contesto da 1M token con visione nativa.
  • Distribuito sotto la Kimi K3 License, una licenza personalizzata anziché MIT o Apache, quindi leggila prima dell’uso commerciale.
  • Stack di inferenza consigliati: vLLM, SGLang e TokenSpeed, e Moonshot ha calibrato alcuni task di valutazione GPU per GPU H20.

Ideale per: chi vuole il più forte coder agentico open disponibile.

Compromesso: capacità quasi di frontiera solo in scala datacenter. Il gap di 3 punti rispetto a Fable 5.1 su Terminal-Bench 2.1 sembra vicino, ma non è like-for-like: Moonshot ha misurato 88,3% nel proprio harness Kimi Code, mentre il 91,4% di Fable viene dalle run Terminus 2 di Artificial Analysis. In pratica, lo noleggi tramite un provider hosted o gestisci un tuo cluster, più una licenza custom da chiarire prima con il legale.

7. Qwen3.8-27B (Alibaba)

Qwen3.8-27B è un modello denso da 27 miliardi di parametri rilasciato ad agosto 2026 sotto Apache 2.0, ed è il miglior LLM per coding che puoi eseguire su una singola GPU da 24 GB.

La scheda del modello riporta 61,7% su SWE-bench Pro, 73,0% su Terminal-Bench 2.1, 90,3% su LiveCodeBench v6 e 42,2% su DeepSWE 1.1, con un contesto nativo da 262.144 token estensibile a 1M con YaRN. Quei numeri di SWE-bench Pro e Terminal-Bench battono Laguna S 2.1, un modello 4 volte più grande, e superano Gemini 3.1 Pro su SWE-bench Pro. Va detto che Qwen ha eseguito SWE-bench Pro sul suo set corretto di task, quindi tratta questi confronti cross-lab come direzionali.

Caratteristiche chiave:

  • La GGUF UD-Q4_K_M della community da Unsloth è un singolo file da 16,5 GB, che lascia spazio a un contesto da 32K su una scheda da 24 GB. UD-Q4_K_XL è 17,6 GB.
  • Architettura densa, quindi è più lento per token di un MoE con 3B attivi ma molto più coerente nelle modifiche multi-file.
  • Apache 2.0, quindi nessuna restrizione d’uso per prodotti commerciali.

Ideale per: sviluppatori che non possono inviare codice a un’API esterna, professionisti singoli con una GPU classe RTX, e chiunque voglia un confronto locale vs Claude sul proprio repository prima di pagare il cloud.

Compromesso: 73,0% contro 91,4% su Terminal-Bench 2.1 è ancora un gap di 18 punti, che si manifesta in più retry sui task agentici lunghi.

8. Laguna S 2.1 (Poolside)

Laguna S 2.1 è il modello per coding MoE da 118B parametri di Poolside con 8B attivi, rilasciato il 21 luglio 2026, ed è la scelta open-weight per un Mac Studio, DGX Spark o workstation multi-GPU.

Il post di lancio di Poolside riporta 59,4% sul set pubblico di SWE-bench Pro, 70,2% su Terminal-Bench 2.1 con thinking al massimo (60,4% con thinking off), 78,5% su SWE-bench Multilingual e 40,4% su DeepSWE.

Il modello è stato addestrato su 409.000 ambienti, inclusi 83.000 task da terminal e 168.000 workflow di ingegneria del software, su 4.096 H200 in meno di 9 settimane.

Caratteristiche chiave:

  • Finestra di contesto da 1M token, insolita a queste dimensioni.
  • Licenza OpenMDW-1.1, permissiva ma da far leggere al team legale.
  • La modalità thinking è attiva per impostazione predefinita e vale circa 10 punti su Terminal-Bench 2.1; la lunghezza media di completamento variava da circa 23K a 249K token per task nelle run di Poolside, quindi mettilo a budget.

Ideale per: team che vogliono un agente locale in stile Claude Code su una macchina con 96–128 GB di memoria unificata, e repository abbastanza grandi da richiedere la finestra da 1M in locale.

Compromesso: 118B parametri a 4-bit sono circa 60–70 GB di pesi prima di allocare una KV cache, quindi una GPU da 24 GB è fuori gioco. Sui punteggi grezzi Qwen3.8-27B lo supera di poco, ma gli 8B parametri attivi di Laguna lo rendono molto più veloce una volta che i pesi entrano in memoria, che è il punto di un agente notturno.

9. Qwen3-Coder-Next (Alibaba)

Qwen3-Coder-Next è un modello MoE da 80B parametri che ne attiva solo 3B per token, rilasciato il 3 febbraio 2026 sotto Apache 2.0, ed è il coder locale più veloce e capace per hardware che non può tenere un denso 27B a velocità.

La scheda del modello riporta 70,6% su SWE-bench Verified, 44,3% su SWE-bench Pro e 36,2% su Terminal-Bench 2.0, con 512 esperti (10 attivi più 1 condiviso) e un contesto da 262.144 token. Funziona solo in modalità non-thinking.

Caratteristiche chiave:

  • La GGUF Q4_K_M ufficiale è circa 48 GB, adatta più a un Mac da 64 GB o a un setup con offload su CPU che a una singola GPU consumer.
  • Attenzione ibrida (3 layer Gated DeltaNet per ogni layer di attenzione standard) mantiene basso l’uso di memoria in contesti lunghi.
  • Supportato in vLLM, SGLang, Ollama, LM Studio, MLX-LM, llama.cpp e KTransformers, secondo la scheda.

Ideale per: task a lungo orizzonte notturni dove i token al secondo contano più dell’accuratezza di picco, e laptop con 64 GB di memoria unificata.

Compromesso: 44,3% su SWE-bench Pro è 17 punti dietro Qwen3.8-27B, quindi per un singolo bug difficile sceglierei il modello denso.

Altri modelli open-weight da considerare

Altri quattro modelli sono quasi entrati in lista, e 2 di questi potrebbero adattarsi meglio a team specifici rispetto alle mie scelte:

Se una di queste scelte open-weight si adatta al tuo hardware, la prossima sezione mostra come metterla in esecuzione.

Come eseguire in locale un modello di coding open-weight?

Eseguire in locale un modello di coding open-weight richiede 3 passaggi: scaricare un checkpoint quantizzato, servirlo dietro a un endpoint compatibile con OpenAI e puntare il tuo client o coding assistant a quell’endpoint. Userò Qwen3.8-27B in questo esempio perché è il più facile dei 9 da far entrare su hardware consumer.

Primo, il download. La libreria huggingface_hub gestisce trasferimenti riprendibili e caching, il che aiuta con questi file più grandi:

"""Download a quantized coding model from Hugging Face.
 
Qwen3.8-27B at UD-Q4_K_M is a single 16.5 GB file, which leaves room for
a 32K context on a 24 GB GPU. Swap FILENAME for the UD-Q4_K_XL build if you
have the extra 1 GB to spare.
"""
 
from huggingface_hub import hf_hub_download
 
REPO_ID = "unsloth/Qwen3.8-27B-GGUF"
FILENAME = "Qwen3.8-27B-UD-Q4_K_M.gguf"
 
 
def fetch(repo_id: str = REPO_ID, filename: str = FILENAME) -> str:
    """Download one file from the Hub and return its local path."""
    path = hf_hub_download(repo_id=repo_id, filename=filename)
    print(f"Saved to {path}")
    return path
 
 
if __name__ == "__main__":
    fetch()

Salvalo come download_gguf.py ed esegui uv run --with huggingface_hub python download_gguf.py. Su Windows vedrai un avviso sui symlink a meno che la Modalità Sviluppatore non sia attiva.

Secondo, servilo.

Qualsiasi tra llama-server di llama.cpp, LM Studio o Ollama esporrà un endpoint compatibile OpenAI su /v1. Con llama.cpp il comando è una riga, e 2 flag fanno il lavoro: -ngl 99 offloada ogni layer sulla GPU e -c 32768 imposta un contesto da 32K.

llama-server -m Qwen3.8-27B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080

Terzo, il client. Tengo uno script per ogni modello che valuto, locale o hosted, e cambio target con 3 variabili d’ambiente. Lo stesso file parla al server locale sopra, all’API di DeepSeek o a quella di OpenAI:

"""Send one coding prompt to any OpenAI-compatible endpoint.
 
The same script talks to a local llama.cpp or vLLM server, to DeepSeek's
API, or to OpenAI itself. Only three environment variables change:
 
    LLM_BASE_URL   e.g. http://localhost:8080/v1  or  https://api.deepseek.com
    LLM_MODEL      e.g. qwen3.8-27b  or  deepseek-flash
    LLM_API_KEY    anything non-empty for a local server
"""
 
import os
 
from openai import OpenAI
 
PROMPT = (
    "Write a Python function top_n(df, col, n) that returns the n largest "
    "rows of a pandas DataFrame by column col, with a docstring and a "
    "ValueError if col is missing."
)
 
 
def ask(prompt: str = PROMPT) -> str:
    """Return the model's reply for a single-turn coding request."""
    client = OpenAI(
        base_url=os.environ["LLM_BASE_URL"],
        api_key=os.environ.get("LLM_API_KEY", "local"),
    )
    response = client.chat.completions.create(
        model=os.environ["LLM_MODEL"],
        messages=[{"role": "user", "content": prompt}],
        temperature=0.2,  # keep code generation close to deterministic
    )
    return response.choices[0].message.content
 
 
if __name__ == "__main__":
    print(ask())

Salvalo come ask_coding_model.py ed eseguilo con LLM_BASE_URL=http://localhost:8080/v1 LLM_MODEL=qwen3.8-27b uv run --with openai python ask_coding_model.py.

Se poi colleghi diversi endpoint in un’applicazione con routing, retry e chiamate a tool, il nostro corso su sviluppare applicazioni LLM con LangChain copre le astrazioni che evitano di trasformare tutto in una pila di if.

Come scegliere il miglior LLM per il coding?

Scegliere il miglior LLM per coding si riduce a 4 vincoli: se il tuo codice può lasciare la tua macchina, quanta memoria hai, quanto pagherai per milione di token in output e di quanto contesto ha bisogno un singolo task. La tabella sotto mette fianco a fianco i 9 modelli classificati sui numeri in cui ho più fiducia, e la guida decisionale dopo mappa quei vincoli su una scelta.

Model Type Terminal-Bench 2.1 SWE-bench Pro Context Price (per 1M output) or memory Best for
Claude Opus 5.5 Cloud 87.6% (Vals AI) 89.9% 1M $20 Default for most coding work
Claude Fable 5.1 Cloud 91.4% (Artificial Analysis) 81.2% 1M $50 Longest-horizon agentic work
GPT-6 Astra Cloud Not published (58.2% tbench.ai / 59.6% Artificial Analysis on Terminal-Bench 4.0) Not published 1.05M $50 Codex users, frontier science tasks
Gemini 3.8 Flash Cloud 89.4% 61.6% 1M $3.75 through 2026 High-volume, cost-sensitive agents
DeepSeek V4.1 Flash Open (MIT) 90.6% (vendor); 74.5% (Vals AI) Not published 1M $0.60 off-peak Cheapest capable open weights via API
Kimi K3 Open (custom) 88.3% (Kimi Code harness) Not published 1M 2.8T params, cluster only Strongest self-hosted agent
Qwen3.8-27B Open (Apache 2.0) 73.0% 61.7% 262K 16.5 GB at UD-Q4_K_M Single 24 GB GPU
Laguna S 2.1 Open (OpenMDW-1.1) 70.2% 59.4% 1M 60 to 70 GB at Q4 128 GB workstation, local agents
Qwen3-Coder-Next Open (Apache 2.0) 36.2% (2.0) 44.3% 262K About 48 GB at Q4 Fast local model, 64 GB Mac

La guida decisionale

Ecco come mappo i 4 vincoli sulla classifica:

  • Pipeline di coding agentico dove la correttezza prevale sul costo: Claude Opus 5.5 a sforzo high o xhigh, con Fable 5.1 pronto per i task a lungo orizzonte dove le tue eval mostrano che Opus 5.5 non basta.
  • Coding quotidiano assistito dall’AI a un prezzo ragionevole: Claude Opus 5.5 al suo sforzo medium di default per primo, GPT-6 Sol secondo se vivi in Codex.
  • Scienza di frontiera, simulazione o lavoro su kernel GPU: GPT-6 Astra o Claude Opus 5.5. Astra guida su Terminal-Bench-Science, Opus 5.5 su Terminal-Bench 4.0.
  • Codebase enorme, prompt da 1M token, budget stretto: Gemini 3.8 Flash per il prezzo, Opus 5.5 quando le risposte di Flash diventano approssimative.
  • Open weights via API: DeepSeek V4.1 Flash in off-peak.
  • Locale e privato su una singola GPU da 24 GB: Qwen3.8-27B a UD-Q4_K_M.
  • Locale e privato su una macchina da 96–128 GB: Laguna S 2.1, o Kimi K3 se "macchina" significa "cluster".
  • Locale e veloce su un laptop da 64 GB: Qwen3-Coder-Next.

Se vuoi un quadro più generale per abbinare un modello a un’applicazione, incluse opzioni di hosting e licenze, la nostra guida su come selezionare il miglior LLM per la tua applicazione va oltre il coding.

E qualunque modello tu scelga, le skill per trarne valore sono le stesse: il nostro percorso di skill AI per Software Engineering e il nostro corso su coding assistito dall’AI per sviluppatori insegnano il prompting, i test e le abitudini di review che trasformano un 91% di benchmark in una pull request mergiata.

Considerazioni finali

Claude Opus 5.5 è il miglior LLM per coding a settembre 2026 e, in modo insolito, anche quello da mettere sul conto del tuo team. Claude Fable 5.1 è il percorso di escalation per i task più lunghi, e Qwen3.8-27B è il modello open-weight che trasforma una GPU da 24 GB in un assistente di coding privato che batte la frontiera dell’anno scorso su SWE-bench Pro. Il resto è una questione dei tuoi vincoli, e la guida decisionale sopra è come li risolverei.

Il cambiamento più grande è che il benchmark che ha definito questa categoria per 2 anni, SWE-bench Verified, ha smesso di contare nello stesso anno in cui gli open weights l’hanno raggiunto.

Non è una coincidenza.

Quando Opus 5 e DeepSeek V4 Pro sono separati da 0,6 punti su un test saturo, e un modello da $20 per milione ora batte quello da $50 di Anthropic su SWE-bench Pro, il valore si è spostato sul design dell’harness, sui budget di sforzo e sulle valutazioni sul tuo repository, che è esattamente il lavoro che una tabella del vendor non può fare per te.

Quindi fai quel lavoro. Prendi lo script ask_coding_model.py, puntalo su 2 o 3 di questi modelli, eseguilo su 20 ticket reali dal tuo backlog al livello di sforzo che pagherai davvero, e lascia che quel risultato prevalga su qualsiasi cosa io abbia scritto qui. Se il vibe coding è più nelle tue corde degli harness di valutazione, il nostro pezzo su cos’è il vibe coding e dove si rompe è uno sguardo onesto ai compromessi, e valgono le stesse classifiche di modelli.

FAQs

What is SWE-bench Verified and why does it matter for evaluating coding LLMs?

SWE-bench Verified è un sottoinsieme da 500 task di SWE-bench in cui annotatori umani hanno confermato che ogni issue GitHub è risolvibile e che i test sono equi; un modello deve produrre una patch che superi i test nascosti. È stato importante perché è stato il primo test ampiamente affidabile sulla correzione di repository reali invece che sulla scrittura di funzioni giocattolo. Nel 2026 i modelli top superano il 96% su di esso, quindi uso SWE-bench Pro e Terminal-Bench per distinguerli.

Can open-weight models compete with Claude and GPT for real coding tasks in 2026?

Sì, sui benchmark più vecchi e quasi su quelli agentici. Kimi K3 segna 88,3% e DeepSeek V4 Pro 0813 segna 87,9% su Terminal-Bench 2.1, contro il 91,4% di Claude Fable 5.1, e Vals AI ha misurato DeepSeek a 0,6 punti da Opus 5 su SWE-bench Verified. Il problema è la dimensione: quei modelli open hanno da 1,6 a 2,8 trilioni di parametri, quindi "open" significa "economici via API", non "gira sul mio laptop".

What is the best LLM for coding if I cannot share my code with an external API?

Qwen3.8-27B è la scelta migliore su una singola GPU da 24 GB, con 73,0% su Terminal-Bench 2.1 e 61,7% su SWE-bench Pro sotto licenza Apache 2.0. Se hai 96–128 GB di memoria unificata, Laguna S 2.1 ti offre un contesto da 1M token e 8B parametri attivi per un agente locale veloce. Per un laptop da 64 GB, i 3B parametri attivi di Qwen3-Coder-Next lo rendono l’opzione più veloce che sia ancora utile.

What is the difference between a coding LLM and an AI coding assistant like Cursor or GitHub Copilot?

Un LLM per coding è il modello che genera il codice, mentre un coding assistant è l’harness attorno che legge i tuoi file, esegue comandi e presenta i diff. Cursor, Copilot, Windsurf, Claude Code e Codex ti permettono tutti di sostituire il modello sottostante, e lo stesso modello può segnare diversamente di alcuni punti a seconda dell’harness. Scegli il modello in base a benchmark e prezzo, poi scegli l’assistant in base al flusso di lavoro.

How often does the best coding LLM change, and how should I keep up?

Anthropic e OpenAI da sole hanno rilasciato 7 modelli classe frontiera tra il 28 maggio e il 24 settembre 2026 (Opus 4.8, Fable 5, Sonnet 5, GPT-5.6, Opus 5 e 5.5, e Fable 5.1 più GPT-6 Astra), quindi aspettati che il leader cambi ogni 4–8 settimane. Tieni il passo guardando 3 board indipendenti, Artificial Analysis, Vals AI e tbench.ai, invece dei post di lancio, e riesegui la tua valutazione da 20 task al livello di sforzo che paghi ogni volta che un modello che usi riceve una nuova versione.


Tim Lu's photo
Author
Tim Lu
LinkedIn

Sono una data scientist con esperienza in analisi spaziale, machine learning e pipeline dei dati. Ho lavorato con GCP, Hadoop, Hive, Snowflake, Airflow e altri processi di data science/engineering.

Argomenti
Intelligenza artificiale
Large Language Models