2025年2月、Claude 3.7 SonnetはSWE-bench Verifiedで62.3%、カスタムスキャフォールドありで70.3%を記録し、当時の最良オープンウェイトであるDeepSeek-R1は論文で49.2%と報告しました。
スキャフォールディングの手厚さ次第で、13〜21ポイントの差がありました。
そして2026年9月、独立系のVals AIのSWE-bench VerifiedボードはClaude Opus 5を97.0%、オープンウェイトのDeepSeek V4 Pro 0813を96.4%とし、ベンチマークは飽和につきアーカイブされました。
最前線はSWE-bench ProやTerminal-Bench 4.0のような、より難度の高いエージェント評価へ移り、旧ベンチではオープンウェイトが追いつきました。結果、「コーディングに最適なLLM」は「何の用途で、どのハードウェア上で、どの価格で」に置き換わりました。
ここでは、いま実際に使う候補に入る9モデルでその問いに答えます。結論の短い版は、Claude Opus 5.5がほとんどのチームの起点になるということです。
ランキング前の注意:この記事はモデル自体についてで、周辺ツールではありません。Cursor、Copilot、Windsurfの比較は、こちらのまとめ2026年のベストAIコーディングアシスタントをご覧ください。
要点まとめ:2026年9月のベスト・コーディングLLM
Claude Opus 5.5は多くのベンチで最強かつ、開発者がまず選ぶべきモデルになりました。最長期のタスクにはClaude Fable 5.1、1枚GPUで動かすオープンウェイトならQwen3.8-27Bです。用途別の最適解は以下のとおりです。
- エージェント的なコーディングの総合最優:Claude Opus 5.5(Anthropic)。SWE-bench Pro 89.9%、Terminal-Bench 4.0 66.4%。料金は入力$4/出力$20(100万トークンあたり)。
- 最長期タスクに最適:Claude Fable 5.1(Anthropic)。SWE-bench Pro 81.2%、Artificial Analysis上のTerminal-Bench 2.1で最高の91.4%。料金は入力$10/出力$50。
- OpenAIのコーディング最有力:GPT-6 Astra(OpenAI)。tbench.aiのTerminal-Bench 4.0エージェント・リーダーボードで58.2%の首位、Artificial Analysisの実行でもOpus 5.5と同率の59.6%。
- フロンティア・ラボからの最良コスパ:Gemini 3.8 Flash(Google)。Terminal-Bench 2.1で89.4%。2026年12月31日まで入力$0.75/出力$3.75。
- APIで使う最強オープンウェイト:DeepSeek V4.1 Flash。MITライセンス、Terminal-Bench 2.1で90.6%。オフピークは出力100万トークン$0.60。
- 自宅では動かせないオープンウェイト最強:Kimi K3(Moonshot AI)。2.8兆パラメータ、Terminal-Bench 2.1で88.3%。
- 24 GB GPU上の最良ローカルモデル:Qwen3.8-27B(Alibaba)。Apache 2.0、Terminal-Bench 2.1で73.0%。UD-Q4_K_Mで16.5 GB。
- 128 GBワークステーション向けローカル最良:Laguna S 2.1(Poolside)。118Bパラメータでアクティブ8B、1Mコンテキスト。
- 旧ハード向け高速ローカル:Qwen3-Coder-Next。合計80Bだがアクティブ3B、SWE-bench Verifiedで70.6%。
特記なき限り、上記スコアはベンダー公表値です。以降は、なぜその結論に至ったかと各モデルの弱点を説明します。
なぜ「コーディングアシスタント」ではなく「モデル」の記事なのか?
コーディングLLMはプロンプトを読みトークンを生成する「モデル」で、コーディングアシスタントはファイルを食わせ、コマンドを実行し、差分を見せる「ハーネス」です。
Claude Code、Codex、Cursor、GitHub Copilot、Windsurfはハーネス。Claude Opus 5.5、GPT-6 Astra、Qwen3.8-27Bはモデルで、スコアは多くの人の想像以上にハーネスで変わります。
AnthropicのClaude Opus 4.8のローンチ投稿の脚注が、その点を具体化しています。
各モデルのTerminal-Bench 2.1スコアを公開のTerminus-2ハーネスで示しつつ、GPT-5.5はOpenAIのCodex CLI内だと83.4%に上がると注記。同じ重みでも配管次第で結果が変わるのです。
このため、以下のランキングでは可能な限りハーネス名も添えています。仕組みに不慣れな場合は、LLMとは何かのガイドを読んでおくと理解がスムーズです(15分)。
コーディングLLMに本当に効くベンチマークは?
2026年時点で重要なのは、SWE-bench Pro、Terminal-Bench(2.1と4.0)、そして一部オープンウェイトが公表するLiveCodeBench v6です。SWE-bench Verifiedは2年間の標準でしたが、現状はトップ層の差をつけられません。
ランキング前に、各モデル項目の数値の意味を整理します。
SWE-bench Verifiedは飽和
SWE-bench Verifiedは、人気Pythonリポジトリの人手検証済みGitHub課題500件のセットで、モデルはリポジトリと課題文を受け取り、非公開の単体テストに通るパッチを出す必要があります。
OpenAIは、元のSWE-benchに不完全な課題や壊れたテストが含まれていたため、2024年にVerifiedサブセットを導入しました。依然もっとも引用される指標ですが、それこそが問題です。
Vals AIのリーダーボードは、すべてのモデルを最低限のbashオンリー・エージェントで走らせ、2026年9月1日の更新でClaude Opus 5を97.0%、DeepSeek V4 Pro 0813を96.4%、GPT-5.6 Solを96.2%とし、ベンチマークをアーカイブ扱いにしました。
3つのラボの3モデルが天井から4ポイント以内、互いに1ポイント以内なら、指標は弁別力を失っています。古い・小さいモデルではカードに載る唯一の数字なので引用はしますが、順位付けには用いません。
SWE-bench Proはその上位互換
Scale AIが運営するSWE-bench Proは、41の実務リポジトリにまたがる1,865タスク(公開731+非公開の保留セット)で構成されます。2026年9月22日、ScaleはSWE-Bench Pro V2を公開し、無効と判定した89件を除外して公開セットを642タスクに縮小。どのバージョンのスコアか要確認です。
平均の修正は4.1ファイルで107.4行に及び、対象言語もPythonに限りません。SWE-bench Proの論文が2025年9月に出た当初、最高モデルは23%前後でした。
1年後、AnthropicのFable 5.1システムカードはFable 5.1で81.2%、Opus 5で79.2%、OpenAIのGPT-5.6のローンチ表はGPT-5.6 Solで64.6%を報告。3週間後、Opus 5.5のシステムカードがトップを89.9%へ押し上げました。
いずれもベンダー実行で、Anthropicは最大努力・5試行の平均です。Scaleの公開ボードはベンダー数値に数か月遅れるため、私はベンダー値を上限、公開ボードを下限として見ます。
Terminal-Bench 2.1と4.0
Terminal-Benchは、モデルにコンテナ内のライブシェルと「このモデルを訓練せよ」「このビルドを修正せよ」「この破損アーカイブを復旧せよ」のようなタスクを与え、生成物で採点します。
2.1版は、ソフトウェア工学、システム管理、データ処理、セキュリティにわたる厳選89タスクで、Artificial AnalysisはTerminus 2ハーネスで3回平均のpass@1を採点。エージェントを作る・使う人には最重視の単一指標です。
Terminal-Bench 4.0は、スタンフォード、Harbor、Laude Instituteがtbench.aiで提供する新たな最前線セットです。
AnthropicのOpus 5.5システムカードは、計算生物学、物理シミュレーション、CAD、形式的証明、GPU性能作業に偏った66タスクで、タイムアウトが長くハーネス影響が小さいと述べています。
tbench.aiのエージェント・リーダーボードでは、Codexハーネス・最大努力のGPT-6 Astraが58.2%で首位、Claude Fable 5.1が57.9%。Opus 5.5はまだエージェント項目がありません。モデルレベル実行では、Artificial AnalysisがOpus 5.5とAstraを59.6%で同率、Vals AIはOpus 5.5を61.6%で首位としつつも、セーフガードでフォールバックに渡したタスクを失敗扱いにすると53.5%に落ちると注記。ここが最前線が群を抜く分岐点です。
LiveCodeBench v6は丸暗記を見抜く
LiveCodeBenchは、2024年のJainらの論文で導入され、LeetCode、AtCoder、Codeforcesの問題を継続収集し、各問題にタイムスタンプを付与。学習カットオフ以降に公開された問題だけでモデルを評価できます。
現在の公開リーダーボードはv6です。対象はアルゴリズム的推論で、リポジトリ規模の工学ではないため、面接・データ構造系には引き続き有用でした。
フロンティア系は2026年に報告をほぼ停止したため、手元の数値はオープンウェイト由来です。DeepSeek V4 Proプレビュー(4月)が93.5%、Qwen3.8-27Bが90.3%、Kimi K2.6が89.6%。Gemini 3.1 Proは関連指標として、LiveCodeBench Pro Elo 2,887を報告しています。
ベンダーのベンチ表の読み方
ベンダー表は最良ケースです。自社ハーネス、自社の努力設定、試行回数。私は、3ポイント未満の差は、Artificial Analysis、Vals AI、tbench.aiの独立再現があるまでは鵜呑みにしません。
LLMベンチマークと比較の手引きでは主要ボードを概観し、MMLUが測るものは、知識ベンチが「壊れたテストを直せるか」をほぼ教えてくれない点の良い注意喚起になります。
自前の評価ハーネス構築には、LLMの評価指標と方法論ガイドを、まず新人に勧めています。
以上を踏まえ、以降はクラウドのフロンティアから順に、9モデルのスコアを見ます。
クラウドのフロンティアモデルで最良なのは?
2026年9月時点のコーディング向けクラウド・フロンティア最良は、Claude Opus 5.5、Claude Fable 5.1、GPT-6 Astra、Gemini 3.8 Flashの4つで、いずれもおおむね100万トークン前後のコンテキストを備えます。
違いは価格、努力設定、各ラボが最適化したベンチマークです。
ここでは、十分な予算があるチームに推す順で挙げます。
1. Claude Opus 5.5(Anthropic)
Claude Opus 5.5はAnthropicの新しいOpus階層フラッグシップ(2026年9月22日リリース)。いま、ほぼ誰にでも勧められるコーディングモデルです。Opus 5からわずか2か月でこの評価になるとは予想外でした。Anthropicのローンチ投稿は、ほとんどの作業でFable 5.1級の性能を示しつつ、Opus 5より40%低コストと述べ、モデル概要でも開発者はOpus 5.5を起点に、長期タスクやOpus 5.5で_evalが不足する場合のみFable 5.1を推奨しています。
システムカードは、SWE-bench Pro 89.9%、DeepSWE v1.1 74.2%、Terminal-Bench 4.0 66.4%(xhigh effort)を報告し、Anthropicが公開したコーディング系の行でFable 5.1をすべて上回ります。独立系では、Artificial AnalysisがTerminal-Bench 4.0でGPT-6 Astraと同率59.6%、Vals AIはTerminal-Bench 4.0で61.6%、Terminal-Bench 2.1で87.6%として首位。どちらもセーフガードのフォールバックを含み、失敗換算にするとそれぞれ53.5%、79.8%に落ちます。
主な特長:
- 入力$4/出力$20(100万トークン)、Opus 5比で20%安。キャッシュ読み出しは$0.20へ60%引き下げ
- 100万トークンのコンテキスト、出力128K、オフ不可の適応思考、デフォルト努力はhighではなくmedium
- CursorBench 4.0で最大努力57.8%(Cursorのボード首位)。mediumでも52.5%で、Fable 5.1最大努力を上回る
- Claude API(
claude-opus-5-5)に加え、Amazon Bedrock、Google Cloud、Microsoft Foundryで提供
最適用途:日常のコーディング、コードベース横断の移行、コードレビュー。Opus 5を低価格で完全に置換し、Claude Codeは既定のOpusとしてこれを使用。Claude Opus 5.5ガイドと、GPT-6 Sol vs Claude Opus 5.5のハンズオン比較を参照。
トレードオフ:40%の節約はデフォルト努力時の話。最大努力では、Artificial AnalysisいわくOpus 5より大幅に多くのトークンを消費し、Intelligence Indexタスクあたりのコストは$5.98でOpus 5の$5.86とほぼ同水準。また、Fable系のセーフガードを搭載し、多くのサイバーセキュリティ系タスクをOpus 4.8へ回します。さらに、シンキング無効や強制ツール使用のリクエストはエラー返却となるため、マイグレーションは要注意。
2. Claude Fable 5.1(Anthropic)
Claude Fable 5.1はAnthropicのMythos級モデルの一般公開版(2026年9月1日)。Opus 5.5で行き詰まった時に切り替えるモデルです。Anthropicのローンチページは、Fable 5.1とClaude Mythos 5.1が同一モデルでセーフガードのみ異なると明記。
システムカードの数値は、SWE-bench Pro 81.2%、Terminal-Bench 4.0 55.8%。Artificial Analysisは独自にTerminal-Bench 2.1で91.4%(最大努力)を測定し、同ボードのトップを維持。
主な特長:
- 100万トークンのコンテキストと128K出力
- 適応思考は常時オン
- 5.1でプロンプトキャッシュ読み出しを$0.25へ75%引き下げ。エージェント系の費用を最大45%削減とAnthropicは試算
- 強力な複数ファイル計画と広い思考、優れたツール利用
最適用途:本番のエージェント・パイプライン、複数日にわたる大規模リファクタ、誤答コストがトークン費用を上回る案件。Opus 5.5で_evalが不足することが確認されたタスクに。Fable 5.1ガイド、および6月版のFable 5概要も参照。
トレードオフ:入力$10/出力$50はOpus 5.5の2.5倍。Anthropicの表でも、SWE-bench Pro、Terminal-Bench 4.0、CursorBench 4.0でFable 5.1はOpus 5.5の後塵を拝します。実運用の差は表ほど広くないとするものの、いまは逆にFable側が立証責任を負う立場。古いCursorBench 3.2.0では、Fable 5.1のmedium努力が68.0%で、タスクあたり$3.53でした。
3. GPT-6 Astra(OpenAI)
GPT-6 AstraはOpenAIのフロンティアモデル(2026年9月3日リリース)。tbench.aiのTerminal-Bench 4.0エージェント・リーダーボードで、Codexハーネス最大努力の58.2%で首位を維持しています(Opus 5.5は未掲載)。
モデルページは、1,050,000トークンのコンテキスト、128,000出力、知識カットオフ2026年4月30日、努力レベルはnone〜max。料金は入力$10(キャッシュ$1)、出力$50(各100万トークン)。
OpenAIのローンチ資料は、横断ベンチより自社評価・システムカード依存の傾向。実力は強力ながら、Opus 5.5やFable 5.1に対し明確な勝者とまでは言い難い、というのが私見です。数値はGPT-6 Astraの概要で扱っています。
主な特長:
- Responses APIで
hosted_shell、apply_patch、computer_use、tool_searchを公開(Codex本体が使うツール群)。 - 入力キャッシュが$1/100万トークンと本体の1/10。同一リポを再読するエージェント・ループに有利。
- Preparedness Frameworkの最高サイバーセキュリティ層に到達した初のOpenAIモデルで、一部のセキュリティ関連プロンプトは制限あり。
最適用途:Codex、GitHub Copilot、Microsoftスタックの既存利用者、理工系の重いタスク、サードパーティツール連携が重要なケース。近い実力を安価に求めるなら、GPT-6 Sol(9月22日発表、入力$2/出力$10)がGPT-5.6 Solの後継で、Terra不在の現状では旧Terra相当の価格帯を埋めます。OpenAIの表ではDeepSWE 1.1が68.8%、FrontierCodeが49.3%(ただしDeepSWEはGPT-5.6 Sol最大努力のほうが高スコア)。
トレードオフ:Fable級の価格。Anthropic試算では、Opus 5.5はTerminal-Bench 4.0でAstraに肩を並べつつ、タスクあたりコストは約40%安。Artificial Analysisでも両者は同水準。明確なリードは科学寄りの領域で、Terminal-Bench-Science 64.6%、FrontierSWE v2 65.5%(いずれもOpus 5.5超)。
4. Gemini 3.8 Flash(Google)
Gemini 3.8 FlashはGoogleの実働モデル(2026年9月2日)。フロンティア級のエージェント・スコアを最安級で得られます(GPT-6 Lunaはさらに安いがエージェント系スコアは低め)。Googleの評価レポートはTerminal-Bench 2.1で89.4%、DeepSWE v1.1で73.7%(Fable 5.1は67.4%)。同表ではOpus 5が74.0%で僅差先行、AnthropicはOpus 5.5で74.2%を報告。開発者ガイドにはSWE-bench Proで61.6%も追記。
Gemini APIの料金は、2026年12月31日まで入力$0.75/出力$3.75、2027年1月1日から$1.50/$7.50。2027年でも、Opus 5.5の出力単価の3分の1強。コンテキストは入力100万、出力64K。
主な特長:
- ネイティブなマルチモーダル入力対応。設計図やUI不具合のスクショとコードを並べて渡せる。
- 高ボリュームのエージェント作業に位置付け、価格もそれに準拠。
- 脆弱性対応のCyber版も別ゲートで提供。詳細はGemini 3.8 Flash/Flash Cyber概要参照。
最適用途:高頻度のエージェント・ループ、コスト重視のチーム、Vertex AI利用者。Gemini 3.1 Pro(2026年2月19日リリース)は依然Pro級で、SWE-bench Pro 54.2%、料金は入力$2/出力$12。ただしコーディング目的なら、現状は3.1 Proより3.8 Flashを選びます。
トレードオフ:Terminal-Bench 4.0が19.1%。Flashは端末作業に強く、最前線の科学タスクに弱いので、最難関チケットには強いモデルの待機が必要です。
クラウドは以上。続いてダウンロード可能なモデルです。
2026年のオープンウェイト・コーディングLLMの最良は?
2026年のオープンウェイト最良は2群に分かれます。DeepSeek V4.1 FlashやKimi K3のようにフロンティア級スコアに並ぶがデータセンター級ハードを要するものと、Qwen3.8-27BやLaguna S 2.1のように120B未満で自前ハードに載せられるものです。
ここでの「オープンウェイト」は重みのダウンロード可を意味します。実際のライセンスはMITやApache 2.0から独自条項まで様々です。
5. DeepSeek V4.1 Flash(DeepSeek)
DeepSeek V4.1 Flashは2026年9月10日リリース。名称に反し、いま私が最優先で選ぶDeepSeekモデルです。V4 Pro 0813のフラッグシップを、性能・コスト・速度・タスク完了時間ですべて上回るとDeepSeekは主張。Vals AIの独立インデックスも同様で、8月に52.4%だったV4 Pro 0813に対し、57.9%でオープンウェイト首位に。
552BパラメータのMoEで、入力は約8B・出力は約16Bがアクティブ、100万トークン・コンテキスト、ネイティブ画像入力、MITライセンス。Terminal-Bench 2.1で90.6%、DeepSWE v1.1で74.2%と、いずれもベンダー公表のオープン最良スコア。Vals AIのTerminal-Bench 2.1実測は74.5%で、オープンウェイト中2位。
詳細はDeepSeek V4.1 Flash概要にて。
主な特長:
- 料金ページのAPI価格は、オフピークで入力$0.15/出力$0.60、平日ピーク(UTC 01:00–04:00, 06:00–10:00)は倍額。キャッシュヒットはオフピーク$0.003/100万。
- OpenAI互換APIで
deepseek-flashとして提供。この記事後半のask_coding_model.pyはベースURLを替えれば動作。 - V4 Flashの約1/4のKVキャッシュで、長文脈の低価格を実現。
最適用途:フロンティアに肉薄する端末作業を低コストで、かつオフピークにバッチ投入できるコード処理。
トレードオフ:Terminal-Bench 4.0は自社報告で31.2%。最難関の長期エージェント作業は依然フロンティア系の牙城。チェックポイントも約510 GBで、「オープンウェイト」はマルチGPUサーバー前提。V4 Pro 0813利用者向けには9月14日にV4.1 Flashへのルーティング移行を発表後、撤回し、当面V4 Proは$0.66/$1.98(オフピーク)で提供継続。
6. Kimi K3(Moonshot AI)
Kimi K3はMoonshot AIの2.8兆パラメータ・オープンウェイト旗艦(2026年7月)。Terminal-Bench 2.1で88.3%を記録し、オープンではDeepSeek V4.1 Flash(90.6%ベンダー報告)に次ぐ2位。
Hugging Faceカードは、896エキスパート中104Bアクティブ(トークンごとに16ルーティング+2共有)、1,048,576トークン・コンテキスト、MXFP4重み。Vals AIはSWE-bench Verifiedで93.4%を測定。
主な特長:
- 100万トークン・コンテキストとネイティブ視覚入力。
- MITやApacheではないKimi K3ライセンス(独自)。商用利用前に精読を。
- 推奨スタックはvLLM、SGLang、TokenSpeed。GPU評価の一部はH20向けに校正。
最適用途:入手可能な中で最強クラスのオープン・エージェント系コーダーを求める場合。
トレードオフ:フロンティア級の能力はデータセンター規模でのみ実現。Terminal-Bench 2.1でFable 5.1との差は3ポイントに見えますが、同条件ではありません(Kimi Codeハーネス vs Terminus 2)。実運用ではホスティング経由か自前クラスタ+法務で独自ライセンスの確認が必要。
7. Qwen3.8-27B(Alibaba)
Qwen3.8-27Bは密(dense)27Bパラメータ(2026年8月、Apache 2.0)。単一の24 GB GPUで動かす最良のコーディングLLMです。
モデルカードは、SWE-bench Pro 61.7%、Terminal-Bench 2.1 73.0%、LiveCodeBench v6 90.3%、DeepSWE 1.1 42.2%。ネイティブ262,144トークンのコンテキストはYaRNで100万まで拡張可。SWE-bench ProとTerminal-Benchの両方で、4倍サイズのLaguna S 2.1を上回り、SWE-bench ProではGemini 3.1 Proも凌駕。ただし、SWE-bench ProはQwen独自の修正セットで実行のため、横断比較は目安に。
主な特長:
- コミュニティ提供のUnsloth製UD-Q4_K_M GGUFは16.5 GBの単一ファイル。24 GBカードで32Kコンテキストが余裕。UD-Q4_K_XLは17.6 GB。
- 密アーキテクチャで、3BアクティブのMoEよりトークンあたりは遅いが、多ファイル編集の一貫性は高い。
- Apache 2.0で商用製品でも利用制限なし。
最適用途:コードを外部APIへ出せない開発者、RTX級GPU1枚の個人、クラウド契約前に自分のリポでローカル対Claudeを比較したい人。
トレードオフ:Terminal-Bench 2.1で73.0%は91.4%に18ポイント差。長期エージェント作業ではリトライが増えます。
8. Laguna S 2.1(Poolside)
Laguna S 2.1は118Bパラメータ・MoEで8Bアクティブ(2026年7月21日)。Mac StudioやDGX Spark、マルチGPUワークステーション向けのオープンウェイトの筆頭です。
Poolsideのローンチ投稿は、SWE-bench Pro公開セット59.4%、Terminal-Bench 2.1で思考オン70.2%(思考オフ60.4%)、SWE-bench Multilingual 78.5%、DeepSWE 40.4%を報告。
409,000の環境(うちターミナル83,000、ソフトウェア工学ワークフロー168,000)で学習し、H200×4,096で9週間未満とのこと。
主な特長:
- このサイズでは珍しい100万トークン・コンテキスト。
- OpenMDW-1.1ライセンス(寛容だが法務確認推奨)。
- 思考モードはデフォルトで有効。Terminal-Bench 2.1で約+10ポイントの効果。平均完了長は23K〜249Kトークン/タスクと幅広く、予算計画が必要。
最適用途:96〜128 GBのユニファイドメモリ機でClaude Code風のローカル・エージェントを動かしたいチーム、ローカルでも100万トークンが必要な大規模リポ。
トレードオフ:118Bを4bitで約60〜70 GB(KVキャッシュ別)。24 GB GPUでは不可。素のスコアではQwen3.8-27Bが僅差で上回るが、重みが載る前提ならLagunaは8Bアクティブゆえに高速——夜通しエージェントの意義はそこにあります。
9. Qwen3-Coder-Next(Alibaba)
Qwen3-Coder-Nextは80BパラメータのMoEで、トークンごとに3Bのみアクティブ(2026年2月3日、Apache 2.0)。密27Bを高速に載せられないハード向けの、最速クラスでなお有用なローカル・コーダーです。
モデルカードは、SWE-bench Verified 70.6%、SWE-bench Pro 44.3%、Terminal-Bench 2.0 36.2%。512エキスパート(10アクティブ+1共有)、262,144トークン・コンテキスト。思考モードなし。
主な特長:
- 公式のQ4_K_M GGUFは約48 GB。64 GB MacやCPUオフロード構成に適合、単一コンシューマGPUにはやや重い。
- ハイブリッド・アテンション(標準層1に対しGated DeltaNet 3層)で長文脈のメモリ使用を抑制。
- vLLM、SGLang、Ollama、LM Studio、MLX-LM、llama.cpp、KTransformersに対応(カード記載)。
最適用途:ピーク精度よりトークン毎秒が重要な長期夜間タスク、64 GBユニファイドメモリのノートPC。
トレードオフ:SWE-bench Pro 44.3%はQwen3.8-27Bより17ポイント低く、難バグ1件なら密27Bを選びます。
他に検討に値するオープンウェイト
あと4モデルが最終候補に迫り、うち2つはチームによっては本命になり得ます。
- DeepSeek V4 Pro 0813(DeepSeek):総1.6T、アクティブ49B、1Mコンテキスト、MIT。Vals AIのSWE-bench Verified(アーカイブ)で96.4%。依然オフピーク入力$0.66/出力$1.98で提供中だが、Terminal-Bench 2.1はVals実測54.7%(自社報告87.9%)。DeepSeekはいまV4.1 Flashを推奨。当社の解説にアーキテクチャ詳細。
- Kimi K2.6(Moonshot):総1T、アクティブ32B、256Kコンテキスト、改変MIT。SWE-bench Verified 80.2%、SWE-bench Pro 58.6%、LiveCodeBench v6 89.6%。兆規模の中では、DeepSeek V4 Pro(純MIT)の次にクリーンなライセンス。
- MiniMax M3:総428B、アクティブ23B、1Mコンテキスト、画像・動画のネイティブ入力。SWE-bench Verified 80.5%、SWE-bench Pro 59%。スクリーンショット混在タスクのオープン候補。
- Qwen3.8-Flash-Next:総125B、アクティブ6B。SWE-bench Pro 62.5%、DeepSWE 58.7%。ただしライセンスはqwen-community-1.0で制約が多く、トップ9からは外しました。
ハードに合うオープンウェイトが見つかったら、次節の手順で実行できます。
オープンウェイト・コーディングモデルをローカルで走らせるには?
ローカル実行は3手順です。量子化済みチェックポイントを入手、OpenAI互換のエンドポイントで提供、クライアントやアシスタントをそのエンドポイントに向けます。ここでは最も載せやすいQwen3.8-27Bを例にします。
まずダウンロード。huggingface_hubはレジューム・キャッシュ対応で大容量転送に便利です:
"""Download a quantized coding model from Hugging Face.
Qwen3.8-27B at UD-Q4_K_M is a single 16.5 GB file, which leaves room for
a 32K context on a 24 GB GPU. Swap FILENAME for the UD-Q4_K_XL build if you
have the extra 1 GB to spare.
"""
from huggingface_hub import hf_hub_download
REPO_ID = "unsloth/Qwen3.8-27B-GGUF"
FILENAME = "Qwen3.8-27B-UD-Q4_K_M.gguf"
def fetch(repo_id: str = REPO_ID, filename: str = FILENAME) -> str:
"""Download one file from the Hub and return its local path."""
path = hf_hub_download(repo_id=repo_id, filename=filename)
print(f"Saved to {path}")
return path
if __name__ == "__main__":
fetch()
このコードをdownload_gguf.pyで保存し、uv run --with huggingface_hub python download_gguf.pyで実行。Windowsでは開発者モードがオフだとシンボリックリンク警告が出ます。
次にサーブします。
llama.cppのllama-server、LM Studio、OllamaはいずれもOpenAI互換の/v1を公開します。llama.cppならコマンド1行で、-ngl 99が全層GPUオフロード、-c 32768が32Kコンテキスト指定です。
llama-server -m Qwen3.8-27B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080
最後にクライアント。私は評価対象ごとに1スクリプトを持ち、環境変数3つで切り替えます。同一ファイルでローカル、DeepSeek API、OpenAIに投げられます:
"""Send one coding prompt to any OpenAI-compatible endpoint.
The same script talks to a local llama.cpp or vLLM server, to DeepSeek's
API, or to OpenAI itself. Only three environment variables change:
LLM_BASE_URL e.g. http://localhost:8080/v1 or https://api.deepseek.com
LLM_MODEL e.g. qwen3.8-27b or deepseek-flash
LLM_API_KEY anything non-empty for a local server
"""
import os
from openai import OpenAI
PROMPT = (
"Write a Python function top_n(df, col, n) that returns the n largest "
"rows of a pandas DataFrame by column col, with a docstring and a "
"ValueError if col is missing."
)
def ask(prompt: str = PROMPT) -> str:
"""Return the model's reply for a single-turn coding request."""
client = OpenAI(
base_url=os.environ["LLM_BASE_URL"],
api_key=os.environ.get("LLM_API_KEY", "local"),
)
response = client.chat.completions.create(
model=os.environ["LLM_MODEL"],
messages=[{"role": "user", "content": prompt}],
temperature=0.2, # keep code generation close to deterministic
)
return response.choices[0].message.content
if __name__ == "__main__":
print(ask())
ask_coding_model.pyとして保存し、LLM_BASE_URL=http://localhost:8080/v1 LLM_MODEL=qwen3.8-27b uv run --with openai python ask_coding_model.pyで実行します。
ルーティングやリトライ、ツール呼び出しを複数エンドポイントに組み込むなら、LangChainによるLLMアプリ開発コースが、if文だらけにしない抽象化を解説しています。
最適なコーディングLLMはどう選ぶべきか?
選定は4制約に帰着します。コードを外部へ出せるか、メモリ量、出力100万トークンあたりの予算、1タスクで必要な文脈長。下表は信頼する数値で9モデルを横並びにし、その後のガイドで制約から最適解へ導きます。
| Model | Type | Terminal-Bench 2.1 | SWE-bench Pro | Context | Price (per 1M output) or memory | Best for |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 | Cloud | 87.6% (Vals AI) | 89.9% | 1M | $20 | Default for most coding work |
| Claude Fable 5.1 | Cloud | 91.4% (Artificial Analysis) | 81.2% | 1M | $50 | Longest-horizon agentic work |
| GPT-6 Astra | Cloud | Not published (58.2% tbench.ai / 59.6% Artificial Analysis on Terminal-Bench 4.0) | Not published | 1.05M | $50 | Codex users, frontier science tasks |
| Gemini 3.8 Flash | Cloud | 89.4% | 61.6% | 1M | $3.75 through 2026 | High-volume, cost-sensitive agents |
| DeepSeek V4.1 Flash | Open (MIT) | 90.6% (vendor); 74.5% (Vals AI) | Not published | 1M | $0.60 off-peak | Cheapest capable open weights via API |
| Kimi K3 | Open (custom) | 88.3% (Kimi Code harness) | Not published | 1M | 2.8T params, cluster only | Strongest self-hosted agent |
| Qwen3.8-27B | Open (Apache 2.0) | 73.0% | 61.7% | 262K | 16.5 GB at UD-Q4_K_M | Single 24 GB GPU |
| Laguna S 2.1 | Open (OpenMDW-1.1) | 70.2% | 59.4% | 1M | 60 to 70 GB at Q4 | 128 GB workstation, local agents |
| Qwen3-Coder-Next | Open (Apache 2.0) | 36.2% (2.0) | 44.3% | 262K | About 48 GB at Q4 | Fast local model, 64 GB Mac |
意思決定ガイド
4制約を以下のようにマッピングします。
- 正確性がコストを凌駕するエージェント系:Claude Opus 5.5をhigh〜xhighで。Opus 5.5の_evalで不足が出る長期案件はFable 5.1を待機。
- 日常のAI支援コーディングを適正価格で:Claude Opus 5.5のデフォルトmediumが第一候補。Codex圏なら二番手はGPT-6 Sol。
- 最前線の科学・シミュレーション・GPUカーネル:GPT-6 AstraかClaude Opus 5.5。科学寄りはAstra優位(Terminal-Bench-Science)、Terminal-Bench 4.0はOpus 5.5。
- 巨大コードベース・100万トークン・予算タイト:価格でGemini 3.8 Flash。Flashの回答が荒れたらOpus 5.5。
- API経由のオープンウェイト:DeepSeek V4.1 Flash(オフピーク)。
- 単一24 GB GPUでローカル・プライベート:Qwen3.8-27B(UD-Q4_K_M)。
- 96〜128 GB機でローカル・プライベート:Laguna S 2.1。クラスタならKimi K3。
- 64 GBノートでローカル高速:Qwen3-Coder-Next。
コーディングに限らないモデル選定の一般枠組み(ホスティングやライセンス含む)は、アプリに最適なLLMの選び方をご覧ください。
どのモデルでも、価値を引き出すスキルは共通です。AI for Software Engineeringスキルトラックや、開発者のためのAI支援コーディングで、91%のベンチをマージ済みPRへ変えるプロンプト、テスト、レビュー習慣を学べます。
まとめ
2026年9月の最良コーディングLLMはClaude Opus 5.5であり、珍しくチームの標準にもそのまま推奨できます。最長期のエスカレーション先はClaude Fable 5.1、24 GB GPUをプライベート・コーディングアシスタントへ変えるオープンウェイトはQwen3.8-27B。残りは制約次第で、上の意思決定ガイドで整理できます。
より大きな変化は、2年この分野を規定したSWE-bench Verifiedが、オープンウェイトが追いついたのと同じ12か月で重要性を失ったことです。
それは偶然ではありません。
飽和したテストでOpus 5とDeepSeek V4 Proが0.6ポイント差、SWE-bench Proでは$20/百万トークンのモデルがAnthropicの$50モデルを上回る——価値はハーネス設計、努力バジェット、自分のリポでの評価に移りました。ベンダー表にはできない仕事です。
だからこそ、その仕事をしてください。ask_coding_model.pyを使い、これら2〜3モデルに向け、実際のバックログから20件を、支払う努力レベルで走らせ、その結果で本記事の記述を上書きしてください。評価ハーネスより「バイブ・コーディング」が性に合うなら、バイブ・コーディングとは何かと限界も正直な検討です。同じモデル順位が適用されます。
FAQs
What is SWE-bench Verified and why does it matter for evaluating coding LLMs?
SWE-bench Verifiedは、各GitHub課題が解決可能でテストが公正であることを人手で確認した、SWE-benchの500タスク部分集合です。モデルは非公開テストに通るパッチを生成しなければなりません。おもちゃの関数ではなく本物のリポジトリ修正を評価する、初の広く信頼された試験として重要でした。2026年にはトップモデルが96%超を記録しており、差別化にはSWE-bench ProとTerminal-Benchを用います。
Can open-weight models compete with Claude and GPT for real coding tasks in 2026?
はい。古いベンチでは明確に、エージェント的なベンチでもほぼ互角です。Kimi K3は88.3%、DeepSeek V4 Pro 0813は87.9%(いずれもTerminal-Bench 2.1)で、Claude Fable 5.1の91.4%に迫ります。Vals AIはSWE-bench VerifiedでDeepSeekがOpus 5に0.6ポイント差と測定。問題はサイズで、どちらも1.6〜2.8兆パラメータ級。「オープン」は「安価なAPI経由」であり「自分のノートで動く」ではありません。
What is the best LLM for coding if I cannot share my code with an external API?
外部APIへコードを出せない場合、単一24 GB GPUならQwen3.8-27Bが最適です(Terminal-Bench 2.1で73.0%、SWE-bench Proで61.7%、Apache 2.0)。96〜128 GBのユニファイドメモリがあればLaguna S 2.1で100万トークン・コンテキストと8Bアクティブをローカルの高速エージェントに。64 GBノートならQwen3-Coder-Nextの3Bアクティブが最速で実用的です。
What is the difference between a coding LLM and an AI coding assistant like Cursor or GitHub Copilot?
コーディングLLMはコードを生成するモデル本体、AIコーディングアシスタントはそれを包むハーネスで、ファイル読込・コマンド実行・差分提示を担います。Cursor、Copilot、Windsurf、Claude Code、Codexはいずれも下位モデルを差し替え可能で、同じモデルでもハーネスで数ポイント変動します。ベンチと価格でモデルを選び、ワークフローでアシスタントを選んでください。
How often does the best coding LLM change, and how should I keep up?
AnthropicとOpenAIだけで、2026年5月28日〜9月24日にフロンティア級を7モデル投入(Opus 4.8、Fable 5、Sonnet 5、GPT-5.6、Opus 5/5.5、Fable 5.1+GPT-6 Astra)。最良モデルは4〜8週間ごとに替わると見てください。ローンチ投稿よりArtificial Analysis、Vals AI、tbench.aiの3ボードを追い、利用中モデルの新版が出たら、実支払いの努力レベルで20タスクの自前評価を再実行しましょう。