コース
2026年10月6日、Mistral は Mistral Large 4 のパブリックプレビュー(ML4)を公開しました。総パラメータ1兆、アクティブ490億パラメータ、テキストと画像の入力対応、そして月末までに公開予定のオープンウェイトを備えています。Mistral史上最大のモデルで、欧州内の自社データセンターにある3,800基のNvidia Grace Blackwell GPUで、スクラッチから学習されました。
ここ1年ほど、最強クラスのオープンウェイトモデルは中国の研究機関(GLM、DeepSeek、Kimi、Qwen)から登場し、一方で最強モデル全般は米国のAPIの背後に留まってきました。Mistralはその「第三の枠」を狙っています。発表によると、ML4は「すでに世界最強のオープンソースモデルと競合する性能に到達しており、米欧で開発されたあらゆるオープンウェイトモデルを大幅に上回る」とのことです。
ただし、実態は発表記事が示すほど単純ではありません。以下では、アーキテクチャ、ベンチマーク(独立再現済みと未再現を区別)、コーディング、ビジョン、サイバーセキュリティ、オープンウェイト、そして依然不明な点を整理します。1つだけ読むなら、サイバーセキュリティの節をおすすめします。
手早く知りたい方へ
Mistral Large 4(Le Chonk)は1兆パラメータのオープンウェイトモデルで、Mistralは中国以外で最強、特にサイバーセキュリティ、金融、法務、ビジュアルグラウンディングに強いと位置づけています。独立評価ではサイバーセキュリティと法務の主張を裏づけつつ、金融は中位、総合指標では44モデル中32位。APIはすでに稼働中で、ウェイトは10月27日に公開予定です。
Mistral Large 4(Le Chonk)とは?
短い説明では抜ける点が多いので、基本から。ML4はMistralの新たなフラッグシップで、同社いわく「過去最大かつ最も高性能なモデル」です。Le Chonk はニックネームですが、発表文では従来と逆の言い回しで「非公式にはML4、そして公式には le Chonk」と述べています。
ネイティブなマルチモーダル対応の Mixture-of-Experts(MoE)モデルです。見出しの数字は総パラメータ1兆、トークンあたりアクティブ490億。ただしMistralの モデルドキュメントではやや異なる数値(総1.05兆、アクティブ520億)も記載されています。差異の理由はどちらにも説明がありません(「アクティブ」が重要な理由は次節で)。
Mistral は ML4 をエンタープライズ用途に向けています。コーディング、サイバーセキュリティ、金融、法務、製造・エンジニアリング、そして技術図面や衛星画像の読解などのビジュアルタスクです。
|
仕様 |
詳細 |
|
総パラメータ数 |
発表では1兆(announcement)、ドキュメントでは1.05兆(docs) |
|
アクティブパラメータ数 |
発表では490億(announcement)、ドキュメントでは520億(docs) |
|
アーキテクチャ |
Mixture-of-Experts、Instruct と Reasoning のハイブリッド |
|
入力 |
|
|
出力 |
テキストのみ |
|
コンテキストウィンドウ |
導入を計画する人にとって最も重要なのは2行で、どちらも未確定です。すなわちコンテキストウィンドウとライセンスです。モデルの仕組みに入る前に、名前の由来を簡単に。
なぜ「Le Chonk」?
2026年6月、Mistral は風刺的な告知として、架空の24兆パラメータモデル「Le Chaton Fat」を投稿し、その後削除しました。インターネット上では話が独り歩きし、仕様が数百兆に「盛られて」いきました。4か月後、実際に1兆パラメータのモデルが登場し、名前は自ずと決まりました。以上が全てです。本題に戻ります。
Mistral Large 4 の仕組み
Mistral はまだ完全なアーキテクチャ詳細を公開していません(ウェイトと同時に公開予定)。この節では公表済みの情報に限定します。
1兆パラメータ、アクティブ490億
1兆パラメータのモデルでも、各トークンで1兆すべてを使うわけではありません。MoE モデルは各トークンを少数の「エキスパート」サブネットワークへルーティングするため、推論計算はアクティブ490億パラメータに相当します。つまり計算量的には約50Bの高密度モデルに近くなります。
では提供コストが安いかというと、そうでもありません。総1兆パラメータをどこかにメモリ常駐させる必要があるため、ML4 を自前ホスティングするには強力なマルチGPU基盤が要ります。MoE は同じアクティブパラメータ数の高密度モデルに比べ、低レイテンシ提供も難しい傾向があります。Mistral はハードウェア要件を公表しておらず、大企業や政府機関以外でフルモデルを自前運用するチームは多くないと見ます。
マルチモーダル入力
アクティブパラメータが扱うのはテキストだけではありません。ML4 は画像も受け取れます(出力はテキストのみ)。Mistral は「複雑な文書、チャート、自然画像を強力に推論」できるとし、エンジニアリング、製造、地球観測など視覚認識が重要な業界を狙っています。デモも産業寄りで、技術図面での機械部品検査、PDFからの証拠抽出、ギガピクセル級の衛星画像からの稀少物体検出などが示されています。
160言語以上
同じ産業分野の顧客は国境を越えて業務を行うことが多く、言語対応が重要です。Mistral によると、学習データの「相当な割合」が多言語で、160言語超と全EU公用語をカバーします。欧州の政府機関を意識する欧州企業にとって、大きなセールスポイントです。
学習インフラ
欧州向けの訴求では、学習がどこで行われたかも重要です。Mistral によれば、ML4 は 自社の欧州データセンターにある3,800基の Nvidia Grace Blackwell GPUでスクラッチから学習されました。Mistral の VP of Science、Pierre Stock 氏は TechCrunch に対し概数4,000基と述べ、これは「中国の競合の2~3分の1」だとしています。この比較は誰も検証していません。
この裏側の計算資源の拡充は以前から公表されていました。2026年3月、Mistral は 8億3,000万ドルのデット調達を行い、パリ近郊のデータセンター向けに13,800基の Nvidia GB300 GPU を購入しました。ML4 がこのクラスターで学習されたかは不明であり、ここでは関連づけません。
なお、本記事のすべてのベンチマークの読み方に影響する事実が1つあります。強化学習(RL)の実行がまだ続いていることです。RL はポストトレーニング段階で、モデルが自身の試行にスコア付けされて改善していく工程です。Mistral によると、現時点で約3,000基のGPUを用い、1日あたり約330億トークンを生成しており、「飽和の兆候はない」とのこと。つまり、今日APIで呼べるモデルは、10月27日にウェイトが出るモデルとは別物になります。
Mistral Large 4 のベンチマーク
未完のRLがまず、この節の内容を暫定扱いにすべき理由です。もう1つは、Mistralの数値の多くが独立再現されておらず、再現されたものでも一致しない例があることです。
公開時点の独立評価は次の3類型に分かれます。
- 独立再現済み:Artificial Analysis(AA)の Cyber Index(CyberGym-E2E を含む)、および vals.ai の5つの評価(Terminal-Bench 4.0 を含む)。
- AAが実行したが未公開:Mistralのコーディング図表の脚注によると、DeepSWE、Terminal-Bench、SWE-Atlas のスコアは「ハーネスの一般公開に先立ち、Artificial Analysis が私的に評価した数値」を使用。ハーネス公開後にAAの Coding Agent Indexに掲載予定。それまではAAとMistral以外は検証不能。
- Mistralのみ:その他すべて。
表の最後の列に最も注意してください。ベンチマーク自体は独立グループが構築していても、そこに記載のML4のスコアがMistralの主張にすぎない場合があります。
ベンチマーク概要
|
ベンチマーク |
ML4の結果 |
競合 |
測定内容 |
|
DeepSWE v1.1 |
61.7%、AA が私的に実行 |
Kimi K3 69%、GLM-5.3 61%、DeepSeek V4 Pro 57%、Qwen3.8 Max 51%、Reflection Beam 44%(自己申告) |
長期的なソフトウェアエンジニアリング |
|
Terminal-Bench 4.0 |
vals.ai で44モデル中20位 |
複雑なターミナルワークフロー |
|
|
SWE-Atlas-QnA |
59.4%、AA が私的に実行 |
未公開 |
リポジトリ理解 |
|
Coding Agent Index |
49.8%、AA が私的に実行 |
DeepSeek V4 Pro 0813、Qwen3.8 Max を上回る |
上記3つのコーディング系ベンチの複合 |
|
AutomationBench |
59.9%(Mistral発表) |
Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Pro を上回る |
Gmail、Slack、Salesforce などでの657の業務ワークフロー |
|
AA-Briefcase |
Elo 1,393(MistralがAAの結果として引用) |
DeepSeek V4 Pro を上回る |
長期のナレッジワーク |
|
Dense 200 |
42%(Mistral発表) |
GPT-6 Astra 41% |
ビジュアルグラウンディング |
|
AA Cyber Index |
Grok 4.7 56%、MiMo-V2.6-Pro 56%、GPT-6 Luna 53% |
実在ソフトの欠陥発見と修正 |
|
|
CyberGym-E2E |
MiMo-V2.6-Pro 79%、GPT-6 Luna 78% |
実在の脆弱性を再現しパッチを当てる |
|
|
93%(Mistral発表) |
オープンウェイトでは「最高水準の一つ」(Mistral) |
40のセキュリティ競技課題 |
|
|
Finance Agent v2 |
全体75中22位、オープンウェイト32中7位 |
金融エージェントタスク |
|
|
Harvey's Legal Agent |
オープンウェイト31中1位 |
自律的な法務タスク |
|
|
2点満点中1.691(Mistral発表) |
Mistralがテストしたオープンモデル中最高 |
責任あるAI行動 |
|
|
93.3%(Mistral発表) |
「競合にこれ以上のスコアはなし」(Mistral) |
プロンプトインジェクション耐性 |
|
|
Vals Index |
オープンウェイト16中9位 |
広範な課題の総合指標 |
Mistral 4 のベンチマーク順位
Mistralの見出しと、上表の最終行を並べて読んでください。vals.ai の総合指標では、ML4 は全体で44中32位、オープンウェイトに限っても16中9位です。少なくとも総合では「世界最強のオープンソースモデルと競合」とは整合しにくい数字です。業種別の結果はずっと良好で、それ自体は正しいのですが、測っている範囲が狭い。ML4 を使うかどうかは、どの垂直分野に重点を置くかで決まります。
コーディング
見出しと詳細のギャップが最初に現れるのがコーディングです。Mistral の数字は一見良好に見えます。ただし DeepSWE の図を見ると、本文で触れていない点があります。最も高いバーは Kimi K3 の69%で、ML4 を7ポイント上回ります。ML4 は GLM-5.3 を僅差で上回る(62%対61%)ものの、1ポイント差はハーネスの違いの誤差範囲です。ハーネスとは、エージェント型ベンチマークでモデルを取り巻く足場(ツール、プロンプト、試行回数など)のこと。Mistral の図では競合ごとに異なるハーネスが使われています。Datacurve の ライブの DeepSWE リーダーボードでは、同一セットアップで GLM-5.3 と Kimi K3 がともに69%、DeepSeek V4 Pro が63%に到達。ML4はまだ掲載されていません。
Terminal-Bench では逆方向の効果が見えます。Mistral は28.3%と報告し、vals.ai の独立実行では22.73%。どちらかが誇張しているというより、1つのセットアップでの1つの数字は順位表にならないという示唆です。
人手評価のほうが興味深い結果です。Mistral が Surge AI に依頼したブラインド評価では、プロのアノテータがコーディング出力を1~5で採点し、 ML4 は5モデル中2位(3.74)。GLM-5.3(3.60)、Kimi K3(3.59)、GLM-5.2(3.40)を上回り、Claude Opus 5(4.22)には大差で及ばず。Kimi K3 は DeepSWE では ML4 を7ポイント上回るのに、人手評価では下回っています。テストを通す力と、読みやすいコードを書く力は別物ということです(しかも比較は Opus 5 で、より新しい 5.5 ではないため、クローズド最強との差はさらに広い可能性があります)。
Mistral 内部の2つ目の評価は、話を一層複雑にします。そこでは、ML4 はコーディングと金融で GLM-5.3 と「同等または近い」性能で、優位なのは CAD と STEM のみとしています。両者はほぼ互角と言ってよいでしょう。
金融
金融は、基準となる独立数値がある分、話が単純です。ML4 は vals.ai の Finance Agent v2 で54.68%。全体75中22位、オープンウェイト32中7位で、中位ど真ん中。Mistral の主張自体はさらに限定的で、このベンチで GPT-6 Astra を上回るというものです。
また、実務的な財務・会計タスクでスプレッドシートの作成・編集能力を試す FinWorkBench でも強い結果を報告していますが、これらは Mistral の図表に基づくもので、他所での再現はありません。
法務
法務は紙の上ではより良好に見えます。 Harvey's Legal Agent Benchmarkで ML4 は75中6位、オープンウェイト31中1位。スコアは15.83%です。
この数字は二度見してください。自律的な法務業務で世界6位ということは、約6件に1件を完了できるという意味です。ベンチは難しく、順位は事実ですが、「ML4 が監督なしで法務業務をこなせる」と受け取るべきではありません。現状、どのモデルもそこまでは到達していません。
ビジョンとビジュアルグラウンディング
ビジョンは逆のケースです。主張は大胆ですが、独立データはまだありません。目玉はビジュアルグラウンディングで、テキスト記述から画像内の特定の物体や領域を特定するタスク(「この図面のひび割れた溶接を見つけて」など)です。Mistral は Dense 200 で42%と報告し、GPT-6 Astra の41%をわずかに上回ります。1ポイント差で購買判断はできません。
また、ChartQA Pro や GDP.pdf(文書推論系)でも好成績だとしています。ビジョン関連の結果は、いずれもまだ独立再現されていません。ユースケースは産業色が強く、災害対応の衛星画像解析、技術図面の検査、大規模地理空間画像の走査などが挙げられています。
Mistral Large 4 はコーディングにどれほど向いている?
読者の多くが実際に ML4 を使うのはコーディングだと思うので、戻りましょう。オープンウェイトでは競合力はありますが、利用可能な中で最良のコーディングモデルではありませんし、Mistral 自身の図でも最良のオープンモデルではありません。数値の反復は避け、実務への翻訳だけ示します。
- 実在コードベースの不具合修正(エージェント的ソフトウェア工学):使えるが、Kimi K3 のほうが強そう。
- 大規模リポジトリ理解:有望だが、根拠は私的実行の1スコアに依存。
- 長時間(数時間規模)のエージェント運用:Mistral のRL設定は長軌跡向けだが、独立検証は未了。
- ターミナル中心の作業:現状、独立信号としては最も弱い。
ウェイト公開後に AA の公開 Coding Agent Index に ML4 が載るのを待ってから、「有力なオープンウェイトの一角」以上の評価を下すとよいでしょう。
なお、ここでオープンウェイトがもたらす価値はスコアとは無関係です。企業は ML4 を自社インフラで実行し、機密のソースコードを外部APIに送らずに済みます。機密コードベース向けのコーディングエージェントでは、これだけで選択が決まることがあります。
サイバーセキュリティにおける Mistral Large 4
これは Mistral の最も大胆な主張です。 AA が独立に評価する Artificial Analysis Cyber Indexでは、実在ソフトの脆弱性を見つけ、再現し、修正する能力を測ります。ML4 は50%で、18モデル中トップ5。これを上回るのは Grok 4.7、MiMo-V2.6-Pro、GPT-6 Luna のみで、GLM-5.3 Flash と同率です。Mistral は「中国以外で開発されたオープンウェイトモデルの中で大差のトップ」と主張し、AA の図とも整合します。
特に際立つのはインデックス構成要素の1つ、CyberGym-E2E。これはオープンソースソフトの実在脆弱性(CVE)を再現し、パッチを当てる課題です。ML4 は82%で、AA がテストした18モデル中1位。さらに Cybench(40のセキュリティ競技課題)でも93%を報告していますが、こちらは再現報告がありません。
拒否(セーフティブロック)のデータも興味深い。CyberGym-E2E では、AA の図によると Claude Opus 5.5 が約96%の課題で安全上の理由によりブロックされ、GPT-6 Astra は100%ブロック。これらのモデルはタスク自体が拒否されるためスコアがほぼゼロで、実力を示していません。拒否が正しい方針かは別議論です。
ここが Mistral の中核の訴えです。防御的なセキュリティ業務では、まず欠陥の再現(実在証明)から始まり、大規模コードベースを走査し、何百もの検知をトリアージする必要があります。業務の大半を拒否するモデルや、インシデント中にモデレーション方針が変わる可能性がある提供者はリスクです。Mistral の主張は、ML4 を自社インフラで動かせば、その挙動を自分たちで制御できるという点です。正当な防御業務をAIの安全策が阻むという、より広い論争は以前から続いています。
悪い側面も。ウェイトが公開されれば、攻撃者も同じ能力にアクセスできます。AA のインデックスは意図的に防御寄り(ソースコードを基に、動くエクスプロイトの構築は課さない)ですが、再現82%が攻撃能力82%を意味するわけではありません。それでも「クラッシュを再現」から「武器化」までの距離は無限ではありません。Mistral は公開までの3週間を、サイバーセキュリティリーダー、認定パートナー、当局とともに、意図的に不正挙動を引き出すレッドチーミングに費やすとしています。
Mistral Large 4 におけるオープンウェイトの意義
サイバーセキュリティの論点は、実のところオープンウェイトの意義そのもので、領域を超えて響きます。「モデルをダウンロードできる」という一言では不十分です。
銀行が ML4 を自社サーバーで動かせば、顧客データを Mistral に送らずに済みます。政府機関はデプロイ環境全体を制御できます。セキュリティチームは、提供者のモデレーション方針を待たずにモデル挙動を調整できます(前節のとおり、これは仮定ではありません)。提供者がダウンしたりバージョンを終了しても、自前運用は継続可能です。
オープンウェイトはカスタマイズも現実的にします。筆者は Mistral Forgeを4月に取り上げましたが、Mistral は ML4 が 「Forge で企業向けに提供しているのと同じ学習・カスタマイズ・RL環境」を使っていると述べています。自社データで ML4 をファインチューニングしたい組織にとって、Forge は有力な選択肢です。
用語を一言。オープンウェイトとは、学習済みモデルパラメータが公開されることを指します。学習データや学習コード、その他をオープンソースライセンスで公開することは含みません。Mistral の モデルページは ML4 をオープンウェイトと説明していますが、ライセンス条項は未公開です。公開までは、商用利用、ファインチューニング権、再配布などは未確定。制御性を核に据えたモデルについて「ライセンスを確認してください」と書くのは少々もどかしいですが、現状はそうです。
Mistral Large 4 と欧州の「AI主権」推進
制御性は Mistral の政治的メッセージの中心でもあります。フランスのマクロン大統領は Mistral の姿勢を 「AIにおける第三の道」と表現しました。第一は米国のクローズドモデル(高性能だが米国法と提供者方針に従う)、第二は中国のオープンモデル(高性能な場合もあるが、データレジデンシや地政学の懸念が欧州機関にとって大きい)。Mistral の提案は、オープンウェイト、欧州のインフラ、欧州法です。
これには、Mistral が「他のデジタルサービスプロバイダーから独立し、欧州法の下で、エンドツーエンドで運用」するとする欧州デプロイも含まれます。GDPR やセクターのデータレジデンシ規制の対象であれば、採用前にこの主張を Mistral のデータ処理契約と突き合わせて確認してください。
Mistral には資金面の裏付けもあります。ML4 は「サムスン主導、評価額2,100億ユーロの、欧州テック企業史上最大のエクイティ調達」とする30億ユーロのシリーズDで資金提供されたロードマップの第一里程標です。資金の大半は欧州のデータセンター能力の拡充に投じられます。
では、欧州は、モデルの稼働場所や方法に対する制御性を担保しながら、最前線レベルのモデルを生み出せるのか。ML4 は制御性の側面では強力なデータポイントです。一方でフロンティア性については、Vals Index で44中32位という結果が現状を物語ります。
Mistral Large 4 と他のオープンウェイトモデルの比較
欧州がまだ到達していないなら、誰が到達しているのか、そして ML4 はそれらとどう比べられるのか。各モデルのスコアはセットアップが違い、横並び表が比較可能性を示唆してしまうため、ここでは並べません。パラメータ数も能力の代理にはなりません。その下の表では位置づけだけ示します:
|
モデル |
アーキテクチャ |
ウェイト公開 |
強み |
出自 |
|
Mistral Large 4 |
MoE、総1T / アクティブ49B |
10月27日(予定) |
サイバーセキュリティ、法務(独立裏づけあり) |
フランス |
|
GLM-5.3 |
非公開 |
あり |
コーディング、STEM |
中国 |
|
DeepSeek V4 Pro |
MoE |
あり |
コーディング、数学 |
中国 |
|
Reflection Beam |
非公開 |
あり |
汎用推論 |
米国 |
|
Qwen3.8 Max |
非公開 |
未確認 |
多言語、コーディング |
中国 |
Mistral Large 4 vs. GLM-5.3
GLM-5.3 は中国発の強力なオープンモデルの一つで、最重要の比較対象です。コーディング節で述べた通り、Mistral の図では1ポイント差、人手評価は割れ、ライブの DeepSWE リーダーボードでは GLM-5.3 が69%に到達、ML4 は未掲載。双方が独立リーダーボードで並ぶまで引き分けと見るのが妥当です。
Mistral Large 4 vs. DeepSeek V4 Pro
Mistral が公開した比較(DeepSWE、Coding Agent Index、AutomationBench、AA-Briefcase)では ML4 が勝っていますが、いずれも独立確認はなく、ライブの DeepSWE リーダーボードでは DeepSeek V4 Pro が63%で、ML4 の62%を上回ります。金融の直接比較は未公表です。
Mistral Large 4 vs. Reflection Beam
Reflection Beam は西側のオープンウェイト有力株で、Mistral の「中国以外で最強」という主張の最も直接的な試金石です。データは乏しく、Mistral の DeepSWE 図では Beam は44%(ML4 より約18ポイント低い)が、これは自己申告値を AA 実行の数値と並べたものなので差には依拠できません。Reflection は Beam の規模も非公開で、スケール比較も不可能。ML4 はより広いマルチモーダル入力と、格段に強いサイバーセキュリティの公開実績を持ちます。
Mistral Large 4 はいつ使える?
比較が片付くのを待たなくても、ML4 を自分で試せます。これまでの展開は次の通り。
- 10月6日:パブリックプレビュー開始。誰でもmistral-large-4 を Mistral Studio経由で呼び出し可能に。
- プレビュー期間中:サイバーセキュリティリーダー、認定パートナー、当局には、レッドチーミング用に「モデレーションを抑制し、サイバー機能を拡張」した版を提供。Pierre Stock 氏は TechCrunch に対し、Mistral は「信頼できるパートナーや政府と連携し、オープンソースのウェイトが防御のために使え、悪用には使えないようにする」と説明。同時にRLは継続中で、APIモデルは変化し続けます。
- 10月27日:ウェイト公開予定。完全なアーキテクチャ詳細、追加ベンチマーク、ポストトレーニング手法も併せて公開。
ウェイトが公開され次第、この節を更新します。
Mistral Large 4 について、まだ不明な点
それまでは、不明点が多く残ります。この記事は公開当日に書いているので、リストは長めです。
- 最終ベンチマーク:RL が進行中のため、上記の全スコアは変わり得ます。Mistral は「大きく迅速な改善」を見込むとしていますが、未測定です。
- 独立したコーディング、ビジョン、ナレッジワークの結果:AA Cyber Index と vals.ai 以外は未再現。
- 価格:発表とドキュメントで不一致。プレビューレートが継続するか不明。
- ライセンス条項:「オープンウェイト」だけでは製品は作れません。
- 自前ホスティングのハードウェア要件:未公開。
- 完全なアーキテクチャ:ウェイト公開時に約束。アクティブ490億と520億の差の説明もあるかもしれません。
- コンテキストウィンドウ:Mistral のドキュメントは100万トークン、vals.ai は512K。
- 最終的な安全性評価:レッドチーミングは10月まで続行。
結論
Mistral Large 4 は、アクティブ490億パラメータのスパース(MoE)モデルで、マルチモーダル入力に対応し、オープンウェイトの公開が予定されています。公開初日時点では、Harvey の法務ベンチでオープンウェイト最上位である一方、Vals Index では44中32位、Mistral 自身のコーディング図では Kimi K3 に後れを取っています。
そもそもベンチマーク首位が Mistral の本当の賭けだとは思いません。賭けているのは、十分に高性能なオープンウェイトと自前ホスティングこそ、企業や政府が最も重視するという点です。サイバーセキュリティでの拒否データは、このパッケージが既存のセキュリティチームの課題を解くことを示す、これまでで最も明確な証拠でしょう。
注目すべきは10月27日。ウェイトが公開され、独立研究者が最終チェックポイントを自ら走らせ、Artificial Analysis と vals.aiが、学習継続中のプレビューではなく、Mistral が実際に出荷するモデルをテストできる日です。Le Chonk が発表どおりかどうか、そこで明らかになります。
MoE モデルの背後にある概念については、Introduction to Large Language Models コースで基礎を解説しています。Mistral の製品については、Mistral Forge、Mistral Large 3、Mistral Le Chat、およびターミナル型コーディングエージェントの Mistral Vibe 2.0 の記事をご覧ください。
FAQs
What is Mistral Large 4 (Le Chonk)?
2026年10月6日にパブリックプレビューで登場した、Mistral の新たなフラッグシップです。約1兆の総パラメータと、トークンあたり約490億のアクティブパラメータを持つ Mixture-of-Experts モデル。テキストと画像を入力でき、出力はテキスト。オープンウェイトは10月27日公開予定です。
Why is it called Le Chonk?
2026年6月に Mistral が冗談交じりに発表して削除した、架空の24兆パラメータモデル「Le Chaton Fat」への呼び戻しです。ジョークはAI界隈のSNSで広まり、実際に1兆パラメータのモデルが登場したとき、その名が引き継がれました。
What is Mistral Large 4 best at?
独立評価で最も強いのはサイバーセキュリティと法務です。モデルが実在ソフトの脆弱性を発見・再現・修正する力を測る Artificial Analysis Cyber Indexでトップ5(18モデル中)に入り、 Harvey's Legal Agent Benchmarkでは75中6位、オープンウェイト中1位です(いずれも10月6日時点)。一方、広範な Vals Indexでは44中32位で、垂直分野の強さと総合性能は別の物語を語ります。
Is Mistral Large 4 open source?
いいえ。オープンウェイトであり、オープンソースとは異なります。オープンウェイトはモデルパラメータが公開されることを意味しますが、学習データや学習コード、その他の構成要素の公開を必須とはしません。Mistral はまだライセンス条項を公開していないため、製品開発の前に必ず確認してください。
When can I download Mistral Large 4 weights?
2026年10月27日、 Axios によると。API はすでに Mistral Studio から利用できますが、プレビューは強化学習の途中にあり、公開されるウェイトは現在APIが提供するものと異なります。