Kursus
Pada 6 Oktober 2026, Mistral meluncurkan pratinjau publik Mistral Large 4 (ML4), model dengan 1 triliun parameter dan 49 miliar parameter aktif, input teks-dan-gambar, serta bobot terbuka yang dijanjikan rilis sebelum akhir bulan. Ini adalah model terbesar yang pernah dibangun Mistral, dilatih dari nol pada 3.800 GPU Nvidia Grace Blackwell di pusat data Mistral sendiri di Eropa.
Sepanjang tahun lalu, model open-weight terkuat banyak berasal dari laboratorium di Tiongkok (GLM, DeepSeek, Kimi, Qwen), sementara model terkuat secara umum tetap tertutup di balik API AS. Mistral mengincar posisi ketiga. Pengumumannya menyatakan ML4 "sudah mencapai performa yang kompetitif dengan model open-source terkuat secara global, sekaligus secara signifikan melampaui model open-weight mana pun yang dikembangkan di AS atau Eropa."
Gambaran nyatanya lebih berantakan daripada yang tersirat di pos peluncuran. Di bawah ini, saya membahas arsitektur, tolok ukur (memisahkan mana yang sudah direproduksi secara independen dan mana yang belum), pengodean, visi, keamanan siber, bobot terbuka, dan hal-hal yang masih belum diketahui. Jika Anda hanya punya waktu untuk satu bagian, pilih keamanan siber.
Jawaban Singkat
Mistral Large 4 (Le Chonk) adalah model open-weight dengan 1 triliun parameter yang diposisikan Mistral sebagai yang terkuat di luar Tiongkok, terutama untuk keamanan siber, keuangan, hukum, dan visual grounding. Evaluasi independen mendukung klaim keamanan siber dan hukum, menempatkan keuangan di tengah-tengah, dan memberi peringkat ML4 ke-32 dari 44 model pada indeks agregat luas. API sudah aktif, dan bobot dijadwalkan rilis pada 27 Oktober.
Apa Itu Mistral Large 4 (Le Chonk)?
Versi singkat itu masih banyak yang terlewat, jadi mari mulai dari dasar. ML4 adalah flagship baru Mistral dan, menurut Mistral, "model terbesar dan paling andal hingga saat ini." Le Chonk adalah julukannya, meski salinan peluncuran Mistral membalik kebiasaan: "Secara tidak resmi ML4, sangat resmi: le Chonk."
Ini adalah model Mixture-of-Experts (MoE) multimodal asli. Angka utama: total 1 triliun parameter dan 49 miliar aktif per token, meski dokumen model Mistral mencantumkan angka sedikit berbeda (total 1,05T, aktif 52B). Tidak ada sumber yang menjelaskan selisih ini. (Mengapa "aktif" penting dibahas di bagian berikut.)
Mistral membidik ML4 untuk pekerjaan perusahaan: pengodean, keamanan siber, keuangan, hukum, manufaktur dan rekayasa, serta tugas visual seperti membaca gambar teknik atau citra satelit.
|
Spesifikasi |
Detail |
|
Total parameter |
1 triliun menurut pengumuman, 1,05T menurut dokumen |
|
Parameter aktif |
49B menurut pengumuman, 52B menurut dokumen |
|
Arsitektur |
Mixture-of-Experts, hibrida instruct dan reasoning |
|
Input |
|
|
Output |
Hanya teks |
|
Jendela konteks |
1M token menurut dokumen, 512K menurut vals.ai (belum jelas) |
Dua baris paling penting bagi siapa pun yang merencanakan penerapan, dan keduanya belum pasti: jendela konteks dan lisensi. Sebelum membahas cara kerja model, namanya layak dijelaskan singkat.
Mengapa Disebut Le Chonk?
Pada Juni 2026, Mistral memposting pengumuman satir untuk "Le Chaton Fat," model fiksi dengan 24 triliun parameter, lalu menghapusnya. Internet terus menggulirkannya, membesar-besarkan spesifikasi hingga ratusan triliun. Empat bulan kemudian Mistral benar-benar merilis model dengan triliun parameter, dan namanya praktis memilih dirinya sendiri. Itu saja ceritanya. Kembali ke model.
Cara Kerja Mistral Large 4
Mistral belum menerbitkan detail arsitektur lengkap (dijanjikan bersamaan dengan bobot), jadi bagian ini berpegang pada yang sudah diungkap.
1 triliun parameter, 49 miliar aktif
Model dengan 1 triliun parameter tidak menggunakan semua 1 triliun itu pada setiap token. Model MoE merutekan tiap token melalui subset kecil sub-jaringan "pakar", sehingga komputasi inferensi mengikuti 49 miliar parameter aktif. Itu menempatkannya lebih dekat ke model dense ~50B parameter daripada 1T.
Murah untuk disajikan? Tidak. Semua 1 triliun parameter tetap harus berada di memori, jadi self-hosting ML4 memerlukan infrastruktur multi-GPU yang serius. Model MoE juga lebih sulit disajikan dengan latensi rendah dibandingkan model dense dengan jumlah parameter aktif yang sama. Mistral belum memublikasikan kebutuhan perangkat keras, dan saya akan terkejut jika banyak tim di luar perusahaan besar dan pemerintah menjalankan model penuh sendiri.
Input multimodal
Parameter aktif itu menangani lebih dari sekadar teks. ML4 juga menerima gambar, meski hanya mengembalikan teks. Mistral mengatakan model ini "mampu bernalar dengan kuat pada dokumen, bagan, dan gambar natural yang kompleks" dan menargetkan industri yang membutuhkan persepsi visual, seperti rekayasa, manufaktur, dan pengamatan bumi. Demo yang ditampilkan semuanya industrial: memeriksa komponen mekanis dalam gambar teknik, mengambil bukti dari PDF, memindai citra satelit gigapiksel untuk objek yang sulit ditemukan.
160+ bahasa
Pelanggan industrial yang sama sering bekerja lintas batas, di sinilah bahasa berperan. Mistral menyatakan "porsi signifikan" data pelatihan bersifat multibahasa, mencakup lebih dari 160 bahasa dan semua bahasa resmi UE. Bagi perusahaan Eropa yang membidik pemerintah Eropa, ini bagian penting dari proposisi.
Infrastruktur pelatihan
Untuk proposisi Eropa, lokasi pelatihan juga penting. Menurut Mistral, ML4 dilatih dari nol pada 3.800 GPU Nvidia Grace Blackwell di pusat data Eropa miliknya. VP Sains Mistral Pierre Stock memberi angka kisaran 4.000 kepada TechCrunch dan mengatakan itu "dua hingga tiga kali lebih sedikit daripada kompetitor Tiongkok kami." Belum ada yang memverifikasi perbandingan itu.
Pembangunan komputasinya sudah lama diketahui publik. Pada Maret 2026, Mistral menggalang utang US$830 juta untuk membeli 13.800 GPU Nvidia GB300 bagi pusat data dekat Paris. Mistral tidak menyebut apakah ML4 dilatih di kluster tersebut, jadi saya tidak akan menghubungkan keduanya.
Satu detail mengubah cara Anda membaca setiap tolok ukur di artikel ini. Proses reinforcement learning (RL) masih berjalan. RL adalah tahap pasca-pelatihan saat model meningkat dengan dinilai atas upayanya sendiri menyelesaikan tugas, dan Mistral menyatakan saat ini menggunakan sekitar 3.000 GPU, menghasilkan sekitar 33 miliar token per hari, dan "belum menunjukkan tanda-tanda jenuh." Jadi model yang bisa Anda panggil melalui API hari ini tidak akan sama dengan model yang bobotnya dirilis pada 27 Oktober.
Tolok Ukur Mistral Large 4
RL yang belum selesai adalah alasan pertama untuk memperlakukan semua di bagian ini sebagai sementara. Alasan kedua: sebagian besar angka Mistral belum direproduksi secara independen, dan yang sudah pun tidak selalu cocok.
Evaluasi independen saat peluncuran terbagi tiga kelompok:
- Direproduksi secara independen: Artificial Analysis (AA) Cyber Index, termasuk komponen CyberGym-E2E, dan lima evaluasi vals.ai, termasuk Terminal-Bench 4.0.
- Dijalankan oleh AA, tetapi belum publik: catatan kaki pada bagan pengodean Mistral menyebut skor DeepSWE, Terminal-Bench, dan SWE-Atlas "menggunakan angka yang dievaluasi secara privat oleh Artificial Analysis sebelum harness diluncurkan ke publik." Angka-angka itu akan muncul di Coding Agent Index AA setelah harness dirilis. Sampai saat itu, tak ada pihak di luar AA dan Mistral yang bisa memeriksanya.
- Hanya Mistral: sisanya.
Perhatikan kolom terakhir tabel. Sebuah tolok ukur bisa dibuat oleh pihak independen, sementara skor ML4 di dalamnya tetap hanya klaim Mistral.
Ringkasan tolok ukur
|
Tolok ukur |
Hasil ML4 |
Pesaing |
Apa yang diukur |
|
DeepSWE v1.1 |
61,7%, dijalankan privat oleh AA |
Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (laporan mandiri) |
Rekayasa perangkat lunak horizon panjang |
|
Terminal-Bench 4.0 |
28,3% menurut Mistral, 22,73% menurut vals.ai |
Peringkat 20 dari 44 di vals.ai |
Alur kerja terminal yang kompleks |
|
SWE-Atlas-QnA |
59,4%, dijalankan privat oleh AA |
Tidak dipublikasikan |
Pemahaman repositori |
|
Coding Agent Index |
49,8%, dijalankan privat oleh AA |
Di depan DeepSeek V4 Pro 0813 dan Qwen3.8 Max |
Komposit dari tiga tolok ukur pengodean di atas |
|
AutomationBench |
59,9% menurut Mistral |
Di depan Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro |
657 alur kerja bisnis di aplikasi seperti Gmail, Slack, dan Salesforce |
|
AA-Briefcase |
1.393 Elo, dikutip Mistral sebagai AA |
Di depan DeepSeek V4 Pro |
Pekerjaan pengetahuan horizon panjang |
|
Dense 200 |
42% menurut Mistral |
GPT-6 Astra 41% |
Visual grounding |
|
AA Cyber Index |
Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53% |
Menemukan dan memperbaiki cacat pada perangkat lunak nyata |
|
|
CyberGym-E2E |
MiMo-V2.6-Pro 79%, GPT-6 Luna 78% |
Mereproduksi dan menambal kerentanan nyata |
|
|
93% menurut Mistral |
"Salah satu yang tertinggi" untuk open-weight, menurut Mistral |
40 tantangan kompetisi keamanan |
|
|
Finance Agent v2 |
Peringkat 22 dari 75, ke-7 dari 32 open-weight |
Tugas agen keuangan |
|
|
Harvey's Legal Agent |
#1 dari 31 open-weight |
Tugas hukum otonom |
|
|
1,691 dari 2 menurut Mistral |
Tertinggi di antara model terbuka yang diuji Mistral |
Perilaku AI yang bertanggung jawab |
|
|
93,3% menurut Mistral |
"Tidak ada skor lebih tinggi di antara pesaing," menurut Mistral |
Ketahanan terhadap injeksi prompt |
|
|
Vals Index |
Ke-9 dari 16 open-weight |
Agregat luas lintas tugas |
Peringkat tolok ukur Mistral 4
Baca baris terakhir berdampingan dengan klaim utama Mistral. Pada indeks luas vals.ai, ML4 berada di peringkat ke-32 dari 44 secara keseluruhan dan ke-9 dari 16 di antara model open-weight saja. Sulit dipadankan dengan "kompetitif dengan model open-source terkuat secara global," setidaknya secara agregat. Hasil vertikal Mistral terlihat jauh lebih baik, dan itu tidak salah. Mereka hanya mengukur sesuatu yang lebih sempit. Jika Anda memutuskan apakah akan membangun di atas ML4, vertikal yang Anda pedulikan lebih penting daripada klaim mana pun.
Pengodean
Pengodean adalah tempat kesenjangan antara tajuk dan detail pertama kali terlihat. Angka Mistral tampak bagus sekilas. Namun, lihat bagan DeepSWE-nya, Anda akan melihat sesuatu yang tidak disebutkan teksnya. Batang tertinggi adalah Kimi K3, di 69%, tujuh poin di atas ML4. ML4 sedikit unggul dari GLM-5.3 (62% versus 61%), tetapi satu poin sangat mudah masuk dalam noise pilihan harness. "Harness" adalah perancah yang membungkus model saat tolok ukur agentic, yaitu alat, prompt, dan berapa banyak percobaan yang diberikan; dan pada bagan Mistral setiap pesaing berjalan di harness berbeda. Pada papan peringkat DeepSWE live milik Datacurve, yang menjalankan setiap model dalam setup yang sama, GLM-5.3 dan Kimi K3 sama-sama mencapai 69% dan DeepSeek V4 Pro mencapai 63%. ML4 belum tercantum.
Terminal-Bench menunjukkan efek serupa dari arah lain. Mistral melaporkan 28,3%, sedangkan run independen vals.ai mendapatkan 22,73%. Saya tidak membaca itu sebagai ada yang melebih-lebihkan, hanya pengingat bahwa satu angka dari satu setup bukanlah peringkat.
Evaluasi manusia lebih menarik. Dalam evaluasi buta yang ditugaskan Mistral kepada Surge AI, anotator profesional menilai keluaran pengodean dari 1 hingga 5. ML4 berada di posisi kedua dari lima (3,74), di depan GLM-5.3 (3,60), Kimi K3 (3,59), dan GLM-5.2 (3,40), serta jauh di belakang Claude Opus 5 (4,22). Perhatikan Kimi K3: tujuh poin di atas ML4 pada DeepSWE, tetapi tertinggal pada preferensi manusia. Lulus tes dan menulis kode yang enak dibaca bukan keterampilan yang sama. (Dan itu Opus 5, bukan 5,5 yang lebih baru, jadi jarak ke model tertutup terbaik mungkin lebih lebar.)
Evaluasi internal kedua dari Mistral membuatnya makin kabur. Evaluasi itu menemukan ML4 "setara atau mendekati" GLM-5.3 dalam pengodean dan keuangan, dan lebih disukai hanya dalam CAD dan STEM. Saya akan menyebut keduanya kurang lebih berimbang.
Keuangan
Keuangan lebih sederhana, terutama karena ada angka independen sebagai jangkar. ML4 mencetak 54,68% pada Finance Agent v2 di vals.ai, yang menempatkannya ke-22 dari 75 secara keseluruhan dan ke-7 dari 32 di antara model open-weight. Kokoh di tengah. Klaim Mistral sebenarnya lebih sempit: bahwa ML4 mengungguli GPT-6 Astra pada tolok ukur ini.
Mistral juga melaporkan hasil kuat pada FinWorkBench, yang menguji apakah model dapat membangun dan mengedit spreadsheet untuk tugas keuangan dan akuntansi nyata. Angka-angka itu berasal dari bagan Mistral dan belum direproduksi di tempat lain.
Hukum
Bidang hukum terlihat jauh lebih baik di atas kertas. Pada Harvey's Legal Agent Benchmark, ML4 berada di peringkat ke-6 dari 75 dan pertama di antara 31 model open-weight. Skornya 15,83%.
Baca angka itu dua kali. Peringkat keenam di dunia pada pekerjaan hukum otonom berarti menyelesaikan sekitar satu dari enam tugas. Tolok ukurnya sulit dan peringkatnya nyata, tetapi tidak ada yang boleh menafsirkan ini sebagai "ML4 bisa melakukan kerja hukum tanpa supervisi." Belum ada model yang bisa.
Visi dan visual grounding
Visi adalah kasus sebaliknya: klaim berani, belum ada data independen. Klaim utama tentang visual grounding, yaitu menemukan objek atau area spesifik dalam gambar dari deskripsi teks, seperti "temukan las retak di gambar ini" alih-alih "jelaskan gambar ini." Mistral melaporkan 42% pada Dense 200, sedikit di atas GPT-6 Astra pada 41%. Saya tidak akan mendasarkan keputusan pembelian pada selisih satu poin.
Mistral juga menyatakan ML4 tampil baik pada ChartQA Pro dan GDP.pdf, sebuah tolok ukur penalaran dokumen. Tidak ada hasil visi yang direproduksi secara independen sejauh ini. Kasus penggunaan yang disorot Mistral sebagian besar industrial, dari citra satelit untuk respons bencana hingga pemeriksaan gambar teknik dan pemindaian citra geospasial besar.
Seberapa Baik Mistral Large 4 untuk Pengodean?
Kembali ke pengodean, karena ini yang paling banyak digunakan pembaca untuk ML4. Model ini kompetitif di antara model open-weight, tetapi bukan model pengodean terbaik yang tersedia, dan bahkan bukan yang open terbaik di bagan Mistral sendiri. Saya tidak akan mengulang angka. Inilah terjemahan hasilnya ke jenis pekerjaan yang akan Anda berikan:
- Memperbaiki isu dalam codebase nyata (rekayasa perangkat lunak agentic): bisa dipakai, tetapi Kimi K3 tampak lebih kuat.
- Memahami repositori besar: menjanjikan, meski bertumpu pada satu skor yang dijalankan privat.
- Run agen multi-jam yang panjang: setup RL Mistral dibangun untuk trajektori panjang, tetapi belum ada yang menguji itu secara independen.
- Pekerjaan yang berat di terminal: sinyal independen terlemah sejauh ini.
Saya akan menunggu entri ML4 di Coding Agent Index publik milik AA, yang diharapkan setelah bobot dirilis, sebelum menyebutnya lebih dari opsi open-weight yang kredibel.
Nilai tambah bobot terbuka di sini tidak ada hubungannya dengan skor. Perusahaan bisa menjalankan ML4 di infrastruktur sendiri dan tidak pernah mengirimkan kode sumber proprieter ke API pihak luar. Untuk agen pengodean pada codebase rahasia, itu saja bisa menjadi penentu pilihan.
Mistral Large 4 untuk Keamanan Siber
Ini adalah klaim paling berani Mistral. Pada Artificial Analysis Cyber Index, evaluasi independen AA tentang seberapa baik model menemukan, mereproduksi, dan menambal kerentanan di perangkat lunak nyata, ML4 mencetak 50%. Itu menempatkannya dalam lima besar dari 18 model yang diuji. Hanya Grok 4.7, MiMo-V2.6-Pro, dan GPT-6 Luna yang lebih tinggi, dan GLM-5.3 Flash menyamainya. Mistral mengatakan ML4 "memimpin model open-weight yang dikembangkan di luar Tiongkok dengan selisih lebar," dan bagan AA konsisten dengan itu.
Yang paling menonjol adalah CyberGym-E2E, salah satu dari tiga komponen indeks. Ia meminta model mereproduksi kerentanan nyata dalam perangkat lunak open source ("CVE," artinya cacat keamanan yang tercatat publik) lalu menambalnya. ML4 mencetak 82%, pertama dari 18 model yang diuji AA. Mistral juga melaporkan 93% pada Cybench, kumpulan 40 tantangan kompetisi keamanan, meski belum ada yang mereproduksi skor itu.
Data penolakan juga menarik. Pada CyberGym-E2E, bagan AA menunjukkan Claude Opus 5,5 diblokir karena alasan keamanan pada sekitar 96% tugas, dan GPT-6 Astra pada 100%. Model-model itu mencetak hampir nol karena tugasnya ditolak, jadi skor mereka tidak mengatakan apa pun tentang apa yang sebenarnya bisa mereka lakukan. Apakah menolak adalah kebijakan yang tepat adalah perdebatan lain.
Dan itulah inti proposisi Mistral. Pekerjaan keamanan defensif sering dimulai dengan mereproduksi cacat untuk membuktikan keberadaannya, dan tim keamanan perlu melakukannya dalam jumlah besar, memindai codebase besar dan menilai ratusan temuan. Model yang menolak sebagian besar beban kerja itu, atau yang penyedianya bisa mengubah aturan moderasi di tengah insiden, menjadi liabilitas. Argumen yang dinyatakan Mistral adalah bahwa menjalankan ML4 di infrastruktur Anda sendiri menempatkan perilakunya di bawah kendali Anda. Perdebatan lebih luas tentang pagar pengaman AI yang menghambat pekerjaan defensif yang sah sudah lama berlangsung.
Sekarang sisi buruknya: Setelah bobot dipublikasikan, penyerang mendapat kapabilitas yang sama. Indeks AA sengaja bersifat defensif (model bekerja dari kode sumber dan tidak pernah diminta membangun eksploit yang berfungsi), jadi skor reproduksi 82% bukan berarti 82% kapabilitas ofensif. Namun, jarak dari "mereproduksi crash" ke "memperalatnya" tidak tak terbatas. Mistral menggunakan tiga minggu sebelum rilis untuk red-teaming model, yaitu sengaja mencoba membuatnya berperilaku menyimpang, bersama "pemimpin keamanan siber, mitra terverifikasi, dan otoritas negara."
Mengapa Bobot Terbuka Penting untuk Mistral Large 4
Kasus keamanan siber ini pada dasarnya adalah argumen untuk bobot terbuka, dan cakupannya jauh melampaui keamanan. "Anda bisa mengunduh model" meremehkannya.
Bank yang menjalankan ML4 di servernya sendiri tidak pernah mengirim data nasabah ke Mistral. Lembaga pemerintah mengendalikan seluruh lingkungan penerapan. Tim keamanan dapat menyesuaikan perilaku model tanpa menunggu kebijakan moderasi penyedia, yang—setelah bagian sebelumnya—bukan kekhawatiran hipotetis. Dan jika penyedia down atau menghentikan versi model, penerapan self-hosted tetap berjalan.
Bobot terbuka juga membuat kustomisasi menjadi praktis. Saya membahas Mistral Forge pada April lalu, dan Mistral mengatakan ML4 "menggunakan lingkungan pelatihan, kustomisasi, dan RL yang sama" yang ditawarkan kepada pelanggan enterprise melalui Forge. Bagi organisasi yang ingin menyetel ML4 dengan data mereka sendiri, Forge adalah rute yang jelas.
Sekilas soal istilah. Open-weight berarti parameter model terlatih tersedia publik. Itu tidak berarti data pelatihan, kode pelatihan, atau komponen lain dirilis di bawah lisensi open-source. Halaman model Mistral menggambarkan ML4 sebagai open-weight tetapi belum menerbitkan ketentuan lisensi. Sampai itu terjadi, penggunaan komersial, hak fine-tuning, dan redistribusi semuanya masih tanda tanya. Agak membuat frustasi menulis "periksa lisensi" tentang model yang seluruh proposisinya adalah kendali, tetapi memang itulah kondisinya.
Mistral Large 4 dan Dorongan Kedaulatan AI Eropa
Kendali juga berada di pusat proposisi politik Mistral. Presiden Prancis Macron menggambarkan pendekatan Mistral sebagai "jalan ketiga dalam AI". Dua jalan pertama adalah model tertutup AS, kapabel tetapi tunduk pada hukum AS dan kebijakan penyedia, dan model terbuka Tiongkok, sering kapabel tetapi menjadi kekhawatiran residensi data dan geopolitik bagi institusi Eropa. Tawaran Mistral adalah bobot terbuka, infrastruktur Eropa, dan hukum Eropa.
Itu mencakup penerapan Eropa yang Mistral klaim dioperasikan "end-to-end, independen dari penyedia layanan digital lain dan di bawah hukum Eropa." Jika Anda tunduk pada GDPR atau aturan residensi data sektoral, cocokkan klaim itu dengan perjanjian pemrosesan data Mistral sebelum mengandalkannya.
Mistral juga punya pendanaan untuk mendukung proposisi ini. Mistral menyebut ML4 "tonggak pertama dalam roadmap yang didanai oleh Seri D €3 miliar kami," ronde yang dipimpin Samsung pada valuasi €21 miliar, yang oleh Mistral digambarkan sebagai rundingan ekuitas terbesar yang pernah dihimpun perusahaan teknologi Eropa. Sebagian besar dananya masuk ke kapasitas pusat data Eropa.
Jadi, bisakah Eropa memproduksi model level frontier sambil memberi organisasi lebih banyak kendali atas di mana dan bagaimana model tersebut berjalan? ML4 adalah data point kuat untuk sisi kendali. Pada sisi frontier, peringkat ke-32 dari 44 pada Vals Index menyiratkan Eropa belum sampai.
Mistral Large 4 vs. Model Open-Weight Lain
Jika Eropa belum sampai, wajar bertanya siapa yang sudah, dan bagaimana ML4 dibandingkan dengan mereka. Saya tidak menaruh skor setiap model dalam satu tabel, karena berasal dari setup berbeda dan tabel gabungan akan menyiratkan keterbandingan. Jumlah parameter juga bukan proksi kapabilitas eiter. Tabel di bawah hanya menempatkan masing-masing:
|
Model |
Arsitektur |
Bobot tersedia |
Kekuatan |
Asal |
|
Mistral Large 4 |
MoE, total 1T / aktif 49B |
27 Oktober (direncanakan) |
Keamanan siber, hukum (didukung independen) |
Prancis |
|
GLM-5.3 |
Tidak diungkap |
Ya |
Pengodean, STEM |
Tiongkok |
|
DeepSeek V4 Pro |
MoE |
Ya |
Pengodean, matematika |
Tiongkok |
|
Reflection Beam |
Tidak diungkap |
Ya |
Penalaran umum |
AS |
|
Qwen3.8 Max |
Tidak diungkap |
Belum dikonfirmasi |
Multibahasa, pengodean |
Tiongkok |
Mistral Large 4 vs. GLM-5.3
Perbandingan paling penting, karena GLM-5.3 adalah salah satu model terbuka Tiongkok terkuat. Seperti dibahas di bagian pengodean, keduanya terpaut satu poin pada bagan Mistral, evaluasi manusia terbelah, dan GLM-5.3 mencapai 69% pada papan peringkat live tempat ML4 belum diuji. Sebut saja seri sampai papan peringkat independen mencantumkan keduanya.
Mistral Large 4 vs. DeepSeek V4 Pro
ML4 menang di setiap perbandingan yang Mistral publikasikan (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase), tetapi tak satu pun terkonfirmasi independen, dan DeepSeek V4 Pro mencapai 63% di papan peringkat DeepSWE live, di atas 62% ML4. Tidak ada head-to-head yang dipublikasikan untuk keuangan.
Mistral Large 4 vs. Reflection Beam
Reflection Beam adalah penantang open-weight Barat lainnya, yang menjadikannya ujian paling langsung untuk klaim Mistral "terbaik di luar Tiongkok." Datanya tipis. Bagan DeepSWE Mistral mencantumkan Beam di 44%, hampir 18 poin di bawah ML4, tetapi itu angka laporan mandiri yang dibandingkan dengan skor yang dijalankan AA, jadi saya tidak akan bersandar pada jarak itu. Reflection belum mengungkap ukuran Beam, jadi perbandingan skala juga tidak mungkin. ML4 memang punya input multimodal yang lebih luas dan bukti keamanan siber terpublikasi yang jauh lebih kuat.
Kapan Anda Bisa Menggunakan Mistral Large 4?
Anda tidak perlu menunggu perbandingan itu tuntas sebelum mencoba ML4 sendiri. Berikut rollout sejauh ini:
- 6 Oktober: pratinjau publik dimulai. Siapa pun bisa memanggil mistral-large-4 melalui Mistral Studio.
- Selama pratinjau: pemimpin keamanan siber, mitra terverifikasi, dan otoritas negara mendapatkan versi dengan "moderasi yang dikurangi dan kapabilitas siber yang diperluas" untuk red-teaming. Pierre Stock mengatakan kepada TechCrunch bahwa Mistral akan "bekerja dengan mitra tepercaya dan pemerintah untuk memastikan bobot open source dapat digunakan untuk bertahan, bukan untuk melakukan serangan jahat." Sementara itu, pelatihan RL berlanjut, jadi model API terus berubah.
- 27 Oktober: bobot dijadwalkan rilis bersamaan dengan detail arsitektur lengkap, lebih banyak tolok ukur, dan metodologi pasca-pelatihan Mistral.
Saya akan memperbarui bagian ini saat bobot dirilis.
Apa yang Masih Belum Kita Ketahui tentang Mistral Large 4
Sampai saat itu, masih banyak yang terbuka. Saya menulis ini pada hari peluncuran, jadi daftarnya panjang:
- Performa tolok ukur final: RL masih berjalan, jadi setiap skor di atas bisa berubah. Mistral memperkirakan "peningkatan besar dan cepat," tetapi belum ada yang mengukurnya.
- Hasil independen untuk pengodean, visi, dan pekerjaan pengetahuan: di luar AA Cyber Index dan vals.ai, belum ada yang direproduksi.
- Harga: pengumuman dan halaman dokumen tidak sejalan, dan tarif pratinjau mungkin tidak berlanjut.
- Ketentuan lisensi: Anda tidak bisa membangun produk hanya berdasar "open-weight" tanpa lisensi.
- Kebutuhan perangkat keras untuk self-hosting: belum dipublikasikan.
- Arsitektur lengkap: dijanjikan bersama bobot, yang mungkin juga menjelaskan selisih parameter aktif 49B versus 52B.
- Jendela konteks: 1M token menurut dokumen Mistral, 512K menurut vals.ai.
- Evaluasi keselamatan final: red-teaming berlangsung hingga Oktober.
Kesimpulan
Mistral Large 4 adalah model sparse dengan 1 triliun parameter dan 49 miliar parameter aktif, input multimodal, serta bobot terbuka yang akan datang. Pada hari peluncuran, kita melihat model ini terbaik di antara open-weight pada tolok ukur hukum Harvey, namun ke-32 dari 44 pada Vals Index dan di belakang Kimi K3 pada bagan pengodean Mistral sendiri.
Saya tidak berpikir kepemimpinan tolok ukur adalah taruhan utama Mistral. Taruhannya adalah bahwa bobot terbuka yang kapabel dan self-hosting adalah hal yang paling dipedulikan perusahaan dan pemerintah. Data penolakan di keamanan siber adalah bukti paling jelas sejauh ini bahwa paket ini menyelesaikan masalah yang sudah dihadapi tim keamanan.
27 Oktober adalah tanggal yang patut diperhatikan. Saat itulah bobot dirilis, peneliti independen bisa menjalankan checkpoint final sendiri, dan Artificial Analysis serta vals.ai dapat menguji model yang benar-benar dirilis Mistral alih-alih pratinjau yang masih dilatih. Le Chonk akan terbukti sepadan dengan pos peluncurannya, atau tidak.
Untuk latar belakang konsep di balik model MoE, kursus kami Pengantar Large Language Models membahas dasarnya. Untuk info lebih lanjut tentang produk Mistral, lihat ulasan kami tentang Mistral Forge, Mistral Large 3, Mistral Le Chat, dan Mistral Vibe 2.0, agen pengodean berbasis terminal.
Penulis teknis yang mengkhususkan diri pada AI, ML, dan ilmu data, membuat gagasan kompleks menjadi jelas dan mudah diakses.
FAQs
Apa itu Mistral Large 4 (Le Chonk)?
Ini adalah flagship baru Mistral, diluncurkan dalam pratinjau publik pada 6 Oktober 2026: model Mixture-of-Experts dengan sekitar 1 triliun parameter total dan 49 miliar aktif per token. Model ini menerima teks dan gambar, menghasilkan teks, dan bobot terbukanya direncanakan untuk 27 Oktober.
Mengapa disebut Le Chonk?
Ini merujuk kembali ke "Le Chaton Fat," model fiksi 24 triliun parameter yang sempat diumumkan Mistral secara bercanda, lalu dihapus, pada Juni 2026. Lelucon itu menyebar di media sosial AI, dan ketika model sungguhan dengan triliun parameter hadir, namanya ikut terbawa.
Mistral Large 4 paling unggul di bidang apa?
Hasil independen terkuatnya ada di keamanan siber dan pekerjaan hukum. Model ini berada di lima besar dari 18 model pada Artificial Analysis Cyber Index dan peringkat keenam dari 75 pada Harvey's Legal Agent Benchmark, pertama di antara model open-weight (keduanya per 6 Oktober). Pada Vals Index yang luas, model ini berada di peringkat ke-32 dari 44, jadi kekuatan vertikal dan performa keseluruhan menyampaikan cerita yang berbeda.
Apakah Mistral Large 4 open source?
Tidak. Ini open-weight, yang berbeda. Open-weight berarti parameter model tersedia publik, tetapi tidak berarti data pelatihan, kode pelatihan, atau komponen lainnya ikut tersedia. Mistral belum menerbitkan ketentuan lisensi, jadi periksalah sebelum membangun produk di atas model ini.
Kapan saya bisa mengunduh bobot Mistral Large 4?
27 Oktober 2026, menurut Axios. API sudah tersedia melalui Mistral Studio, namun pratinjau masih dalam reinforcement learning, jadi bobot rilis akan berbeda dari yang dilayani API hari ini.

