Chuyển đến nội dung chính

Mistral Large 4 (Le Chonk): Tất cả những gì chúng ta biết

Mô hình open-weight nghìn tỷ tham số của Mistral dẫn đầu ở các benchmark an ninh mạng và pháp lý.
Đã cập nhật 9 thg 10, 2026  · 15 phút đọc

Khám phá cùng AI

ChatGPTClaudePerplexity

Ngày 6 tháng 10 năm 2026, Mistral ra mắt bản xem trước công khai của Mistral Large 4 (ML4), một mô hình 1 nghìn tỷ tham số với 49 tỷ tham số hoạt động, đầu vào văn bản và hình ảnh, và hứa hẹn sẽ mở trọng số vào cuối tháng. Đây là mô hình lớn nhất Mistral từng xây dựng, được huấn luyện từ đầu trên 3.800 GPU Nvidia Grace Blackwell tại các trung tâm dữ liệu của Mistral ở châu Âu.

Phần lớn năm vừa qua, những mô hình open-weight mạnh nhất đến từ các phòng thí nghiệm Trung Quốc (GLM, DeepSeek, Kimi, Qwen), trong khi các mô hình mạnh nhất nói chung vẫn đóng sau API của Mỹ. Mistral muốn có một vị trí thứ ba. Thông báo của hãng nói ML4 "đã đạt hiệu năng cạnh tranh với các mô hình nguồn mở mạnh nhất toàn cầu, đồng thời vượt trội đáng kể so với bất kỳ mô hình open-weight nào được phát triển ở Mỹ hoặc châu Âu."

Bức tranh thực tế phức tạp hơn bài đăng ra mắt gợi ý. Bên dưới, tôi trình bày kiến trúc, các benchmark (tách bạch giữa những gì đã được tái lập độc lập và những gì chưa), coding, thị giác, an ninh mạng, open weights, và những điều còn chưa rõ. Nếu bạn chỉ có thời gian cho một phần, hãy đọc phần an ninh mạng.

Câu trả lời nhanh

Mistral Large 4 (Le Chonk) là mô hình open-weight 1 nghìn tỷ tham số mà Mistral quảng bá là mạnh nhất được xây dựng ngoài Trung Quốc, đặc biệt cho an ninh mạng, tài chính, pháp lý và liên kết thị giác. Đánh giá độc lập ủng hộ các tuyên bố về an ninh mạng và pháp lý, đặt tài chính ở mức trung bình, và xếp ML4 thứ 32 trên 44 mô hình trong một chỉ số tổng hợp rộng. API đã hoạt động, và trọng số dự kiến ra mắt ngày 27 tháng 10.

Mistral Large 4 (Le Chonk) là gì?

Phiên bản tóm tắt đó bỏ qua nhiều điều, nên hãy bắt đầu từ cơ bản. ML4 là sản phẩm đầu bảng mới của Mistral và theo lời Mistral, là "mô hình lớn nhất và mạnh nhất cho đến nay." Le Chonk là biệt danh, dù phần ra mắt của Mistral đảo ngược cách gọi thường thấy: "Không chính thức là ML4, rất chính thức: le Chonk."

Đây là mô hình MoE (Hỗn hợp chuyên gia) đa phương thức ngay từ gốc. Con số tiêu đề là 1 nghìn tỷ tham số tổng và 49 tỷ tham số hoạt động mỗi token, dù chính tài liệu mô hình của Mistral liệt kê con số hơi khác (1,05T tổng, 52B hoạt động). Không nguồn nào giải thích khoảng chênh. (Vì sao "hoạt động" quan trọng sẽ trình bày ở phần kế tiếp.)

Mistral nhắm ML4 cho công việc doanh nghiệp: coding, an ninh mạng, tài chính, pháp lý, sản xuất và kỹ thuật, cùng các tác vụ thị giác như đọc bản vẽ kỹ thuật hoặc ảnh vệ tinh.

Thông số

Chi tiết

Tổng tham số

1 nghìn tỷ theo thông báo, 1,05T theo tài liệu

Tham số hoạt động

49B theo thông báo, 52B theo tài liệu

Kiến trúc

Mixture-of-Experts, kết hợp instruct và reasoning

Đầu vào

Văn bản và hình ảnh

Đầu ra

Chỉ văn bản

Cửa sổ ngữ cảnh

1M token theo tài liệu, 512K theo vals.ai (chưa ngã ngũ)

Hai hàng quan trọng nhất cho ai lên kế hoạch triển khai, và cả hai đều chưa rõ ràng: cửa sổ ngữ cảnh và giấy phép. Trước khi đi vào cách mô hình hoạt động, cái tên cũng đáng được giải thích nhanh.

Vì sao lại gọi là Le Chonk?

Tháng 6/2026, Mistral đăng thông báo châm biếm về "Le Chaton Fat," một mô hình hư cấu 24 nghìn tỷ tham số, rồi xóa. Internet vẫn lan truyền, thổi phồng thông số lên hàng trăm nghìn tỷ. Bốn tháng sau Mistral ra mô hình thật 1 nghìn tỷ tham số, và cái tên gần như tự chọn. Hết chuyện. Quay lại mô hình.

Mistral Large 4 hoạt động thế nào

Mistral chưa công bố đầy đủ chi tiết kiến trúc (hứa sẽ phát hành cùng trọng số), nên phần này chỉ dựa trên những gì đã tiết lộ.

1 nghìn tỷ tham số, 49 tỷ hoạt động

Một mô hình 1 nghìn tỷ tham số không dùng toàn bộ 1 nghìn tỷ tham số trên mỗi token. Mô hình MoE định tuyến mỗi token qua một tập con nhỏ các mạng con "chuyên gia," nên chi phí suy luận bám theo 49 tỷ tham số hoạt động. Điều đó đặt nó gần với một mô hình đặc dày ~50B hơn là 1T.

Vậy phục vụ rẻ chăng? Không. Tất cả 1 nghìn tỷ tham số vẫn phải nằm đâu đó trong bộ nhớ, nên tự vận hành ML4 đòi hỏi hạ tầng đa GPU nghiêm túc. MoE cũng khó phục vụ với độ trễ thấp hơn các mô hình đặc dày có cùng lượng tham số hoạt động. Mistral chưa công bố yêu cầu phần cứng, và sẽ không bất ngờ nếu ngoài các doanh nghiệp lớn và chính phủ, ít đội tự chạy trọn mô hình này.

Đầu vào đa phương thức

Những tham số hoạt động đó xử lý nhiều hơn văn bản. ML4 nhận cả hình ảnh, dù chỉ trả về văn bản. Mistral nói mô hình "lý luận mạnh mẽ trên các tài liệu phức tạp, biểu đồ và ảnh tự nhiên" và nhắm tới các ngành cần nhận thức thị giác, như kỹ thuật, sản xuất và quan sát Trái Đất. Bản demo đều mang tính công nghiệp: kiểm tra chi tiết cơ khí trong bản vẽ kỹ thuật, trích xuất bằng chứng từ PDF, quét ảnh vệ tinh gigapixel để tìm các đối tượng khó phát hiện.

Hơn 160 ngôn ngữ

Các khách hàng công nghiệp tương tự thường làm việc xuyên biên giới, đó là lúc ngôn ngữ quan trọng. Mistral nói "một phần đáng kể" dữ liệu huấn luyện là đa ngôn ngữ, bao phủ hơn 160 ngôn ngữ và mọi ngôn ngữ chính thức của EU. Với một công ty châu Âu chào mời các chính phủ châu Âu, đây là điểm bán hàng lớn.

Hạ tầng huấn luyện

Với thông điệp châu Âu, nơi huấn luyện cũng đáng kể. Theo Mistral, ML4 được huấn luyện từ đầu trên 3.800 GPU Nvidia Grace Blackwell tại các trung tâm dữ liệu của chính hãng ở châu Âu. Phó Chủ tịch Khoa học Mistral Pierre Stock nói với TechCrunch con số tròn là 4.000 và cho biết đó là "ít hơn hai đến ba lần so với các đối thủ Trung Quốc của chúng tôi." Chưa ai kiểm chứng so sánh đó.

Việc xây dựng năng lực tính toán đằng sau đã được công khai một thời gian. Tháng 3/2026, Mistral huy động 830 triệu USD nợ để mua 13.800 GPU Nvidia GB300 cho một trung tâm dữ liệu gần Paris. Mistral không nói ML4 được huấn luyện trên cụm đó cụ thể hay không, nên tôi sẽ không kết nối hai việc này.

Một chi tiết thay đổi cách bạn nên đọc mọi benchmark trong bài này. Chạy reinforcement learning (RL) vẫn đang tiếp diễn. RL là giai đoạn hậu huấn luyện nơi mô hình cải thiện bằng cách được chấm điểm trên chính các lần thử nghiệm nhiệm vụ của nó, và Mistral nói hiện đang dùng khoảng 3.000 GPU, tạo ra khoảng 33 tỷ token mỗi ngày và "chưa có dấu hiệu bão hòa." Vậy mô hình bạn gọi qua API hôm nay sẽ không phải là mô hình có trọng số phát hành vào ngày 27/10.

Benchmark của Mistral Large 4

Đợt RL chưa hoàn tất là lý do đầu tiên để coi mọi thứ trong phần này là tạm thời. Lý do thứ hai là hầu hết con số của Mistral chưa được tái lập độc lập, và những con số đã có thì không phải lúc nào cũng khớp.

Đánh giá độc lập khi ra mắt rơi vào ba nhóm:

  • Đã tái lập độc lập: Artificial Analysis (AA) Cyber Index, bao gồm thành phần CyberGym-E2E, và năm đánh giá của vals.ai, gồm Terminal-Bench 4.0.
  • Do AA chạy nhưng chưa công khai: một chú thích trên biểu đồ coding của Mistral nói điểm DeepSWE, Terminal-Bench và SWE-Atlas "dùng các con số AA đánh giá riêng trước khi bộ khung công khai ra mắt." Chúng sẽ xuất hiện trên Chỉ số Tác tử Coding của AA khi bộ khung đó phát hành. Cho đến khi đó, ngoài AA và Mistral, không ai kiểm tra được.
  • Chỉ Mistral: mọi thứ còn lại.

Hãy chú ý nhất tới cột cuối bảng. Một benchmark có thể do nhóm độc lập xây dựng trong khi điểm ML4 trên đó vẫn chỉ là tuyên bố của Mistral.

Tóm tắt benchmark

Benchmark

Kết quả ML4

Đối thủ

Đo lường gì

DeepSWE v1.1

61,7%, AA chạy riêng

Kimi K3 69%, GLM-5.3 61%, DeepSeek V4 Pro 57%, Qwen3.8 Max 51%, Reflection Beam 44% (tự báo cáo)

Kỹ nghệ phần mềm tầm xa

Terminal-Bench 4.0

28,3% theo Mistral, 22,73% theo vals.ai

Thứ 20/44 trên vals.ai

Quy trình terminal phức tạp

SWE-Atlas-QnA

59,4%, AA chạy riêng

Chưa công bố

Hiểu repository

Coding Agent Index

49,8%, AA chạy riêng

Trước DeepSeek V4 Pro 0813 và Qwen3.8 Max

Tổng hợp ba benchmark coding ở trên

AutomationBench

59,9% theo Mistral

Trước Kimi K3, MiMo-V2.6-Pro, DeepSeek V4 Pro

657 quy trình nghiệp vụ trên các ứng dụng như Gmail, Slack, Salesforce

AA-Briefcase

1.393 Elo, Mistral dẫn nguồn AA

Trước DeepSeek V4 Pro

Công việc tri thức tầm xa

Dense 200

42% theo Mistral

GPT-6 Astra 41%

Liên kết thị giác

AA Cyber Index

50%, top 5/18

Grok 4.7 56%, MiMo-V2.6-Pro 56%, GPT-6 Luna 53%

Tìm và sửa lỗi trong phần mềm thực

CyberGym-E2E

82%, #1/18

MiMo-V2.6-Pro 79%, GPT-6 Luna 78%

Tái tạo và vá một lỗ hổng thực

Cybench

93% theo Mistral

"Một trong những điểm cao nhất" cho open-weight, theo Mistral

40 thử thách thi an ninh

Finance Agent v2

54,68%

Thứ 22/75, thứ 7/32 open-weight

Tác vụ tác tử tài chính

Harvey's Legal Agent

15,83%, #6/75

#1/31 open-weight

Tác vụ pháp lý tự động

KORA Benchmark

1,691/2 theo Mistral

Cao nhất trong các mô hình mở mà Mistral thử

Hành vi AI có trách nhiệm

B3 Attack Resistance

93,3% theo Mistral

"Không có điểm cao hơn trong số đối thủ," theo Mistral

Kháng tiêm nhiễm prompt

Vals Index

48,05%, thứ 32/44

Thứ 9/16 open-weight

Tổng hợp rộng nhiều tác vụ

Xếp hạng benchmark của Mistral 4

Đọc hàng cuối cùng song song với tuyên bố tiêu đề của Mistral. Trên chỉ số rộng của vals.ai, ML4 đứng thứ 32/44 tổng thể và thứ 9/16 trong nhóm chỉ các mô hình open-weight. Khó mà dung hòa với "cạnh tranh với các mô hình nguồn mở mạnh nhất toàn cầu," ít nhất là xét tổng hợp. Kết quả theo ngành dọc của Mistral trông tốt hơn nhiều, và điều đó không sai. Chúng chỉ đo lường thứ hẹp hơn. Nếu bạn đang cân nhắc xây trên ML4, ngành dọc bạn quan tâm quan trọng hơn cả hai tiêu đề.

Coding

Coding là nơi khoảng cách giữa tiêu đề và chi tiết lộ rõ nhất. Con số của Mistral trông tốt qua loa. Nhưng nhìn vào biểu đồ DeepSWE của hãng, bạn sẽ thấy điều văn bản không nhắc: cột cao nhất là Kimi K3, ở mức 69%, cao hơn ML4 bảy điểm. ML4 nhỉnh hơn GLM-5.3 (62% so với 61%), nhưng một điểm nằm trong sai số do lựa chọn bộ khung (harness). "Harness" là giàn khung bao quanh mô hình trong một benchmark tác tử, tức công cụ, prompt, và số lần thử. Trên biểu đồ của Mistral, mỗi đối thủ chạy trong một bộ khung khác nhau. Trên bảng xếp hạng DeepSWE trực tiếp của chính Datacurve, chạy mọi mô hình trong cùng thiết lập, GLM-5.3 và Kimi K3 đều đạt 69% và DeepSeek V4 Pro đạt 63%. ML4 chưa được liệt kê.

Terminal-Bench cho thấy hiệu ứng tương tự theo hướng ngược lại. Mistral báo 28,3%, chạy độc lập của vals.ai được 22,73%. Tôi không coi đó là ai thổi phồng gì, chỉ nhắc rằng một con số từ một thiết lập không phải là xếp hạng.

Đánh giá của con người thú vị hơn. Trong một đánh giá mù Mistral đặt Surge AI thực hiện, các biên tập viên chuyên nghiệp chấm đầu ra mã từ 1 đến 5. ML4 đứng thứ hai trong năm (3,74), trên GLM-5.3 (3,60), Kimi K3 (3,59), và GLM-5.2 (3,40), và kém xa Claude Opus 5 (4,22). Lưu ý Kimi K3: hơn ML4 bảy điểm trên DeepSWE, nhưng lại xếp sau về ưu thích của con người. Vượt bài kiểm tra và viết mã khiến người khác thích đọc không phải cùng một kỹ năng. (Và đó là Opus 5, không phải 5.5 mới hơn, nên khoảng cách tới mô hình đóng tốt nhất có lẽ còn lớn hơn.)

Một đánh giá nội bộ thứ hai của Mistral làm mọi thứ rối thêm. Họ thấy ML4 "ngang hoặc gần" GLM-5.3 về coding và tài chính, và chỉ vượt trội trong CAD và STEM. Tôi sẽ coi hai bên ngang ngửa.

Tài chính

Mảng tài chính đơn giản hơn, chủ yếu vì có con số độc lập để bấu víu. ML4 đạt 54,68% trên Finance Agent v2 trên vals.ai, xếp thứ 22/75 tổng thể và thứ 7/32 trong nhóm open-weight. Ở giữa bảng một cách vững chắc. Tuyên bố thực tế của Mistral hẹp hơn: ML4 vượt GPT-6 Astra trên benchmark này.

Mistral cũng báo cáo kết quả mạnh trên FinWorkBench, kiểm tra việc mô hình có thể xây dựng và chỉnh sửa bảng tính cho các tác vụ tài chính và kế toán thực. Những con số đó đến từ biểu đồ của Mistral và chưa được tái lập ở nơi khác.

Pháp lý

Mảng pháp lý trông tốt hơn nhiều trên giấy tờ. Trên Harvey's Legal Agent Benchmark, ML4 xếp 6/75 và đứng đầu trong 31 mô hình open-weight. Điểm số là 15,83%.

Hãy đọc con số đó hai lần. Hạng sáu thế giới về công việc pháp lý tự động nghĩa là hoàn thành khoảng một nhiệm vụ trong sáu. Benchmark khó và xếp hạng là thật, nhưng không ai nên coi đây là "ML4 có thể làm việc pháp lý không giám sát." Chưa có mô hình nào làm được.

Thị giác và liên kết thị giác

Thị giác là trường hợp ngược lại: tuyên bố táo bạo, chưa có dữ liệu độc lập. Tuyên bố tiêu đề là về liên kết thị giác, tức xác định vị trí các đối tượng hay vùng cụ thể trong ảnh từ mô tả văn bản, như "tìm mối hàn nứt trong bản vẽ này" thay vì "mô tả bức ảnh." Mistral báo 42% trên Dense 200, nhỉnh hơn GPT-6 Astra ở 41%. Tôi sẽ không quyết định mua dựa trên một điểm chênh.

Mistral cũng nói ML4 thể hiện tốt trên ChartQA Pro và GDP.pdf, một benchmark suy luận tài liệu. Không có kết quả thị giác nào được tái lập độc lập đến lúc này. Các trường hợp sử dụng Mistral nêu đều mang tính công nghiệp, từ ảnh vệ tinh cho ứng phó thảm họa đến kiểm tra bản vẽ kỹ thuật và quét ảnh địa không gian cỡ lớn.

Mistral Large 4 giỏi coding đến đâu?

Quay lại coding, vì đây là thứ đa số độc giả sẽ dùng ML4 cho. ML4 cạnh tranh trong nhóm open-weight, nhưng không phải mô hình coding tốt nhất hiện có, thậm chí không phải mở tốt nhất trên chính biểu đồ của Mistral. Tôi sẽ không lặp lại con số. Đây là cách chúng dịch sang công việc bạn giao:

  • Sửa lỗi trong codebase thực (kỹ nghệ phần mềm tác tử): dùng được, nhưng Kimi K3 có vẻ mạnh hơn.
  • Hiểu một repository lớn: đầy hứa hẹn, dù dựa trên một điểm số chạy riêng tư.
  • Chạy tác tử dài nhiều giờ: thiết lập RL của Mistral được xây cho quỹ đạo dài, nhưng chưa ai kiểm chứng độc lập.
  • Công việc nặng terminal: tín hiệu độc lập yếu nhất tới nay.

Tôi sẽ đợi mục ML4 trên Chỉ số Tác tử Coding công khai của AA, dự kiến sau khi trọng số phát hành, trước khi gọi nó là hơn một lựa chọn open-weight đáng tin cậy.

Giá trị của open weights ở đây không liên quan đến điểm số. Một công ty có thể chạy ML4 trên hạ tầng của riêng mình và không bao giờ gửi mã nguồn sở hữu trí tuệ ra API bên ngoài. Với tác tử coding trên codebase mật, chỉ riêng điều đó có thể quyết định lựa chọn.

Mistral Large 4 cho an ninh mạng

Đây là tuyên bố táo bạo nhất của Mistral. Trên Artificial Analysis Cyber Index, đánh giá độc lập của AA về khả năng mô hình tìm, tái tạo và vá lỗ hổng trong phần mềm thực, ML4 đạt 50%. Điều đó đặt mô hình trong top 5 của 18 mô hình được kiểm tra. Chỉ Grok 4.7, MiMo-V2.6-Pro và GPT-6 Luna cao hơn, và GLM-5.3 Flash ngang điểm. Mistral nói ML4 "dẫn trước các mô hình open-weight phát triển ngoài Trung Quốc với khoảng cách lớn," và biểu đồ của AA phù hợp với điều đó.

Điểm nổi bật là CyberGym-E2E, một trong ba thành phần của chỉ số. Nó yêu cầu mô hình tái tạo một lỗ hổng thực trong phần mềm nguồn mở (một "CVE," tức lỗi bảo mật được ghi mục công khai) rồi vá nó. ML4 đạt 82%, đứng đầu trong 18 mô hình AA kiểm tra. Mistral cũng báo 93% trên Cybench, bộ 40 thử thách thi an ninh, dù chưa ai tái lập được điểm đó.

Dữ liệu từ chối cũng đáng chú ý. Trên CyberGym-E2E, biểu đồ của AA cho thấy Claude Opus 5.5 bị chặn vì lý do an toàn cho khoảng 96% tác vụ, và GPT-6 Astra bị chặn 100%. Những mô hình đó gần như bằng không điểm vì nhiệm vụ bị từ chối, nên điểm số không nói gì về khả năng thực sự. Việc từ chối có phải chính sách đúng hay không là một tranh luận khác.

Và đó là trọng tâm thông điệp của Mistral. Công việc an ninh phòng thủ thường bắt đầu bằng việc tái tạo lỗi để chứng minh nó tồn tại, và đội an ninh cần làm việc đó ở quy mô lớn, quét các codebase lớn và phân loại hàng trăm phát hiện. Một mô hình từ chối phần lớn khối lượng đó, hoặc nhà cung cấp có thể thay đổi quy tắc kiểm duyệt giữa lúc sự cố, là một rủi ro. Lập luận nêu ra của Mistral là chạy ML4 trên hạ tầng của bạn giúp bạn kiểm soát hành vi của mô hình. Cuộc tranh luận rộng hơn về các biện pháp bảo vệ AI chặn công việc phòng thủ hợp pháp đã diễn ra một thời gian.

Giờ là phần xấu: Khi trọng số được công khai, kẻ tấn công cũng có cùng khả năng. Chỉ số của AA cố tình mang tính phòng thủ (mô hình làm việc từ mã nguồn và không bao giờ bị yêu cầu xây một khai thác hoạt động), nên điểm 82% tái tạo không phải 82% năng lực tấn công. Dù vậy, khoảng cách từ "tái tạo một vụ sập" tới "vũ khí hóa nó" không phải vô hạn. Mistral đang dành ba tuần trước khi phát hành để red-team mô hình, tức cố tình khiến nó hành xử sai, với "các lãnh đạo an ninh mạng, đối tác đã thẩm định và cơ quan nhà nước."

Vì sao open weights quan trọng với Mistral Large 4

Trường hợp an ninh mạng thực chất là lập luận cho open weights, và nó vượt xa an ninh. "Bạn có thể tải mô hình" là nói giảm.

Một ngân hàng chạy ML4 trên máy chủ của mình sẽ không bao giờ gửi dữ liệu khách hàng tới Mistral. Một cơ quan chính phủ kiểm soát toàn bộ môi trường triển khai. Một đội an ninh có thể điều chỉnh hành vi mô hình mà không phải chờ chính sách kiểm duyệt của nhà cung cấp, điều mà sau phần trước không còn là lo ngại giả định. Và nếu nhà cung cấp gặp sự cố hoặc ngừng một phiên bản mô hình, các triển khai tự vận hành vẫn tiếp tục chạy.

Open weights cũng giúp tùy biến trở nên thực tế. Tôi đã đề cập tới Mistral Forge hồi tháng 4, và Mistral nói ML4 "dùng cùng môi trường huấn luyện, tùy biến và RL" mà hãng cung cấp cho khách hàng doanh nghiệp qua Forge. Với các tổ chức muốn fine-tune ML4 trên dữ liệu của riêng họ, Forge là lộ trình hiển nhiên.

Một từ về thuật ngữ. Open-weight nghĩa là tham số mô hình đã huấn luyện được công khai. Nó không có nghĩa dữ liệu huấn luyện, mã huấn luyện hay bất cứ thứ gì khác được phát hành theo giấy phép nguồn mở. Trang mô hình của Mistral mô tả ML4 là open-weight nhưng chưa công bố điều khoản giấy phép. Khi chưa có, quyền sử dụng thương mại, quyền fine-tune và phân phối lại đều là câu hỏi mở. Tôi thấy hơi khó chịu khi phải viết "kiểm tra giấy phép" về một mô hình có điểm bán là quyền kiểm soát, nhưng thực tế đang là vậy.

Mistral Large 4 và nỗ lực chủ quyền AI của châu Âu

Quyền kiểm soát cũng là trung tâm thông điệp chính trị của Mistral. Tổng thống Pháp Macron mô tả cách tiếp cận của Mistral là "con đường thứ ba trong AI". Hai con đường đầu là mô hình đóng của Mỹ, mạnh nhưng chịu luật Mỹ và chính sách nhà cung cấp, và mô hình mở của Trung Quốc, thường mạnh nhưng gây lo ngại về nơi lưu trữ dữ liệu và địa chính trị cho các tổ chức châu Âu. Đề nghị của Mistral là open weights, hạ tầng châu Âu và luật châu Âu.

Điều đó bao gồm một triển khai châu Âu mà Mistral nói họ vận hành "end-to-end, độc lập với các nhà cung cấp dịch vụ số khác và theo luật châu Âu." Nếu bạn chịu GDPR hoặc quy định lưu trú dữ liệu theo ngành, hãy kiểm tra tuyên bố đó với thỏa thuận xử lý dữ liệu của Mistral trước khi dựa vào nó.

Mistral cũng có tiền để hậu thuẫn. Mistral gọi ML4 là "cột mốc đầu tiên trên lộ trình được tài trợ bởi vòng Series D trị giá 3 tỷ €," do Samsung dẫn dắt với định giá 21 tỷ €, mà Mistral mô tả là vòng huy động vốn cổ phần lớn nhất từng được một công ty công nghệ châu Âu gọi vốn. Phần lớn sẽ đổ vào năng lực trung tâm dữ liệu ở châu Âu.

Vậy châu Âu có thể tạo ra các mô hình trình độ biên trong khi cho tổ chức nhiều kiểm soát hơn về nơi và cách mô hình chạy không? ML4 là dữ kiện mạnh cho nửa "kiểm soát." Còn nửa "trình độ biên," thứ hạng 32/44 trên Vals Index nói rằng châu Âu chưa ở đó.

Mistral Large 4 so với các mô hình open-weight khác

Nếu châu Âu chưa ở đó, hợp lý để hỏi ai đang ở đó, và ML4 so ra sao. Tôi không đưa điểm của mọi mô hình vào một bảng, vì chúng đến từ các thiết lập khác nhau và một bảng gộp sẽ ngụ ý có thể so sánh. Số tham số cũng không đại diện cho năng lựce. Bảng dưới chỉ đặt từng mô hình vào bối cảnh:

Mô hình

Kiến trúc

Có trọng số

Thế mạnh

Xuất xứ

Mistral Large 4

MoE, 1T tổng / 49B hoạt động

27 tháng 10 (kế hoạch)

An ninh mạng, pháp lý (được hỗ trợ độc lập)

Pháp

GLM-5.3

Chưa tiết lộ

Có

Coding, STEM

Trung Quốc

DeepSeek V4 Pro

MoE

Có

Coding, toán

Trung Quốc

Reflection Beam

Chưa tiết lộ

Có

Lý luận tổng quát

Mỹ

Qwen3.8 Max

Chưa tiết lộ

Chưa xác nhận

Đa ngôn ngữ, coding

Trung Quốc

Mistral Large 4 so với GLM-5.3

So sánh quan trọng nhất, vì GLM-5.3 là một trong các mô hình mở mạnh nhất của Trung Quốc. Như đã đề cập ở phần coding, hai bên cách nhau một điểm trên biểu đồ của Mistral, đánh giá con người chia phe, và GLM-5.3 đạt 69% trên bảng xếp hạng trực tiếp nơi ML4 chưa được kiểm thử. Hãy coi là hòa cho đến khi các bảng xếp hạng độc lập có cả hai.

Mistral Large 4 so với DeepSeek V4 Pro

ML4 thắng ở mọi so sánh Mistral công bố (DeepSWE, Coding Agent Index, AutomationBench, AA-Briefcase), nhưng không cái nào được xác nhận độc lập, và DeepSeek V4 Pro đạt 63% trên bảng xếp hạng DeepSWE trực tiếp, cao hơn 62% của ML4. Chưa có đối đầu công khai về tài chính.

Mistral Large 4 so với Reflection Beam

Reflection Beam là đối thủ open-weight phương Tây khác, khiến nó trở thành phép thử trực diện nhất cho tuyên bố "tốt nhất ngoài Trung Quốc" của Mistral. Dữ liệu còn mỏng. Biểu đồ DeepSWE của Mistral liệt Beam ở 44%, kém ML4 gần 18 điểm, nhưng đó là số tự báo cáo đặt cạnh số do AA chạy, nên tôi sẽ không dựa vào khoảng cách này. Reflection chưa tiết lộ kích thước Beam, nên cũng không so quy mô được. ML4 có đầu vào đa phương thức rộng hơn và bằng chứng an ninh mạng công bố mạnh hơn hẳn.

Khi nào bạn có thể dùng Mistral Large 4?

Bạn không phải chờ các so sánh ngã ngũ trước khi tự thử ML4. Lịch triển khai đến nay:

  1. Ngày 6/10: bắt đầu bản xem trước công khai. Ai cũng có thể gọi mistral-large-4 qua Mistral Studio.
  2. Trong thời gian xem trước: các lãnh đạo an ninh mạng, đối tác đã thẩm định và cơ quan nhà nước nhận phiên bản với "kiểm duyệt giảm và năng lực an ninh mở rộng" để red-team. Pierre Stock nói với TechCrunch rằng Mistral sẽ "làm việc với đối tác tin cậy và chính phủ để đảm bảo trọng số nguồn mở có thể dùng để phòng thủ, chứ không để thực hiện tấn công ác ý." Trong khi đó, RL tiếp tục, nên mô hình API vẫn thay đổi.
  3. Ngày 27/10: dự kiến phát hành trọng số kèm chi tiết kiến trúc đầy đủ, thêm benchmark và phương pháp hậu huấn luyện của Mistral.

Tôi sẽ cập nhật phần này khi trọng số phát hành.

Những điều ta vẫn chưa biết về Mistral Large 4

Cho đến khi đó, còn nhiều điều bỏ ngỏ. Tôi viết bài này vào ngày ra mắt, nên danh sách dài:

  • Hiệu năng benchmark cuối cùng: RL vẫn chạy, nên mọi điểm số ở trên có thể thay đổi. Mistral kỳ vọng "cải thiện lớn và nhanh," nhưng chưa ai đo lường.
  • Kết quả độc lập về coding, thị giác và công việc tri thức: ngoài AA Cyber Index và vals.ai, chưa có gì được tái lập.
  • Giá: thông báo và trang tài liệu bất nhất, và mức giá xem trước có thể không giữ nguyên.
  • Điều khoản giấy phép: bạn không thể xây sản phẩm dựa trên "open-weight" nếu không có giấy phép.
  • Yêu cầu phần cứng để tự vận hành: chưa công bố.
  • Kiến trúc đầy đủ: hứa sẽ phát hành kèm trọng số, có thể cũng giải thích chênh lệch 49B so với 52B tham số hoạt động.
  • Cửa sổ ngữ cảnh: 1M token theo tài liệu của Mistral, 512K theo vals.ai.
  • Đánh giá an toàn cuối cùng: red-team kéo dài tới hết tháng 10.

Kết luận

Mistral Large 4 là mô hình thưa 1 nghìn tỷ tham số với 49 tỷ tham số hoạt động, đầu vào đa phương thức, và open weights đang trên đường phát hành. Ngày ra mắt, ta thấy nó là mô hình open-weight tốt nhất trên benchmark pháp lý của Harvey, nhưng lại đứng thứ 32/44 trên Vals Index và kém Kimi K3 trên biểu đồ coding của chính Mistral.

Tôi không nghĩ dẫn đầu benchmark mới là canh bạc thực sự của Mistral. Canh bạc là open weights đủ mạnh và khả năng tự vận hành là điều doanh nghiệp và chính phủ quan tâm nhất. Dữ liệu từ chối trong an ninh mạng là bằng chứng rõ nhất đến nay rằng gói này giải quyết một vấn đề các đội an ninh đang có sẵn.

Ngày 27 tháng 10 là mốc cần theo dõi. Khi đó trọng số phát hành, các nhà nghiên cứu độc lập có thể tự chạy checkpoint cuối cùng, và Artificial Analysis cùng vals.ai có thể kiểm thử mô hình Mistral thực sự phát hành thay vì bản xem trước vẫn đang huấn luyện. Le Chonk khi đó hoặc là đạt như bài đăng ra mắt, hoặc là không.

Để tìm hiểu nền tảng về các khái niệm đằng sau mô hình MoE, khóa học Giới thiệu về Mô hình Ngôn ngữ Lớn của chúng tôi bao quát các điều cơ bản. Để biết thêm về các sản phẩm của Mistral, xem bài viết của chúng tôi về Mistral Forge, Mistral Large 3, Mistral Le Chat, và Mistral Vibe 2.0, tác tử coding dựa trên terminal.


Oluseye Jeremiah's photo
Author
Oluseye Jeremiah
LinkedIn

Nhà viết nội dung về công nghệ, chuyên về AI, ML và khoa học dữ liệu, giúp làm rõ và phổ biến những ý tưởng phức tạp.

FAQs

Mistral Large 4 (Le Chonk) là gì?

Đây là sản phẩm đầu bảng mới của Mistral, ra mắt bản xem trước công khai vào ngày 6 tháng 10 năm 2026: một mô hình Mixture-of-Experts với khoảng 1 nghìn tỷ tham số tổng và 49 tỷ tham số hoạt động mỗi token. Nhận văn bản và hình ảnh, tạo đầu ra văn bản, và dự kiến mở trọng số vào ngày 27 tháng 10.

Vì sao gọi là Le Chonk?

Đó là gợi nhắc tới "Le Chaton Fat," một mô hình hư cấu 24 nghìn tỷ tham số mà Mistral đùa vui công bố rồi xóa vào tháng 6/2026. Trò đùa lan rộng trên mạng xã hội AI, và khi một mô hình thật nghìn tỷ tham số xuất hiện, cái tên đi theo.

Mistral Large 4 mạnh nhất ở đâu?

Kết quả độc lập mạnh nhất là ở an ninh mạng và công việc pháp lý. ML4 xếp trong top 5/18 mô hình trên Artificial Analysis Cyber Index và đứng thứ 6/75 trên Harvey's Legal Agent Benchmark, đứng đầu trong các mô hình open-weight (tính đến 6/10). Trên chỉ số rộng Vals Index, ML4 xếp thứ 32/44, nên điểm mạnh theo ngành dọc và hiệu năng tổng thể kể hai câu chuyện khác nhau.

Mistral Large 4 có phải nguồn mở không?

Không. Đây là open-weight, khác với nguồn mở. Open-weight nghĩa là tham số mô hình được công khai, nhưng không nhất thiết dữ liệu huấn luyện, mã huấn luyện hay thành phần khác. Mistral chưa công bố điều khoản giấy phép, nên hãy kiểm tra trước khi xây sản phẩm dựa trên mô hình.

Khi nào tôi có thể tải trọng số Mistral Large 4?

Ngày 27 tháng 10 năm 2026, theo Axios. API hiện có qua Mistral Studio, nhưng bản xem trước vẫn đang trong reinforcement learning, nên trọng số phát hành sẽ khác với những gì API phục vụ hôm nay.

Chủ đề
Trí tuệ Nhân tạo

Học cùng DataCamp

Khóa học

Hiểu về Trí tuệ Nhân tạo

2 giờ
427.3K
Tìm hiểu các khái niệm cơ bản về Trí tuệ Nhân tạo như học máy, học sâu, NLP, AI tạo sinh và hơn thế nữa.
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow
Liên quan

blog

Claude Opus 4.6: Tính năng, Điểm chuẩn, Bài kiểm tra thực hành và hơn thế nữa

Mô hình mới nhất của Anthropic dẫn đầu ở mã hóa tác tử và lập luận phức tạp. Thêm vào đó, nó có cửa sổ ngữ cảnh 1M.
Matt Crabtree's photo

Matt Crabtree

10 phút

Xem ThêmXem Thêm