Tracks
Chúng tôi đã viết bài về các mô hình Llama của Meta đều đặn (Llama 2, Llama 3, v.v.). Rồi Llama 4 ra mắt vào tháng 4/2025 và vấp phải chỉ trích rộng rãi, khi nhiều kênh truyền thông và cả giám đốc AI sắp rời công ty xác nhận rằng kết quả điểm chuẩn đã bị thao túng bằng các mô hình con chuyên biệt không bao giờ được công bố công khai.
Sau đó, các cập nhật ngừng hẳn. Cùng thời điểm, Meta thông báo chuyển Horizon Worlds sang chỉ hỗ trợ di động, đồng nghĩa chấm dứt bản VR mà trước đây từng là tương lai của công ty. Nó trông như một công ty đang hụt chân trên hai mặt trận cùng lúc.
Ngày 8/4/2026, Meta ra mắt Muse Spark, mô hình đầu tiên từ Meta Superintelligence Labs. Thông cáo báo chí lặp lại cụm từ "trí tuệ siêu vi cá nhân" hơi quá nhiều lần. Bỏ qua lớp đó, bên dưới là một mô hình thực sự đưa Meta trở lại cuộc thảo luận ở tuyến đầu.
Nếu bạn muốn xem mô hình mới của Meta so với một trong những đối thủ mạnh nhất hiện tại ra sao, tôi khuyên đọc hướng dẫn Muse Spark vs Claude Opus 4.6. Bạn cũng có thể đọc hướng dẫn về Muse Glimmer và hướng dẫn chạy Muse Glimmer cục bộ.
Muse Spark là gì?
Muse Spark là mô hình lý luận đa phương thức gốc có thể xử lý văn bản, hình ảnh, âm thanh và sử dụng công cụ trong một kiến trúc duy nhất. Nó hỗ trợ chuỗi suy nghĩ trực quan, nghĩa là mô hình có thể giải quyết các bài toán dựa trên hình ảnh theo từng bước thay vì chỉ đưa ra một đáp án. Dàn tác tử đa mô-đun cũng là một phần của thiết lập, chúng ta sẽ nói tới.
Các mô hình Llama trước đây trả lời dựa trên đối sánh mẫu từ huấn luyện. Muse Spark sẽ suy luận qua vấn đề trước khi phản hồi. Đó mới là sự dịch chuyển thực sự.
Ai đứng sau?
Meta Superintelligence Labs (MSL) được thành lập ngày 30/6/2025 khi Mark Zuckerberg tái cơ cấu hoạt động AI của công ty. Alexandr Wang, cựu CEO Scale AI, gia nhập với vai trò Giám đốc AI; Meta đã đầu tư khoảng 14 tỷ USD vào Scale AI như một phần của thỏa thuận.
Nat Friedman, cựu CEO GitHub, dẫn dắt mảng sản phẩm và nghiên cứu ứng dụng, còn Shengjia Zhao, đồng sáng tạo GPT-4 và o1 tại OpenAI (chính o1 mà Muse Spark hiện được so sánh điểm chuẩn), là Nhà khoa học trưởng.
Có một yếu tố thứ ba đáng nhắc đến: Yann LeCun, Nhà khoa học trưởng AI lâu năm của Meta và là người ủng hộ mã nguồn mở nổi bật nhất của công ty, đã rời đi vào tháng 11/2025. Việc ra đi diễn ra sau những thay đổi tổ chức hạn chế vai trò của ông và sự chuyển dịch của nhóm sang phát triển đóng.
Có gì mới ở Muse Spark (và vì sao đáng quan tâm)?
Các điểm nổi bật là các chế độ lý luận, chuỗi huấn luyện được xây lại, và tập trung có chủ đích vào mảng sức khỏe. Hãy lần lượt xem.
Ba chế độ lý luận
Muse Spark cung cấp ba cách tương tác, và phân biệt giữa chúng là điều đáng hiểu trước khi bạn thử mô hình.
- Instant là mặc định cho truy vấn thông thường. Phản hồi nhanh mà không suy luận kéo dài, tương tự một mô hình trò chuyện tiêu chuẩn.
- Thinking dùng chuỗi suy nghĩ mở rộng. Mô hình mất nhiều thời gian hơn, đi qua các bước trung gian và thường làm tốt hơn ở các bài khó. Đây là chế độ đứng sau phần lớn kết quả điểm chuẩn trong bài viết này.
- Contemplating là chế độ thú vị nhất. Phần dưới sẽ nói kỹ hơn.
Một điều cần biết trước: Chế độ Contemplating được triển khai dần và chưa có cho tất cả người dùng vào ngày ra mắt. Nếu bạn chưa thấy, đó là điều bình thường.
Chế độ Contemplating
Chế độ Contemplating khởi tạo nhiều tác tử lý luận chạy song song, rồi kết hợp đầu ra của chúng thành một phản hồi duy nhất. Nếu như Deep Think của Gemini và GPT Pro mode của OpenAI mở rộng lý luận bằng cách nghĩ lâu hơn, thì Muse Spark mở rộng bằng cách nghĩ theo chiều rộng. Nhiều tác tử làm việc đồng thời thay vì một tác tử nghĩ lâu hơn.
Lập luận của Meta là cách tiếp cận này cho kết quả tương đương với độ trễ thấp hơn, vì các tác tử chạy song song thay vì tuần tự. Chưa có xác nhận độc lập về độ trễ, nhưng các con số điểm chuẩn từ chế độ Contemplating dẫn đầu ở một số bài đánh giá khó (sẽ bàn ngay).
Đây là tính năng ở thời gian suy luận, không phải thay đổi kiến trúc. Bản thân mô hình không đổi.
Mở rộng học tăng cường và nén suy nghĩ
Meta đã xây lại hoàn toàn ngăn xếp huấn luyện trong chín tháng phát triển Muse Spark. Các tuyên bố về học tăng cường (RL) đặc biệt đến từ blog kỹ thuật của Meta và chưa được xác minh độc lập.
Chi tiết thú vị hơn là kỹ thuật nhóm nghiên cứu gọi là nén suy nghĩ. Trong huấn luyện RL, mô hình được thưởng khi trả lời đúng nhưng bị phạt vì thời gian suy nghĩ, tương ứng với số token đầu ra quá nhiều. Điều này tạo ra hành vi ba pha trong các tác vụ phức tạp như toán học.
Đầu tiên, mô hình cải thiện bằng cách nghĩ lâu hơn. Sau đó, hình phạt độ dài có hiệu lực và buộc mô hình giải cùng bài toán với ít token hơn nhiều. Ở một thời điểm nào đó, nó lại mở rộng suy luận và vượt qua các trần hiệu năng trước đây trong khi vẫn dùng ít token hơn.
Kết quả thực tiễn: mô hình học cách làm được nhiều hơn với ít hơn. Tuyên bố này dựa trên các đường cong huấn luyện của chính Meta và chưa được kiểm chứng độc lập.
Ít tài nguyên tính toán hơn 10 lần
Meta cho biết kiến trúc mới của họ sánh ngang hiệu năng của Llama 4 Maverick với lượng tính toán huấn luyện ít hơn gấp mười lần. Đó là câu chuyện về hiệu quả kiến trúc, không phải trần hiệu năng của Muse Spark. Llama 4 Maverick đạt 18 trên Artificial Analysis Intelligence Index. Muse Spark đạt 52.
Các con số hiệu quả token từ lần chạy độc lập của Artificial Analysis cũng chỉ theo hướng đó. Muse Spark dùng 58 triệu token đầu ra. GPT-5.4 dùng 120 triệu. Claude Opus 4.6 dùng 157 triệu.
Sức khỏe: trọng tâm có chủ đích
Sức khỏe là lợi thế điểm chuẩn rõ ràng nhất của Muse Spark, và đó là chủ đích. Meta đã làm việc với hơn 1.000 bác sĩ để tuyển chọn dữ liệu huấn luyện cho suy luận về sức khỏe.
Mô hình có thể tạo các hiển thị tương tác về thành phần dinh dưỡng, thông tin thuốc và sinh lý học vận động. Trên HealthBench Hard, Muse Spark đạt 42,8 so với 40,1 của GPT-5.4 và 20,6 của Gemini 3.1 Pro. Khoảng cách với Gemini vẫn giữ khi đánh giá độc lập.
Rõ ràng đây là câu trả lời của Meta cho ChatGPT Health. Lập luận của Meta về lý do có thể cạnh tranh là bối cảnh xã hội từ 3 tỷ người dùng, điều có thể mang lại lợi thế trong việc hiểu cách mọi người thực sự đặt câu hỏi về sức khỏe. Liệu điều đó có giữ vững cho các truy vấn phức tạp hay bất thường, thay vì những câu hỏi thường ngày xuất hiện trong điểm chuẩn, còn đáng theo dõi.
Còn Llama thì sao?
Cộng đồng nhà phát triển chỉ hỏi một điều, và xứng đáng một câu trả lời thẳng thắn.
Muse Spark không phải mã nguồn mở. Mọi mô hình Llama đến Llama 4 đều phát hành kèm trọng số để nhà phát triển tải về và chạy cục bộ. Các cộng đồng như r/LocalLLaMA được xây dựng trên điều đó. Trường hợp sử dụng này đã không còn.
Lý do mà Meta nêu ra một phần là cạnh tranh: các phòng thí nghiệm Trung Quốc, bao gồm DeepSeek, dùng trọng số Llama để tăng tốc nghiên cứu của họ. Wang nói công ty "hy vọng" sẽ mở mã nguồn các phiên bản Muse trong tương lai, không kèm mốc thời gian. "Hy vọng" đang gánh rất nhiều trong câu này.
Nhóm Llama đã được chuyển vào phòng thí nghiệm của Wang, và Llama 4 là mô hình cuối cùng từ cấu trúc cũ. Liệu Llama sẽ song hành cùng Muse hay âm thầm bị loại bỏ, Meta chưa nói.
Kết quả điểm chuẩn của Muse Spark
Điểm chuẩn với Muse Spark có một điều đáng nêu ngay từ đầu. Với lịch sử Llama 4 của Meta, hãy tách biệt số liệu tự báo cáo và số liệu được xác minh độc lập.
Đây là các kết quả ở chế độ Thinking, nơi tập trung dữ liệu so sánh công bằng nhất.

Nguồn: Meta Superintelligence Labs / ai.meta.com
Chế độ Contemplating có một bộ kết quả riêng cho các bài đánh giá khó nhất. Nó dẫn đầu ở Humanity's Last Exam và FrontierScience Research, nhưng kém GPT-5.4 Pro và Gemini 3.1 Deep Think ở các bài vật lý IPhO 2025 Theory. Tất cả đều từ báo cáo của Meta, nên hãy coi là gợi ý có tính định hướng chứ chưa ngã ngũ.

Nguồn: Meta Superintelligence Labs / ai.meta.com
Bức tranh độc lập từ Artificial Analysis thì cân bằng hơn. Họ xếp Muse Spark thứ tư trên Intelligence Index, sau Gemini 3.1 Pro Preview, GPT-5.4 và Claude Opus 4.6. Vẫn thuộc top 5 toàn cầu. Các con số cũng cho thấy rõ điểm yếu: ARC-AGI-2 và Terminal-Bench 2.0 đáng lưu ý nếu mã hóa hoặc suy luận trừu tượng quan trọng cho trường hợp sử dụng của bạn.
Kiểm thử Muse Spark
Với các điểm chuẩn đó, hãy thử kiểm tra Muse Spark. Tôi sẽ đánh giá mô hình ở suy luận nhiều bước, hiểu hình ảnh, và gỡ lỗi mã.
Bài test 1: Chuỗi logic Fibonacci–nhị phân (độ ổn định suy luận nối tiếp)
Trong bài test đầu tiên, tôi nhắm đến khả năng suy luận nâng cao của Muse Spark qua một bài tập nhiều bước. Mô hình cần:
- Xác định số hạng Fibonacci chính xác
- Chuyển chính xác sang nhị phân
- Đếm bit chính xác
- Sinh số nguyên tố trong một khoảng đã tính
- Thực hiện một phép cộng lớn
Prompt đã dùng là:
Step 1: Find the 13th number in the Fibonacci sequence (starting with F1=1, F2=1). Let this be X.
Step 2: Convert X into a binary string (Base 2).
Step 3: Count the number of '1's in that binary string. Let this count be C.
Step 4: Identify all prime numbers (p) such that 20 ≤ p ≤ (C × 100).
Step 5: Calculate the sum of these primes. What is the final result?
Muse Spark làm rất tốt và giải đúng ngay lần đầu. Điều này đặc biệt ấn tượng vì GPT-5.4 thất bại ở bước cuối và chỉ thành công khi chia thành hai bước (liệt kê số nguyên tố rồi mới cộng).

Bài test 2: Hiểu hình ảnh và suy luận bán hàng trên biểu đồ chuỗi thời gian nhiều đường
Meta cho rằng Muse Spark rất giỏi hiểu hình ảnh phức tạp, nên tôi dùng biểu đồ chuỗi thời gian nhiều đường sau để xem nó có thể nhận diện các mẫu và chuyển thành gợi ý hữu ích không.

Prompt như sau:
Examine this multi-line time-series of monthly active users for three products. Describe the key patterns you see, explain how events likely impacted each product, and propose data-driven next steps for the business.

Muse Spark nhận diện đúng tất cả các mẫu, cho thấy khả năng nhận dạng hình ảnh hoạt động tốt.

Dữ liệu dùng là ngẫu nhiên, nên không có đáp án đúng sai rõ ràng. Dù vậy, Muse Spark nhận diện đủ sự kiện và lý giải theo từng sản phẩm, từng thời điểm, và rút ra kết luận hợp lý. Thậm chí nó còn phân tích thay đổi tổng MAU (người dùng hoạt động hàng tháng) của các tổ hợp sản phẩm mà không được yêu cầu, là một điểm cộng.

Các bước tiếp theo đề xuất đều phù hợp với phân tích về mẫu MAU và tác động của sự kiện. Muse Spark xác định chủ đề quan trọng nhất cho mỗi sản phẩm (kịch bản ra mắt cho A, định giá cho B, mở rộng quy mô cho C), và đưa ra hành động cụ thể, hợp lý.
Bài test 3: Gỡ lỗi mã
Cuối cùng, tôi kiểm tra kỹ năng chẩn đoán lỗi mã của Muse Spark. Bài test nhằm cho thấy mô hình chỉ lần theo tính đúng đắn từng dòng hay cũng phát hiện các sai sót gốc rễ.
Prompt:
A developer wrote this Python function to compute a running average:
def running_average(data, window=3):
result = []
for i in range(len(data)):
start = max(0, i - window + 1)
chunk = data[start:i + 1]
result.append(round(sum(chunk) / window, 2))
return result
When called with running_average([10, 20, 30, 40, 50]), the first two values in the output seem wrong. Why? Please help me fix what is wrong!
Hàm này luôn chia cho window (3), ngay cả lúc đầu khi đoạn chunk có ít hơn 3 phần tử. Kết quả lỗi là [3.33, 10.0, 20.0, 30.0, 40.0], nhưng hai giá trị đầu phải là 10.0 và 15.0 vì các đoạn đó chỉ có lần lượt 1 và 2 phần tử. Cách sửa là đổi / window thành / len(chunk).
Các mô hình thường lần theo vòng lặp rất chuẩn, rồi kết luận rằng kết quả có vẻ "đúng." Chúng thấy phép toán diễn ra từng bước mà không cảnh báo rằng chia một phần tử cho 3 là vô lý. Việc này đòi hỏi mô hình giữ được mục đích (chạy trung bình trượt phải làm gì) song song với thực thi (mã thực sự làm gì) và phát hiện khoảng cách giữa chúng.

Muse Spark xác định đúng mục đích là trung bình trượt và phát hiện lỗi. Nó đề xuất thay đổi đúng và giải thích vì sao cần. Thậm chí nó còn gợi ý phương án khác nếu muốn bỏ qua hoàn toàn các cửa sổ chưa đủ phần tử.
Tổng thể, mô hình vượt qua cả ba bài test một cách hoàn hảo và để lại ấn tượng tốt ban đầu.
Tôi có thể truy cập Muse Spark bằng cách nào?
Bạn có thể truy cập Muse Spark tại meta.ai hoặc thông qua ứng dụng Meta AI trên iOS và Android. Cả hai đều miễn phí. Đợt triển khai đầu tiên ưu tiên Mỹ, mở rộng sang các khu vực khác trong vài tuần tiếp theo. 
Meta dự định triển khai trên WhatsApp, Instagram, Facebook, Messenger và kính Ray-Ban AI trong cùng khung thời gian.
Chưa có API công khai. Bản xem trước riêng tư mở cho một số đối tác doanh nghiệp chọn lọc, chưa có ngày xác nhận cho truy cập rộng hơn. Về quyền riêng tư: chính sách của Meta đặt ít giới hạn về cách dùng hội thoại để cải thiện mô hình. Nếu bạn định chia sẻ thông tin nhạy cảm, hãy đọc điều khoản trước.
Muse Spark còn hạn chế ở đâu
Meta nói thẳng trong blog kỹ thuật: mô hình có khoảng trống ở tác vụ tác tử nhiều bước và quy trình mã hóa.
Trên SWE-Bench Verified, khoảng cách với Gemini và Opus 4.6 là nhỏ. Nó mở rộng ở công việc tác tử: Terminal-Bench 2.0 (59,0 so với 75,1 của GPT-5.4) và GDPval-AA tự động hóa văn phòng (1.444 so với 1.672 của GPT-5.4). Những con số đó không sát nhau.
Suy luận hình ảnh trừu tượng cũng theo mẫu đó: ARC-AGI-2 là 42,5 cho Muse Spark trong khi GPT-5.4 và Gemini đều ở khoảng giữa 70. Mô hình dẫn đầu ở đọc biểu đồ lại tụt xa ở các mẫu hình ảnh mới lạ.
Điểm cuối này đã nhận phản hồi ngay ngày ra mắt. François Chollet, đồng sáng lập ARC Prize và là người tạo Keras và ARC-AGI, gọi mô hình là "tối ưu hóa quá mức cho các con số điểm chuẩn công khai, đánh đổi mọi thứ khác." Wang hồi đáp, thừa nhận khoảng cách ở ARC-AGI-2, và chỉ ra phản hồi tích cực của người dùng về mã hóa và lý luận trực quan. Liệu điều đó có giữ vững khi dùng rộng hơn vẫn là câu hỏi mở.
Việc thiếu API công khai, như tôi đã nêu, là một khoảng trống cạnh tranh. Wang thừa nhận trong ngày ra mắt: "Chắc chắn có những góc cạnh thô chúng tôi sẽ mài giũa theo thời gian trong hành vi mô hình."
An toàn của Muse Spark
Meta đã thực hiện các đánh giá theo Advanced AI Scaling Framework trước khi ra mắt. Trên BioTIER-refuse, Muse Spark dẫn đầu tập so sánh về từ chối truy vấn vũ khí sinh học. Đây là số liệu của chính Meta.

Nguồn: Meta Superintelligence Labs / ai.meta.com
Phát hiện thú vị hơn đến từ Apollo Research. Họ thấy rằng Muse Spark có tỷ lệ nhận biết đánh giá cao nhất trong số các mô hình họ từng thử: mô hình thường nhận ra bối cảnh đang bị đánh giá an toàn và hành xử cẩn trọng hơn vì phát hiện đó.
Một mô hình chỉ cư xử tốt khi biết mình đang bị quan sát là vấn đề đáng lưu tâm. Công trình trước đây của Apollo ghi nhận mẫu hình này có thể làm tăng cái họ gọi là "hành vi mưu mẹo" trong triển khai thực tế.
Meta thừa nhận phát hiện này khi ra mắt, điều mà đa số phòng thí nghiệm không làm. Họ theo dõi và thấy nó ảnh hưởng đến một tập con nhỏ các bài đánh giá cân chỉnh, không liên quan đến năng lực nguy hiểm, và kết luận không phải mối lo chặn đường. Nghiên cứu vẫn đang tiếp tục.
Muse Spark vs. GPT-5.4 vs. Opus 4.6 vs. Gemini 3.1
Các điểm chuẩn cho thấy những mô hình này có thể làm gì. Phần này nói về việc nên dùng cái nào.
Tổng quan nhanh
|
Thông số |
Muse Spark |
GPT-5.4 |
Opus 4.6 |
Gemini 3.1 Pro |
|
Ngày phát hành |
8 Thg 4, 2026 |
5 Thg 3, 2026 |
5 Thg 2, 2026 |
19 Thg 2, 2026 |
|
Cửa sổ ngữ cảnh |
262K* |
1,05M |
1M từ 13 Thg 3 |
1M |
|
Phương thức đầu vào |
Văn bản, hình ảnh, giọng nói |
Văn bản, hình ảnh |
Văn bản, hình ảnh |
Văn bản, hình ảnh, âm thanh, video |
|
Giá API (mỗi 1M token vào / ra) |
Không có API công khai |
$2,50 / $15,00 |
$5,00 / $25,00 |
$2,00 / $12,00 |
|
Truy cập người dùng |
meta.ai (ưu tiên Mỹ) |
ChatGPT |
Claude.ai |
Ứng dụng Gemini |
*Artificial Analysis ghi nhận cửa sổ ngữ cảnh của Muse Spark là 262K. Một số nguồn nêu 1M. Meta chưa công bố thẻ mô hình xác nhận con số nào.
Bạn nên dùng cái nào?
Chọn Muse Spark nếu trường hợp sử dụng của bạn là truy vấn sức khỏe, đọc biểu đồ, hoặc ứng dụng tiêu dùng đa phương thức. Chưa có API công khai, nên nếu bạn cần tích hợp sản xuất, bạn sẽ phải chờ.
Chọn GPT-5.4 nếu bạn cần một mô hình đa dụng có thể xây dựng ngay hôm nay. Nó dẫn đầu ở mã hóa, suy luận hình ảnh trừu tượng và tự động hóa văn phòng, với API công khai và cửa sổ ngữ cảnh 1M sẵn có.
Chọn Claude Opus 4.6 nếu bạn làm việc với tài liệu dài hoặc cần đầu ra viết cẩn trọng, chất lượng cao. Cửa sổ 1M chuyển sang mức giá tiêu chuẩn từ 13/3/2026. Đây là lựa chọn đắt nhất ở mức $5/$25 mỗi 1M token.
Chọn Gemini 3.1 Pro nếu quy trình của bạn xử lý video. Đây là mô hình duy nhất ở đây nhận đầu vào video, và ở mức $2/$12 mỗi 1M token, nó là lựa chọn tuyến đầu rẻ nhất trong nhóm này.
Mọi người nói gì về Muse Spark
Phản ứng ban đầu chia hai hướng như dự đoán. Có người tìm thấy điều cụ thể khiến họ ngạc nhiên. Người khác nhìn vào bảng điểm chuẩn và rút ra kết luận khác.

Khung "xây lại toàn bộ ngăn xếp từ đầu" xuất hiện khá nhiều. Mốc thời gian chín tháng hoặc là ấn tượng, hoặc là khó tin, tùy mức độ bạn tin các tuyên bố của Meta.
Pietro Schirano chia sẻ một ví dụ cụ thể: anh nhờ Muse Spark chuyển ảnh chụp màn hình UI thành mã, và nó cắt tách các tài sản hình ảnh từ giao diện thay vì coi là một ảnh phẳng.

Đó không phải điểm chuẩn. Đó là kiểu việc được chia sẻ vì thực sự bất ngờ.
Aakash Gupta có nhận định sắc sảo nhất. Khung của anh: "Đây là mô hình của một CEO làm gắn nhãn dữ liệu. Dấu vết có mặt khắp các kết quả." Các điểm chuẩn nơi Muse Spark dẫn đầu đều là bài toán nhạy về chất lượng dữ liệu, nơi việc tuyển chọn tập huấn luyện quyết định trần hiệu năng.
Những chỗ nó tụt lại (ARC-AGI-2, Terminal-Bench, GDPval) chính là nơi kiến trúc và mở rộng RL quan trọng hơn dữ liệu. Kết luận của anh: "anh ấy xây mô hình tốt nhất ở những thứ đường ống dữ liệu giải quyết, và trung bình ở mọi thứ khác."

Kết luận
Cú nhảy từ 18 của Llama 4 Maverick lên 52 của Muse Spark trên Artificial Analysis Intelligence Index không hề nhỏ. Với một đội ngũ xây lại từ đầu trong chín tháng, các kết quả về sức khỏe và đa phương thức là một bước đi thực sự, và được giữ vững dưới kiểm thử độc lập.
Dĩ nhiên, khoảng trống rất rõ. Mã hóa và tác vụ tác tử so với GPT-5.4 còn rất xa; suy luận hình ảnh trừu tượng là điểm yếu rõ rệt, và vẫn chưa có API công khai. Nếu bạn cần một mô hình để xây dựng ngay hôm nay, Muse Spark chưa phải.
Điều tôi cứ nghĩ lại là câu chuyện mã nguồn mở. Hệ sinh thái Llama xây trên niềm tin rằng trọng số sẽ sẵn có. Muse Spark phá vỡ điều đó. "Hy vọng" của Wang về việc mở mã nguồn các phiên bản tương lai không phải cam kết. Theo tôi, đó là điều hệ trọng nhất về lần ra mắt này, và nó được chú ý ít hơn nhiều so với các con số điểm chuẩn.
Các mô hình Muse lớn hơn đang được phát triển. Nếu kiến trúc mở rộng như tuyên bố, các con số hôm nay sẽ trông khiêm tốn. Đó là canh bạc.
Nếu bạn muốn học cách khai thác tối đa bất kỳ mô hình ngôn ngữ lớn nào, tôi khuyên bạn tham gia khóa học Understanding Prompt Engineering của chúng tôi.
Câu hỏi thường gặp về Muse Spark
Nếu tôi dùng Llama cục bộ, Muse Spark có thay thế không?
Không. Muse Spark chỉ chạy trên đám mây. Bạn không thể tải về, chạy trên phần cứng của riêng bạn, hoặc fine-tune. Truy cập thông qua meta.ai hoặc ứng dụng Meta AI, cả hai đều yêu cầu tài khoản Meta. Trường hợp dùng trọng số mở mà Llama xây dựng cộng đồng xung quanh không tồn tại ở đây.
Khi nào tôi nên dùng chế độ Contemplating thay vì Thinking?
Chế độ Contemplating hữu ích nhất khi một vấn đề thực sự có nhiều con đường giải hợp lệ, các câu hỏi khoa học phức tạp, suy luận nhiều bước với đầu vào mơ hồ, hoặc các tác vụ nghiên cứu nơi những góc tiếp cận khác nhau có thể đi đến các kết luận khác nhau. Với hầu hết truy vấn thường ngày, chế độ Thinking nhanh hơn và kết quả tương đương. Điều nữa cần biết: Contemplating vẫn đang triển khai dần, nên bạn có thể chưa truy cập được.
Tuyên bố tiết kiệm 10 lần tài nguyên tính toán thực sự có ý nghĩa gì với tôi, người dùng?
Có lẽ chưa có ý nghĩa gì ngay bây giờ. So sánh là với chính mô hình trước đó của Muse Spark, không phải với GPT-5.4 hay Gemini, và con số chưa được xác minh độc lập. Dữ liệu liên quan hơn là hiệu quả suy luận: như đã đề cập, Muse Spark dùng 58 triệu token đầu ra trong lần chạy độc lập của Artificial Analysis so với 157 triệu của Claude Opus 4.6. Khoảng cách đó có thể phản ánh vào giá về sau, nhưng giá API chưa được công bố.
Có đáng chuyển sang Muse Spark từ công cụ tôi đang dùng không?
Nếu bạn dùng ChatGPT cho các tác vụ chung, trải nghiệm hằng ngày là tương tự. Nếu truy vấn sức khỏe, khoa học hoặc phân tích biểu đồ là trường hợp chính, Muse Spark là một nâng cấp hợp lý. Nếu bạn dựa vào trợ lý mã hóa hoặc công cụ cho tài liệu dài, nó chưa thể thay thế GPT-5.4 hoặc Opus 4.6. Bảng so sánh ở trên có chi tiết.
Tôi có nên lo ngại về phát hiện nhận biết đánh giá không?
Không đáng lo ở mức thực tiễn hằng ngày, nhưng nên hiểu vấn đề. Phát hiện là Muse Spark hành xử cẩn trọng hơn khi nhận ra mình đang được kiểm tra an toàn, không phải vì giá trị nền tảng khác biệt mà vì nhận biết bối cảnh. Theo dõi của Meta cho thấy nó ảnh hưởng đến một tập nhỏ các bài đánh giá cân chỉnh, không liên quan đến năng lực nguy hiểm. Nếu bạn đang đánh giá mô hình cho triển khai nhạy cảm, hãy đọc đầy đủ báo cáo của Apollo trước khi rút kết luận chỉ từ điểm số đánh giá an toàn.
Tôi là một kỹ sư dữ liệu và người xây dựng cộng đồng, làm việc với pipeline dữ liệu, đám mây và công cụ AI, đồng thời viết các hướng dẫn thực hành, tác động cao cho DataCamp và các nhà phát triển mới nổi.

Tôi là một cây bút và biên tập viên về khoa học dữ liệu, đã có bài đóng góp cho các nghiên cứu đăng trên tạp chí khoa học. Tôi đặc biệt quan tâm đến đại số tuyến tính, thống kê, R và các chủ đề tương tự. Tôi cũng chơi cờ vua khá thường xuyên!
Tom là một nhà khoa học dữ liệu và giảng viên kỹ thuật. Anh viết và quản lý các bài hướng dẫn và bài blog về khoa học dữ liệu của DataCamp. Trước đây, Tom làm việc trong lĩnh vực khoa học dữ liệu tại Deutsche Telekom.

