Anthropic chưa công bố bài kiểm thử trực tiếp giữa Opus 5 và Sonnet 5. Mỗi bài ra mắt đều so sánh mẫu với phiên bản tiền nhiệm của chính nó và với Opus 4.8. Vì vậy, các con số dưới đây chỉ phản ánh một phần bức tranh. Phần còn lại vẫn là câu hỏi bạn luôn phải tự cân nhắc với bất kỳ cặp Opus và Sonnet nào: bạn thực sự cần “trần năng lực” cao đến mức nào, và bạn sẵn sàng trả bao nhiêu cho điều đó.
Claude Opus 5 là gì?
Opus 5 là mẫu cao cấp nhất của Anthropic, ra mắt ngày 24/07/2026, có giá $5 cho mỗi triệu token đầu vào và $25 cho mỗi triệu token đầu ra. Anthropic gọi đây là mẫu đạt chuẩn tối tân trên Frontier-Bench và GDPval-AA, và tiệm cận mẫu Fable 5 lớn hơn với mức giá chỉ bằng một nửa. Đây là mẫu mặc định trên Claude Max và là mẫu mạnh nhất trên Claude Pro.
Đặc điểm nổi bật là khả năng tự kiểm định: tự kiểm tra kết quả, xây dựng bộ khung kiểm thử khi không có dữ liệu đầu vào, phản biện các chỉ dẫn kém thay vì tuân theo một cách máy móc.
Claude Sonnet 5 là gì?
Sonnet 5 là mẫu tầm trung của Anthropic, ra mắt ngày 30/06/2026. Anthropic mô tả đây là phiên bản Sonnet có tính chủ động cao nhất đến nay, với hiệu năng gần Opus 4.8 nhưng giá thấp hơn. Đây là mẫu mặc định trên gói Free và Pro, đồng thời có mặt trên Max, Team, Enterprise và API.
Giá: $2 cho mỗi triệu token đầu vào và $10 cho mỗi triệu token đầu ra đến hết ngày 31/08/2026, sau đó là mức chuẩn $3/$15.
Sự khác biệt giữa các tầng, ở góc nhìn thực tế
Đây là phần các bài ra mắt không nói thẳng, vì nó phản ánh cách hệ thống sản phẩm của Anthropic vận hành nói chung, không riêng gì cặp đôi này.
Opus là mẫu “trần năng lực”
Bạn chọn Opus khi cái giá của việc sai là rất đắt, khi một tác vụ chạy dài và tự chủ mà không có ai kiểm tra giữa chừng, hoặc khi vấn đề thực sự mới mẻ thay vì chỉ là biến thể của thứ mà mô hình đã gặp hàng nghìn lần. Tái cấu trúc sâu nhiều tệp, câu hỏi nghiên cứu mơ hồ, các phiên tác tử chạy dài nơi sai sót chồng chất — đó là lãnh địa của Opus. Bạn trả tiền để mô hình tự phát hiện lỗi trước khi chúng trở thành vấn đề của bạn.
Sonnet là “ngựa thồ”
Mục tiêu là đủ nhanh và rẻ để vận hành liên tục: trợ lý chat, phân loại khối lượng lớn, lập trình lặp nơi bạn vẫn ở trong vòng kiểm duyệt vài bước một lần, các ứng dụng nhạy độ trễ. “Trần” về năng lực phán đoán thấp hơn, nhưng với phần lớn công việc thực tế, bạn hiếm khi chạm tới giới hạn đó. Nhu cầu hằng ngày của hầu hết đội nhóm nên nghiêng về Sonnet, còn Opus chỉ gọi vào có chọn lọc cho các tác vụ thật sự cần.
Riêng Sonnet 5 là nỗ lực của Anthropic nhằm đẩy “trần” đó cao hơn mức thường thấy ở một mẫu tầm trung — vì thế mới có câu “Sonnet mang tính chủ động nhất từ trước đến nay” và khẳng định rằng nó tiệm cận Opus 4.8 ở một số tác vụ. Đây là bối cảnh để đọc các con số điểm chuẩn bên dưới: Sonnet 5 không chỉ rẻ, mà còn rẻ và gần mức Opus hơn các đời Sonnet trước.
Các con số ra mắt thực sự cho thấy gì
Giá
Khác biệt rõ ràng và ít mơ hồ nhất. Sonnet 5 có mức $2/$10 (đến 31/8) hoặc $3/$15 (chuẩn) so với mức cố định $5/$25 của Opus 5 — Sonnet 5 tốn 40–60% chi phí của Opus 5 tùy giai đoạn giá.
Căn chỉnh
Đây là phần duy nhất hai bài ra mắt nhắc trực tiếp đến nhau. Kiểm toán tự động của Anthropic cho thấy Opus 5 “tuân thủ Hiến pháp của Claude tốt hơn Opus 4.8, Sonnet 5, hoặc Fable 5” — một kết quả được nêu rõ, không phải suy diễn. Opus 5 đạt 2.3 trong kiểm toán đó, mức an toàn cao nhất của nó tới nay. Sonnet 5 cải thiện so với thế hệ trước (giảm ảo giác, giảm xu hướng nịnh bợ, chống chịu tốt hơn với tấn công chèn nhắc lệnh), nhưng Anthropic lưu ý tỷ lệ hành vi lệch chuẩn của nó vẫn cao hơn Opus 4.8.
An ninh mạng
Cả hai mẫu đều không được huấn luyện có chủ đích về mảng an ninh mạng, nhưng kết quả khác nhau.
Opus 5 tiệm cận Mythos 5 ở khả năng tìm lỗ hổng, dù kém hơn trong việc chuyển chúng thành khai thác. Sonnet 5 ở xa hơn: Anthropic nói thẳng rằng Sonnet 5 có “năng lực an ninh mạng kém hơn đáng kể so với Opus 4.8 và Mythos 5,” và trong một bài đánh giá phát triển khai thác trên Firefox, nó không bao giờ tạo được một khai thác hoàn chỉnh hoạt động (tỷ lệ thành công 0.0%, chỉ nhỉnh hơn Sonnet 4.6 một chút ở các nỗ lực bán phần).
Nếu trường hợp sử dụng của bạn chạm tới bất kỳ khía cạnh nào liên quan an ninh mạng, khoảng cách này là có thật và nghiêng rõ ràng về phía Opus 5.
Lập trình và công việc tri thức
Ở đây hai bài sử dụng bộ điểm chuẩn khác nhau, nên không có vạch điểm trực tiếp.
Opus 5 vượt hơn gấp đôi Opus 4.8 trên Frontier-Bench v0.1 và chỉ kém Fable 5 khoảng 0.5% trên CursorBench 3.2 với chi phí bằng một nửa. Sonnet 5 được mô tả là tiệm cận Opus 4.8 trên BrowseComp và OSWorld-Verified ở mức nỗ lực cao.
Đọc cùng với logic phân tầng ở trên: Sonnet 5 tới gần trên các tác vụ Anthropic chọn làm điểm nhấn, nhưng các chiến thắng của Opus 5 có vẻ lớn hơn và rộng hơn. Hãy xem phần này như chỉ dấu xu hướng, không phải phép đo trực tiếp.
Khi nào chọn mẫu nào
Chọn Opus 5 nếu
tác vụ mang tính rủi ro cao, chạy dài, hoặc thực sự mới lạ; bạn làm trong khoa học đời sống, hóa học, hoặc công việc tác tử nhiều bước phức tạp; bạn cần mẫu có mức căn chỉnh cao nhất hiện có; bất cứ thứ gì liên quan an ninh mạng đều nằm trong phạm vi.
Chọn Sonnet 5 nếu
bạn chạy khối lượng lớn, độ trễ quan trọng, hoặc tác vụ đủ rõ ràng để bạn không cần “trần phán đoán” của Opus; bạn đang ở gói Free hoặc Pro nơi nó vốn là mặc định; chi phí theo token là ràng buộc chính.
Không chọn mẫu nào, nếu
bạn cần công việc an ninh mạng với hàng rào bảo vệ nới lỏng. Opus 5 sẽ tự động lùi về Opus 4.8, và Sonnet 5 thì xếp sau Opus 4.8 một cách rõ ràng.
Kết luận
Yếu tố quyết định ở đây nhìn chung vẫn là câu hỏi quen thuộc với mọi cặp Opus và Sonnet: tác vụ này cần “trần” năng lực, hay chỉ cần hoàn thành ổn định ở quy mô lớn? Sonnet 5 đẩy “trần” đó cao hơn các đời Sonnet trước, và đó là điểm mới đáng chú ý trong lần ra mắt này. Nhưng ở nơi Anthropic đưa ra con số so sánh trực tiếp giữa hai mẫu — bài kiểm toán căn chỉnh — Opus 5 vượt lên, và câu chuyện an ninh mạng cũng củng cố hướng đó. Mặc định hãy chọn Sonnet 5 cho khối lượng lớn, và chuyển sang Opus 5 khi tác vụ không thể chấp nhận câu trả lời sai.