Chuyển đến nội dung chính

Claude Opus 5 vs GPT-5.6 Sol: Điểm chuẩn, Giá và Cách lựa chọn

Opus 5 của Anthropic và GPT-5.6 Sol của OpenAI cùng ra mắt tháng 7/2026 với các tuyên bố cạnh tranh về công việc tác tử. Tôi đã so sánh điểm chuẩn của chúng về lập trình, lý luận, sử dụng công cụ tác tử và an ninh.
Đã cập nhật 31 thg 7, 2026  · 14 phút đọc

Khám phá với AI

Mở trong ChatGPTMở trong ClaudeMở trong Perplexity

Nếu bạn đang chọn một mô hình cho công việc tác tử trong nửa cuối năm 2026, danh sách rút gọn rất ngắn, và hai cái tên trong đó ra mắt cách nhau hai tuần. Anthropic phát hành Claude Opus 5 vào ngày 24 tháng 7, còn OpenAI đưa GPT-5.6 Sol ra sử dụng rộng rãi vào ngày 9 tháng 7. Cả hai đều là hạng đầu bảng, đều nhắm tới các tác vụ chuyên nghiệp chạy lâu, và mức giá của cả hai gần như giống hệt nhau.

Trong bài viết này, tôi sẽ so sánh Claude Opus 5 và GPT-5.6 Sol về lập trình, lý luận, sử dụng máy tính, sử dụng công cụ, giá và khả năng truy cập, để bạn có thể quyết định mô hình nào phù hợp với quy trình làm việc của mình. Để tìm hiểu sâu hơn từng mô hình, xem hướng dẫn Claude Opus 5hướng dẫn dòng GPT-5.6 của chúng tôi.

Tóm tắt nhanh

  • Opus 5 là chuyên gia về lý luận mới lạ và tác tử; GPT-5.6 Sol là tướng mạnh hơn về terminal và duyệt web.
  • Token đầu vào có giá $5 mỗi triệu ở cả hai. Với đầu ra, Opus 5 rẻ hơn 17%.
  • Chọn Opus 5 cho các vấn đề thực sự mới, lập trình và sử dụng máy tính. Chọn Sol cho quy trình terminal, tác tử duyệt web và công việc phòng thủ an ninh mạng.

Claude Opus 5 là gì?

Claude Opus 5 là mô hình hạng Opus của Anthropic, ra mắt ngày 24 tháng 7 năm 2026, cho kết quả tương tự Fable 5 hạng cao hơn với một nửa chi phí. Đây là mô hình mặc định mới trên Claude Max và là mô hình mạnh nhất có sẵn trên Claude Pro.

Điểm khác biệt của mô hình là tính kiên định. Theo cách diễn đạt của Anthropic, Opus 5 tự kiểm chứng công việc của mình và lặp lại cho đến khi thành công thay vì dừng ở một kết quả có vẻ hợp lý, và ghi nhận điểm kiểm toán hành vi sai lệch là 2,3, thấp nhất trong các mô hình Anthropic gần đây. Ngữ cảnh lên tới 1M token với trần đầu ra 128K, và chế độ tư duy bật mặc định.

Nếu bạn muốn xây dựng thay vì chỉ đọc, hướng dẫn API Claude Opus 5 của chúng tôi hướng dẫn tạo một tác tử sửa lỗi và đo hiệu năng của nó ở cả năm mức nỗ lực.

GPT-5.6 Sol là gì?

GPT-5.6 Sol là mẫu đầu bảng của dòng GPT-5.6 từ OpenAI, đạt trạng thái sử dụng rộng rãi vào ngày 9 tháng 7 năm 2026 sau giai đoạn xem trước giới hạn. Dòng này có ba hạng:

  • Sol: mô hình đầu bảng với hiệu năng cao nhất
  • Terra: mô hình cân bằng cho nhu cầu hàng ngày
  • Luna: lựa chọn tiết kiệm chi phí

OpenAI mô tả Sol là đạt kết quả tối tân trong lập trình, công việc tri thức, an ninh mạng và khoa học, đồng thời tiêu tốn ít token hơn các mô hình mà nó vượt mặt.

Tính năng nổi bật của Sol là ultra, một chế độ lý luận mặc định phối hợp bốn tác tử trên các luồng công việc song song. OpenAI cũng bổ sung Programmatic Tool Calling trong Responses API, cho phép mô hình viết và chạy các chương trình nhỏ để điều phối công cụ và lọc dữ liệu trung gian thay vì chuyển mọi phản hồi công cụ quay lại qua mô hình.

Để biết thêm về cấu trúc dòng và các lưu ý giai đoạn xem trước, xem phân tích GPT-5.6 của chúng tôi. Chúng tôi cũng đã đề cập đến phản ví dụ được cho là của GPT-5.6 Pro với giả thuyết Dinitz-Garg-Goemans, điều thú vị nhất mà ai đó đã làm với dòng này cho đến nay.

Claude Opus 5 vs GPT-5.6 Sol: So sánh đối đầu

Dưới đây là phần tóm tắt trước khi tôi đi vào từng khía cạnh.

Tính năng Claude Opus 5 GPT-5.6 Sol
Ngày phát hành 24 tháng 7, 2026 9 tháng 7, 2026
Đầu vào, mỗi 1M token $5.00 $5.00
Đầu ra, mỗi 1M token $25.00 $30.00
Cửa sổ ngữ cảnh 1M token 1M token
Đầu ra tối đa 128K token 128K token
Lý luận mới lạ (ARC-AGI-3) 30,2% 7,78%
Lập trình trên kho mã (SWE-Bench Pro) 79,2% 64,6%
Lập trình trên terminal (Terminal-Bench 2.1) 89,1% 88,8% (91,9% với ultra)
Lập trình dài hạn (DeepSWE V1.1) 68,8% 72,7%
Sử dụng máy tính (OSWorld 2.0) 70,6% 62,6%
Tác tử duyệt web (BrowseComp) 90,8% 90,4% (92,2% với ultra)
Tính năng tiêu biểu Tự kiểm chứng và lặp Chế độ tác tử song song ultra
Model ID claude-opus-5 gpt-5.6-sol

Lý luận mới lạ và các bài toán trừu tượng

Đây là nơi hai mô hình khác biệt rõ nhất, nên tôi bắt đầu từ đây. ARC-AGI-3 yêu cầu mô hình giải các bài toán mà nó chưa gặp trong quá trình huấn luyện, khiến nó gần nhất với một bài kiểm tra về lý luận thay vì ghi nhớ.

Opus 5 đạt 30,2%. GPT-5.6 Sol đạt 7,78%, dù là mô hình đứng thứ hai trên bảng xếp hạng. Để so sánh, Gemini 3.1 Pro Preview đạt 0,42%. Đặt con số của Opus 5 vào bối cảnh, Opus 4.8 đạt 1,5% hai tháng trước, tức tăng gấp hai mươi lần chỉ trong một thế hệ Anthropic.

Tôi muốn cẩn trọng về ý nghĩa của khoảng cách 4x trên một bài đánh giá. ARC-AGI-3 cố ý chống ghi nhớ, và điểm 30,2% vẫn là đa số thất bại. Nhưng nếu công việc của bạn liên quan đến các vấn đề không giống bất kỳ thứ gì trong tập huấn luyện, đây là con số phù hợp nhất trong toàn bộ so sánh, và khoảng cách là rất lớn.

Lập trình và kỹ thuật tác tử

Lập trình là nơi kết quả chia đôi thay vì một mô hình áp đảo. Mỗi nhà cung cấp dẫn đầu ở các bài đánh giá họ nhấn mạnh, điều đúng như kỳ vọng và cũng là lý do bạn nên đọc chi tiết sau các tuyên bố tiêu đề.

Bài đánh giá Claude Opus 5 GPT-5.6 Sol Ghi chú
SWE-Bench Verified 96,0% 96,2% Gần như hòa; Fable 5 đạt 95,0%
SWE-Bench Pro 79,2% 64,6% Claude Mythos 5 dẫn đầu với 80,3%
DeepSWE v1.1 68,8% 72,7% Sol dẫn 3,9 điểm
Terminal-Bench 2.1 89,1% 88,8% (91,9% với ultra) Hòa, với ultra tạo khác biệt
Frontier-Bench v0.1 43,3% 37,5% Opus 4.8 đạt 18,7% hai tháng trước
AA Coding Agent Index v1.1 Chưa công bố 80 Fable 5 đạt 77,2; Opus 4.8 đạt 72,5

Mẫu hình trở nên rõ ràng khi tách công việc trên kho mã khỏi công việc trên terminal. Opus 5 dẫn SWE-Bench Pro gần 15 điểm và hơn gấp đôi điểm Frontier-Bench của Opus 4.8, vốn đo kỹ thuật phần mềm tác tử trên các nhiệm vụ như tái tạo một bộ phận máy trong FreeCAD từ bản vẽ kỹ thuật. Ví dụ của chính Anthropic rất đáng trích: khi không có cách xem bản vẽ, Opus 5 đã tự viết pipeline thị giác máy tính để trích xuất hình học từ điểm ảnh thô, và không có mô hình cạnh tranh nào giải được trong năm lượt thử.

Sol làm chủ terminal, nhưng biên độ thấp hơn các phiên bản trước. Nó hòa với Opus 5 trên Terminal-Bench 2.1, nhưng đẩy lên 91,9% khi bật ultra. Sol cũng dẫn DeepSWE v1.1, bài kiểm tra kỹ thuật dài hạn trên các codebase thực, hơn 3,9 điểm trong khi dùng ít hơn một nửa token đầu ra của Fable 5 và giảm khoảng một phần ba chi phí.

Một điều công việc thực tế của chúng tôi bổ sung: khi chúng tôi xây một tác tử sửa lỗi với Opus 5 và chạy qua cả năm mức nỗ lực, low đã sửa lỗi trong cả ba lần chạy, trong khi max thất bại một trong ba. Lần thất bại đó trả về một báo cáo hợp lệ theo schema nhưng rỗng tuếch, không có lời gọi công cụ nào và trường nguyên nhân gốc đặt là "b0". Bài học là đầu ra có cấu trúc chỉ đảm bảo cấu trúc, không đảm bảo nội dung, và mức nỗ lực cao hơn không tự động tốt hơn. Chi tiết đầy đủ trong hướng dẫn API Opus 5.

Quan điểm của tôi: nếu tác tử của bạn sống trong shell và bạn chịu được ultra, Sol nhỉnh hơn chút. Nếu chúng sống trong kho mã và cần lý luận về kiến trúc trên nhiều tệp, Opus 5 phù hợp hơn. Không mô hình nào thắng tuyệt đối ở hạng mục “lập trình”, và bất kỳ tuyên bố nào nói khác đi đều đang chọn bài đánh giá có lợi.

Sử dụng máy tính và duyệt web

Sử dụng máy tính quan trọng nếu bạn xây bất cứ thứ gì điều khiển GUI, và bức tranh chia tách tương tự lập trình.

Opus 5 dẫn OSWorld 2.0 với 70,6% so với 62,6% của Sol, chênh 8 điểm. Anthropic cũng cho biết Opus 5 vượt kết quả OSWorld tốt nhất của Fable 5 với chỉ hơn một phần ba chi phí, điều này đáng chú ý hơn bởi Fable 5 có giá $10 mỗi triệu token đầu vào so với $5 của Opus 5.

Duyệt web gần như hòa. Opus 5 báo 90,8% trên BrowseComp; Sol báo 90,4%, tăng lên 92,2% với ultra trên mười sáu tác tử song song. Lần nữa, ultra tạo khác biệt ở đây.

Kết quả OSWorld của Sol đi kèm một tuyên bố về hiệu quả token đáng chú ý: OpenAI nói rằng nó vượt Opus 4.8 trong khi dùng ít hơn 85% token đầu ra. Đây là so sánh với thế hệ trước của Anthropic chứ không phải với Opus 5, nên không áp vào cặp đấu này, nhưng báo hiệu rằng đường hướng sử dụng máy tính của Sol có chi phí theo tác vụ rẻ bất thường.

Sử dụng công cụ và tự động hóa

Đây là khía cạnh nơi khoảng cách năng lực trừu tượng chuyển hóa thành các tác vụ kinh doanh hoàn chỉnh, và Opus 5 dẫn rõ rệt.

Trên AutomationBench của Zapier, đo lường xem mô hình có thể hoàn thành một tác vụ kinh doanh từ đầu đến cuối hay không, Opus 5 đạt 26,0% so với 18,1% của Sol. Anthropic báo tỷ lệ vượt qua của nó xấp xỉ 1,5 lần mô hình đứng thứ hai ở cùng chi phí mỗi tác vụ, và ngay cả ở mức nỗ lực thấp nhất, Opus 5 vẫn vượt qua nhiều tác vụ hơn bất kỳ mô hình nào khác.

CEO Zapier Wade Foster mô tả một lần chạy cụ thể: Opus 5 nhận một workbook sức khỏe tài khoản thô và thực thi chuỗi ngăn ngừa rời bỏ từ đầu đến cuối, gắn cờ các tài khoản rủi ro, cảnh báo đúng người phụ trách và tóm tắt cho bộ phận giữ chân. Các mô hình trước không vượt qua; Opus 5 đạt 100%.

Phản biện của Sol mang tính kiến trúc hơn là điểm số. Programmatic Tool Calling trong Responses API cho phép Sol viết các chương trình nhỏ điều phối công cụ, lọc kết quả trung gian và chọn hành động tiếp theo khi công việc diễn tiến, nghĩa là các tác vụ nặng công cụ tiến triển với ít lượt qua mô hình hơn. Đó là một cơ chế hiệu quả thực sự, nhưng khác với việc hoàn thành nhiều tác vụ đúng hơn, và AutomationBench đo lường vế sau.

An ninh mạng và khoa học

Đây là khía cạnh nơi hai bên cố ý chọn hướng ngược nhau, và tự thân nó sẽ quyết định lựa chọn cho một số độc giả.

Anthropic không huấn luyện Opus 5 cho các tác vụ mạng. Họ nêu rõ Opus 5 không đẩy ranh giới năng lực lưỡng dụng và vẫn thua Mythos 5 ở cả nghiên cứu sinh học và an ninh mạng tấn công. Trên OSS-Fuzz, Opus 5 xác định lỗ hổng ở mức gần Mythos 5 nhưng tụt xa khi phát triển khai thác cho chúng. Bộ phân loại mạng của Opus 5 chặn quét lỗ hổng dựa trên nhị phân, kiểm thử xâm nhập và tạo khai thác, dù Anthropic kỳ vọng chúng can thiệp ít hơn khoảng 85% so với Fable 5.

OpenAI đi theo hướng ngược lại. Sol được mô tả là mô hình an ninh mạng mạnh nhất của OpenAI, và các con số rất lớn:

  • ExploitBench: 73,5% so với 47,9% của GPT-5.5 ở ngân sách token đầu ra tương đương
  • ExploitGym: 24,9% trong giới hạn hai giờ, tăng lên 33,7% với sáu giờ, so với đỉnh 15,1% của GPT-5.5
  • SEC-Bench Pro: 71,2% so với 45,8% của GPT-5.5, với độ trễ cải thiện
  • Capture-the-Flag: 96,7%

Cả hai bên đều áp cổng. OpenAI phân luồng năng lực phòng thủ nâng cao qua Trusted Access for Cyber của Daybreak, yêu cầu passkey hỗ trợ phần cứng trước ngày 1 tháng 9 để tiếp tục truy cập các mô hình có năng lực mạng cao nhất, và nói rằng hàng rào an toàn mạng của Sol chặn nhiều hoạt động tiềm ẩn gây hại gấp khoảng mười lần so với các mô hình trước. Anthropic vận hành Chương trình Xác minh An ninh mạng cho phép doanh nghiệp và nhà nghiên cứu đã đăng ký dùng bản Opus 5 ít hạn chế hơn.

Về khoa học, Opus 5 vượt Opus 4.8 ở mọi bài đánh giá khoa học đời sống của Anthropic, với mức tăng lớn nhất ở hóa hữu cơ (tăng 10,2 điểm phần trăm khi suy luận cấu trúc phân tử từ dữ liệu phổ) và dự đoán chức năng theo chuỗi protein (tăng 7,7 điểm). Sol báo 28,7% trên GeneBench Pro so với 12% của GPT-5.5 và 59,9% trên LifeSciBench. Không có bài đánh giá chung, nên đây không phải so sánh trực tiếp; là hai bên tự chấm trên các đề thi khác nhau.

Giá

Mức giá đầu vào và đọc từ bộ nhớ đệm trùng khớp ở ngữ cảnh chuẩn, loại bỏ một biến trong quyết định. Còn lại là phụ phí đầu ra 20% của Sol, cùng phụ phí ngữ cảnh dài mà chỉ Sol áp dụng.

Mức giá token đặt cạnh nhau

Mức Claude Opus 5 GPT-5.6 Sol
Đầu vào, mỗi 1M token $5.00 $5.00
Đầu ra, mỗi 1M token $25.00 $30.00
Đọc đầu vào từ bộ nhớ đệm, mỗi 1M token $0.50 $0.50
Ghi vào bộ nhớ đệm, mỗi 1M token $6.25 $6.25
Phụ phí ngữ cảnh dài Không (cố định tới 1M) 2× đầu vào / 1,5× đầu ra trên 272K đầu vào
Chế độ nhanh Giá 2×, tốc độ ~2,5× Giá 2×, tốc độ ~2,5×

Toàn bộ chênh lệch chi phí ngữ cảnh ngắn rơi vào phần sinh, nên phụ phí của Sol tác động mạnh nhất ở lý luận dài và đầu ra dài. Khoảng cách thu hẹp ở công việc truy xuất nơi bạn gửi vào nhiều token hơn hẳn so với đầu ra, cho tới khi phụ phí ngữ cảnh dài của Sol chi phối.

Cả hai mô hình giờ có Chế độ Nhanh với giá khoảng gấp đôi chuẩn cho tốc độ khoảng 2,5×. OpenAI đã gộp Priority Processing cũ của Sol vào Chế độ Nhanh ngày 30 tháng 7, 2026, nên đòn bẩy này đối xứng giữa hai bên và không phải điểm khác biệt.

Chi phí của một khối lượng công việc thực

Giá theo triệu token khó để lập ngân sách, và một tỷ lệ cố định duy nhất che đi phần quan trọng nhất của so sánh: khoảng cách giữa hai mô hình này hoàn toàn phụ thuộc vào hình dạng khối lượng công việc. Dưới đây là ba hình dạng đại diện ở mức giá chuẩn, không có bộ nhớ đệm hay chiết khấu lô.

Khối lượng công việc Giả định khối lượng Claude Opus 5 GPT-5.6 Sol Sol so với Opus
Nặng phần sinh 250K vào / 1M ra $26.25 $31.25 +19%
Truy xuất, dưới 272K 250K vào / 25K ra $1.88 $2.00 +7%
Truy xuất, trên 272K 500K vào / 50K ra $3.75 $7.25 +93%

Với công việc nặng phần sinh, phụ phí đầu ra 20% gần như truyền thẳng qua, và Sol đắt hơn khoảng 19%. Với truy xuất ngắn, chênh lệch gần như đóng lại còn khoảng 7%, vì phần đầu ra chỉ là sai số làm tròn so với mức đầu vào giống hệt.

Hàng thứ ba là điều cần chú ý. Khi yêu cầu vượt 272K token đầu vào, phụ phí của Sol áp 2× đầu vào và 1,5× đầu ra trên toàn bộ yêu cầu, trong khi Opus 5 giữ cố định tới 1M, nên phụ phí không co lại khi mở rộng; nó gần như nhân đôi hóa đơn. Với công việc nặng truy xuất hoặc ngữ cảnh lớn, sự đảo chiều này quan trọng hơn phụ phí đầu ra tiêu đề.

Vì sao cùng một tác vụ lại có chi phí khác nhau

Có hai yếu tố khiến cùng khối lượng công việc tạo ra hóa đơn khác nhau ở đây, ngoài các mức giá tiêu đề:

  • Phụ phí ngữ cảnh dài của Sol. Bất kỳ yêu cầu nào trên 272K token đầu vào đều bị tính 2× đầu vào và 1,5× đầu ra trên toàn bộ yêu cầu, nên chỉ một prompt quá khổ cũng đẩy Sol vào bậc giá cao hơn mà Opus 5 không có. Đây là chuyển bậc giá, không phải khác biệt token, và đã phản ánh trong hàng công việc thứ ba phía trên.
  • Sol ultra. Ultra không mang phụ phí giá, tính theo cùng mức $5/$30 như Sol gốc, nhưng chế độ đa tác tử, nỗ lực cao tiêu tốn nhiều token hơn đáng kể mỗi tác vụ, có thể đẩy một công việc tác tử lên chi phí gấp khoảng ba lần Sol gốc ở cùng mức giá. Bội số này là ước tính được báo cáo, không phải số đo thực nghiệm.

Lưu ý đó áp dụng chung cho phía đầu ra. Các tuyên bố về hiệu quả đang lưu hành hầu như đều so với mô hình khác: Sol được cho là dùng ít hơn một nửa token đầu ra của Fable 5 trên Coding Agent Index, và Anthropic báo Opus 5 tạo ít hơn 26% token so với Opus 4.8 ở mức suy luận tối đa. Cả hai đều là so sánh với tiền nhiệm và không thay đổi các con số ở trên. 

Khi nào chọn Claude Opus 5 so với GPT-5.6 Sol

Kết quả theo từng chiều quy chiếu khá rõ vào khối lượng công việc, nên đây là hướng dẫn quyết định trước khi tôi mở rộng cho từng bên.

Tình huống sử dụng Khuyến nghị Lý do
Vấn đề thực sự mới, không có tiền lệ trong huấn luyện Claude Opus 5 30,2% trên ARC-AGI-3 so với 7,78% của Sol
Tác tử terminal và dòng lệnh phức tạp GPT-5.6 Sol 88,8% trên Terminal-Bench 2.1, tăng lên 91,9% với ultra
Tái cấu trúc cấp kho và công việc kiến trúc Claude Opus 5 79,2% trên SWE-Bench Pro so với 64,6%
An ninh mạng phòng thủ và tái tạo khai thác GPT-5.6 Sol 73,5% trên ExploitBench; Opus 5 chặn tạo khai thác theo thiết kế
Tác tử điều khiển GUI và sử dụng máy tính Claude Opus 5 70,6% trên OSWorld 2.0 so với 62,6%
Truy xuất ngữ cảnh dài trên bộ tài liệu lớn Claude Opus 5 Ngữ cảnh 1M mặc định, không bậc phụ phí
Triển khai doanh nghiệp đa đám mây Claude Opus 5 Có trên Bedrock, Vertex AI và Azure AI Foundry

Chọn Claude Opus 5 nếu...

  • Vấn đề của bạn thực sự mới. Khoảng cách ARC-AGI-3 là kết quả lớn nhất trong so sánh này, và phản ánh trực tiếp vào công việc nghiên cứu và mọi thứ mà câu trả lời không nằm trong tập huấn luyện.
  • Bạn cần tác tử hoàn thành tác vụ, không chỉ thử. Lợi thế trên AutomationBench là tín hiệu mạnh nhất trong bài về khả năng hoàn tất thay vì chỉ năng lực.
  • Bạn làm việc qua ngữ cảnh dài. 1M token vừa là mặc định vừa là tối đa, không có bậc phụ phí, là câu chuyện rõ ràng hơn bất kỳ con số nào OpenAI công bố cho xử lý ngữ cảnh của Sol.
  • Căn chỉnh là yêu cầu nêu rõ. Điểm kiểm toán hành vi sai lệch 2,3 là tốt nhất của Anthropic tới nay, với tỷ lệ đánh lừa thấp nhất và ít bị lợi dụng sai mục đích nhất.

Chọn GPT-5.6 Sol nếu...

  • Bạn vận hành tác tử phức tạp sống trong shell. Chế độ ultra của Sol đẩy nó lên hàng đầu 
  • Bạn làm công việc an ninh phòng thủ. Các con số ExploitBench, ExploitGym và SEC-Bench Pro rất lớn, và bộ phân loại của Opus 5 chủ động chặn tạo khai thác, nên đây không phải lựa chọn sít sao.
  • Bạn muốn điều phối đa tác tử tích hợp sẵn. ultra phối hợp bốn tác tử mặc định và đã đẩy BrowseComp lên 92,2% ở mười sáu tác tử, và bản beta đa tác tử trong Responses API cho phép bạn tự xây mẫu tương tự.

Kết luận

Cách nhau hai tuần, hai nhà cung cấp đưa ra những canh bạc trái chiều: Opus 5 theo đuổi lý luận mới lạ và hoàn thành tác vụ, trong khi Sol tập trung vào công việc terminal, duyệt web và an ninh phòng thủ, kèm phụ phí đầu ra 20%.

Chọn Opus 5 nếu vấn đề của bạn thực sự mới, tác tử của bạn cần hoàn thành thay vì thử, hoặc bạn làm việc trên ngữ cảnh dài nơi mức giá cố định 1M của nó thắng phụ phí của Sol; chọn Sol nếu tác tử của bạn sống trong shell, bạn làm công việc tái tạo khai thác mà Opus 5 chặn theo thiết kế, hoặc bạn có thể chi cho ultra để đứng đầu bảng xếp hạng terminal và duyệt web.

Ở hầu hết khía cạnh khác, khoảng cách nhỏ hơn những gì marketing của cả hai gợi ý, nên hãy ghép mô hình với khối lượng công việc chủ đạo của bạn thay vì bài đánh giá tiêu đề.

Câu hỏi thường gặp

Claude Opus 5 hay GPT-5.6 Sol tốt hơn?

Không có mô hình nào tốt hơn trên mọi mặt. Opus 5 dẫn về lý luận trừu tượng và lập trình cấp kho, trong khi GPT-5.6 Sol mạnh hơn ở các tác vụ dài hạn, và họ so kè sát sao về lập trình trên terminal và chi phí. Lựa chọn đúng phụ thuộc vào khối lượng công việc cụ thể của bạn hơn là một xếp hạng tổng thể.

Mô hình nào rẻ hơn?

Opus 5 rẻ hơn ở cả ba khối lượng công việc được kiểm thử, nhưng biên độ khác nhau: chỉ 7% dưới ngữ cảnh 272K, 19% ở công việc nặng phần sinh, và 93% khi đầu vào vượt 272K token, lúc giá của Sol nhảy bậc. Nếu bạn hiếm khi chạm ngữ cảnh lớn, hai bên gần như ngang nhau.

Mô hình nào tốt hơn cho lập trình?

Tùy thuộc vào loại công việc lập trình. Trong các bài đánh giá này, Opus 5 dẫn ở tác vụ cấp kho (SWE-Bench Pro, 79,2% so với 64,6%) và gần như hòa trên lập trình terminal (89,1% so với 88,8%), trong khi GPT-5.6 Sol dẫn ở lập trình dài hạn (72,7% so với 68,8%). Không có người thắng tuyệt đối, nên hãy khớp mô hình với việc của bạn là chỉnh sửa toàn kho, tự động hóa terminal hay chuỗi bước dài.

Tôi có thể chuyển giữa hai mô hình một cách dễ dàng không?

Một phần. Chúng chạy trên các API riêng với mức giá khác nhau, nên chuyển đổi đòi hỏi endpoint mới và chỉnh prompt đôi chút. Chi phí là điểm dễ mắc: giá của Sol gần như gấp đôi Opus 5 khi vượt 272K token, nên một khối lượng công việc rẻ trên bên này có thể đắt trên bên kia.

Điểm đánh giá có cho tôi biết nên dùng mô hình nào không?

Một phần. Khoảng cách về lý luận là rất lớn (30,2% so với 7,78%), nhưng cả hai đều có điểm thấp tuyệt đối ở mảng đó, nên có thể không ảnh hưởng đến sử dụng hàng ngày. Các điểm lập trình đều cao và sát nhau, nên thử nghiệm trên tác vụ thực quan trọng hơn bảng xếp hạng.


Tom Farnschläder's photo
Author
Tom Farnschläder
LinkedIn

Tom là một nhà khoa học dữ liệu và giảng viên kỹ thuật. Anh viết và quản lý các bài hướng dẫn và bài blog về khoa học dữ liệu của DataCamp. Trước đây, Tom làm việc trong lĩnh vực khoa học dữ liệu tại Deutsche Telekom.

Chủ đề

Học AI với DataCamp!

Tracks

Cơ bản về ChatGPT

3 giờ
Khám phá những kiến thức cơ bản về ChatGPT và kỹ thuật tạo prompt. Nâng cao kỹ năng tạo prompt để tối ưu hóa khả năng của ChatGPT.
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow