Chuyển đến nội dung chính

Claude Opus 4.7 và Gemini 3.1 Pro: Mẫu nào tốt hơn?

Chúng tôi so sánh Opus 4.7 và Gemini 3.1 Pro về mã hóa, suy luận, benchmark tác tử, giá và giới hạn ngữ cảnh để giúp bạn chọn đúng mô hình.
Đã cập nhật 31 thg 8, 2026  · 10 phút đọc

Khám phá với AI

ChatGPTClaudePerplexity

Cho đến nay, 2026 là năm của AI tác tử. Những cải tiến trong các mô hình đã dẫn đến vô số công cụ cho công việc mang tính tác tử, từ trợ lý AI cá nhân đến tác tử lập trình. Những cái tên lớn trong lĩnh vực này là Gemini của Google, dòng GPT của OpenAI và các mô hình của Anthropic, vốn đã trở thành lựa chọn ưa thích của nhà phát triển. 

Trong bài viết này, tôi sẽ so sánh Claude Opus 4.7 và Gemini 3.1 Pro, bao gồm cả benchmark và giá. Cuối bài, tôi sẽ đưa ra một tiêu chí để bạn có thể quyết định mô hình nào phù hợp nhất với quy trình làm việc của mình. 

Claude Opus 4.7 là gì?

Như chúng tôi đề cập trong bài viết về Opus 4.7, Claude Opus 4.7 là mẫu chủ lực mới nhất của Anthropic, bản cập nhật của người tiền nhiệm Claude Opus 4.6. Nó được thiết kế cho các quy trình tác tử phức tạp và suy luận nhiều bước. Mô hình thể hiện tốt hơn trong tác vụ lập trình mang tính tác tử, suy luận thị giác và sử dụng công cụ.

Các tính năng và khả năng chính của Claude Opus 4.7

Một tính năng trọng tâm của Opus 4.7 là ngân sách tác vụ, cho phép bạn đặt ràng buộc tài chính về số token mà tác tử có thể dùng cho mỗi tác vụ. Chúng giúp ngăn chi phí phát sinh khi tác tử chạy tự động bằng cách buộc tối ưu hóa và giữ trong ngân sách.

Claude Opus 4.7 có cửa sổ ngữ cảnh 1 triệu token và tối đa 128K token đầu ra. Điều này có nghĩa nó có thể chạy các tác vụ dài trong khi vẫn giữ toàn bộ ngữ cảnh của tác vụ. Điều này đặc biệt hữu ích khi khám phá một codebase lớn. 

Mô hình cũng cải thiện khả năng thị giác, hỗ trợ hình ảnh lên đến 3,75 megapixel. Nhờ đó, nó thể hiện tốt hơn ở suy luận thị giác so với Opus 4.6, trở thành mẫu lý tưởng cho các tác vụ như trích xuất dữ liệu từ biểu đồ độ phân giải cao.  

Opus 4.7 cũng có mức nỗ lực suy luận mới xhigh nằm giữa highmax để cho kết quả tốt nhất trên các tác vụ lập trình và tác tử. Bạn cũng có thể dùng mức nỗ lực high cho mức suy nghĩ thấp hơn một chút. Anthropic cũng giới thiệu /ultrareview trong Claude Code để chạy review mã trên các thay đổi mã và bắt lỗi. 

Claude Opus 4.7 key features and capabilities

Điều có thể khiến một số người ngạc nhiên là Adaptive Thinking nay mặc định không hiển thị phần suy nghĩ. Bạn có thể khôi phục phiên bản tóm tắt của lập luận bằng cách đặt thinking.display thành summarized.  

Về benchmark, Opus 4.7 đạt:

  • 87,6% trên SWE-bench Verified
  • 64,3% trên biến thể khó hơn SWE-bench Pro
  • 78% trên OSWorld, đo lường khả năng sử dụng máy tính tự chủ
  • 77,3% trên MCP Atlas cho điều phối quy trình đa công cụ

Khi Claude Opus 4.7 ra mắt, nó đứng đầu Artificial Analysis Intelligence Index với điểm 57. Nó cũng dẫn đầu ở tác vụ tác tử thực tế được đo bằng GDPval-AA, với 1.753 Elo. Trong lúc đó, GPT-5.5 đã vượt qua nó ở cả hai.

Tìm hiểu cách xây dựng ứng dụng benchmark bằng Streamlit để kiểm tra liệu bộ nhớ tự phê bình của Opus 4.7 có thực sự cải thiện hiệu suất lập trình qua các mức nỗ lực high, xhighmax từ Hướng dẫn Benchmark Thực tiễn Claude Opus 4.7 của chúng tôi. 

Ưu và nhược điểm của Claude Opus 4.7

Các mô hình của Anthropic được biết đến là tốt nhất cho lập trình, và benchmark của Opus 4.7 chứng minh điều đó. Tuy nhiên, họ Opus không rẻ, vì vậy tính năng ngân sách tác vụ rất hữu ích, đặc biệt cho những ai chạy các quy trình tác tử dài. 

Mô hình cũng có sẵn qua nhiều nhà cung cấp đám mây như Amazon Bedrock, Google Vertex AI và Microsoft Foundry. Điều này giúp tích hợp dễ dàng với nhà cung cấp hiện tại của bạn. 

Opus 4.7 cũng đi kèm bộ tokenizer mới, khiến việc so sánh chi phí thực tế với mẫu Opus trước đó khó hơn một chút. Tuy nhiên, theo Artificial Analysis Intelligence, Opus 4.7 dùng ít hơn ~35% token đầu ra so với Opus 4.6 để chạy chỉ số. 

The pros and cons of Claude Opus 4.7

Tìm hiểu các khả năng của mẫu tốt nhất công khai của Anthropic, Claude Opus 4.7, và xây dựng một công cụ khoa học dữ liệu có thể biến biểu đồ thành dữ liệu thô từ Hướng dẫn API Claude Opus 4.7. 

Gemini 3.1 Pro là gì? 

Gemini 3.1 Pro là mẫu suy luận chủ lực hiện tại của Google DeepMind, nổi bật với kiến trúc hỗn hợp chuyên gia dựa trên Transformer. Khi Gemini 3.1 Pro ra mắt, nó dẫn đầu Artificial Analysis Intelligence Index 4 điểm so với Opus 4.6, và hiện ngang bằng Opus 4.7 với điểm 57. 

Để tìm hiểu thêm về Gemini 3.1 Pro, hãy xem bài viết Xây dựng với Gemini 3.1 Pro của chúng tôi, hướng dẫn cách xây dựng ứng dụng sẵn sàng sản xuất với Gemini 3.1 Pro. 

Các tính năng và khả năng chính của Gemini 3.1 Pro

Không giống Gemini 3 Pro, vốn có hai mức, Gemini 3.1 Pro có 3 mức suy nghĩ: suy luận low, mediumhigh. Low phù hợp nhất cho tốc độ và tối ưu token. medium cân bằng. Vì high tạo ra nhiều token suy nghĩ hơn và phản hồi chậm nhất, bạn nên dùng cho các tác vụ cần suy luận phức tạp.  

Gemini 3.1 Pro cũng có cửa sổ ngữ cảnh 1 triệu token cho đầu vào, nhưng nhỏ hơn ở đầu ra, khoảng 65K token. Nó là đa phương thức, hỗ trợ âm thanh, PDF, văn bản và hình ảnh. 

Hãy nói về benchmark. Đây là hai lĩnh vực nơi Gemini 3.1 Pro tỏa sáng: 

  • Gemini 3.1 Pro dẫn đầu ở ARC-AGI-2 với 77,1%.
  • Gemini 3.1 Pro đạt 73,9% trên MCP Atlas, đo lường điều phối quy trình đa công cụ. 

Gemini 3.1 Pro key features and capabilities

Theo Artificial Analysis Intelligence, Gemini 3.1 Pro Preview hiệu quả về token, dùng ~57 triệu token để chạy Index của họ so với Opus 4.6. 

Gemini 3.1 Pro dẫn trước Opus 4.7 trên Artificial Analysis Coding Index, nhưng xếp sau trên Agentic Index. 

Ưu và nhược điểm của Gemini 3.1 Pro

Giá của Gemini 3.1 Pro khá hấp dẫn, đặc biệt cho công việc cần nhiều token. Google cũng cung cấp mức giảm 50% với mô hình định giá theo lô (batch), khiến nó trở thành lựa chọn lý tưởng khi bạn không cần kết quả thời gian thực. 

Ở chiều ngược lại, cửa sổ đầu ra 65K của Gemini 3.1 Pro chỉ bằng một nửa so với Opus 4.7 (128K). 

So sánh trực diện Claude Opus 4.7 và Gemini 3.1 Pro

Dưới đây là phần tham chiếu nhanh, trước khi chúng ta xem từng hạng mục.

 

Claude Opus 4.7

Gemini 3.1 Pro

Ngày phát hành

16 tháng 4, 2026

19 tháng 2, 2026

Cửa sổ ngữ cảnh

1 triệu token

1 triệu token

Đầu ra tối đa

128K token

65K token

SWE-bench Verified

87,6%

80,6%

SWE-bench Pro

64,3%

54,2%

ARC-AGI-2

75,8%

77,1%

GPQA Diamond

94,2% (hòa)

94,3% (hòa)

MCP Atlas

77,3%

73,9%

OSWorld

78,0%

Chưa công bố điểm

Thị giác

2576px / 3,75MP

Đa phương thức (video, âm thanh, PDF)

Giá đầu vào

$5/triệu token

$2/triệu token

Giá đầu ra

$25/triệu token

$12/triệu token

Hiệu năng tác vụ tác tử và sử dụng máy tính 

Opus 4.7 là một mô hình rất mạnh cho công việc tác tử, đặc biệt vì nó cho phép bạn kiểm soát số token tác tử có thể dùng. Hệ thống này không có ở Gemini 3.1 Pro; bạn phải dùng mức suy nghĩ để kiểm soát mức dùng token. 

Opus 4.7 đạt 78% trên benchmark sử dụng máy tính tự chủ OSWorld. Đó là kết quả mạnh, ngang với GPT 5.5 ở mức 78,7%, trong khi Gemini 3.1 Pro chưa công bố điểm OSWorld. Trên MCP Atlas, Opus 4.7 dẫn đầu với 77,3% so với 73,9% của Gemini. Những con số này khiến Opus 4.7 là lựa chọn lý tưởng cho hệ thống tác tử vận hành thực tế. 

Benchmark lập trình 

Giờ hãy xem mô hình nào tốt nhất khi nói đến lập trình theo các benchmark hiện có, đặc biệt là SWE-bench Verified, kiểm tra các issue thực trên GitHub. 

Opus 4.7 đạt 87,6% so với 80,6% của Gemini 3.1 Pro. Trên SWE-bench Pro, biến thể khó hơn, Opus 4.7 đạt 64,3% so với 54,2% của Gemini (và 58,6% của GPT 5.5). Những con số này cho thấy Opus 4.7 hiện là mô hình lập trình mạnh nhất thế giới. 

Hãy xem các mô hình thể hiện thế nào trên Terminal-Bench 2.0, đánh giá khả năng viết mã trên terminal. Opus 4.7 đạt 69,4%, Gemini Pro đạt 68,5%, và GPT 5.5 mới đạt 82,7%. GPT-5.5 là người thắng rõ ràng trên benchmark này, trong khi hai mô hình của chúng ta coi như hòa. 

Suy luận và các tác vụ khoa học 

Mô hình nào tốt nhất cho suy luận và các tác vụ khoa học? Hãy cùng tìm hiểu. Tôi sẽ không dùng benchmark GPQA Diamond vì tất cả các mô hình đều đạt xuất sắc. Thay vào đó, chúng ta sẽ xem ARC-AGI-2, đánh giá trí thông minh lỏng, tức khả năng giải các bài toán suy luận trừu tượng mà mô hình chưa từng thấy. 

Gemini 3.1 Pro đạt 77,1% so với 75,8% của Opus 4.7 và 85,0% của GPT 5.5, khiến GPT 5.5 là kẻ thắng rõ ràng ở đây, theo sau là Gemini 3.1 Pro. 

Trên Humanity's Last Exam, nhằm đo lường suy luận trình độ sau đại học trên khoa học, toán và nhân văn, Opus 4.7 dẫn trước Gemini 3.1 Pro cả khi có và không có công cụ:

  • Không dùng công cụ: Opus 4.7 dẫn với 46,9%, theo sau là Gemini 3.1 Pro (44,4%) và GPT 5.5 Pro (43,1%).
  • Có dùng công cụ: GPT 5.5 Pro dẫn với 57,2%, tiếp đến là Opus 4.7 (54,7%) và Gemini 3.1 Pro (51,4%).

Chi phí và hiệu quả token 

Opus 4.7 có giá $5 cho mỗi triệu token đầu vào và $25 cho mỗi triệu token đầu ra, trong khi Gemini 3.1 Pro có giá $2 cho mỗi triệu token đầu vào và $12 cho mỗi triệu token đầu ra. Gemini rẻ hơn nhiều, và với mức giảm 50% theo giá batch, mô hình có giá rất tốt cho các tác vụ cần nhiều token. 

Cũng cần lưu ý rằng tokenizer mới của Opus 4.7 khiến việc so sánh chi phí với mẫu Opus trước đó khó hơn một chút. 

Cửa sổ ngữ cảnh và dung lượng đầu ra 

Cả hai mô hình đều chấp nhận 1 triệu token đầu vào, cho phép chúng tiêu thụ toàn bộ codebase và các tài liệu nghiên cứu dài trong một prompt. 

Với token đầu ra, Opus 4.7 hỗ trợ 128K token trong khi Gemini 3.1 Pro hỗ trợ 65.536. Điều này khiến Opus phù hợp hơn cho các quy trình cần tạo nhiều token đầu ra hơn. 

Claude Opus 4.7 vs Gemini 3.1 Pro head-to-head comparison

Tìm hiểu cách Opus 4.7 và GPT 5.4 so sánh trong hướng dẫn Opus 4.7 vs. GPT-5.4 của chúng tôi, nơi chúng tôi so sánh hai mô hình về lập trình, quy trình tác tử và tác vụ ngữ cảnh dài, đồng thời phân tích benchmark.  

Claude Opus 4.7 có tốt hơn Gemini 3.1 Pro không?

Điều này đưa chúng ta đến câu hỏi: bạn nên chọn mô hình nào trong hai mô hình này?

Bạn nên chọn Claude Opus 4.7 nếu... 

  • Bạn xây dựng pipeline lập trình mang tính tác tử, nơi chênh lệch 10 điểm SWE-bench Pro chuyển hóa trực tiếp thành ít lần chạy thất bại hơn trong sản xuất.
  • Bạn cần ngân sách tác vụ để khiến các vòng lặp tự chủ dài dễ dự đoán hơn mà không cần thêm logic giám sát bên ngoài.
  • Pipeline của bạn tạo đầu ra dài và trần 128K token là quan trọng, gần gấp đôi so với Gemini 3.1 Pro hỗ trợ.
  • Bạn muốn điểm điều phối đa công cụ mạnh nhất trên MCP Atlas cho các quy trình tác tử phức tạp.
  • Bạn đã ở trong hệ sinh thái Anthropic qua Claude Code, Amazon Bedrock, hoặc Claude API, và chi phí chuyển đổi lớn hơn chênh lệch giá.

Bạn nên chọn Gemini 3.1 Pro nếu... 

  • Khối lượng token của bạn khiến chênh lệch chi phí đầu vào 2,5 lần trở nên đáng kể; ở mức 500 triệu token mỗi tháng, khoảng cách đó là $1.500 mỗi tháng
  • Bạn cần đầu vào video, âm thanh hoặc PDF nguyên bản trong một lần gọi API mà không cần bước tiền xử lý riêng
  • Bạn xây dựng trên hạ tầng của Google và muốn quan hệ một nhà cung cấp qua Vertex AI
  • Suy luận thị giác trừu tượng là trường hợp sử dụng chính của bạn. Opus kém ARC-AGI-2 ở mức 75,8% so với 77,1% của Gemini

Kết luận

Claude Opus 4.7 và Gemini 3.1 Pro đều là những mô hình mạnh. Việc chọn mô hình nào phụ thuộc vào ngân sách và tác vụ bạn muốn thực hiện. Opus thắng ở tác vụ tác tử, nhưng nếu vượt ngân sách, Gemini 3.1 Pro cũng là ứng viên mạnh, đặc biệt nhờ token rẻ hơn và giảm giá 50% theo batch. 

Anthropic duy trì vị thế dẫn đầu ở các mô hình lập trình tốt nhất, phù hợp với tác vụ tác tử cần suy luận và lập trình phức tạp. Google cung cấp các mô hình suy luận hàng đầu với mức giá thấp hơn đáng kể so với Anthropic. Cuộc đua giữa cả hai và các ông lớn khác như OpenAI là cung cấp mô hình tác tử tốt nhất đồng thời cũng là mô hình đa dụng tốt.

Vì họ Opus khá đắt, thật đáng mừng khi thấy giới thiệu ngân sách tác vụ. Tôi sẽ không ngạc nhiên nếu các nhà cung cấp khác tích hợp điều này trong các bản phát hành tương lai. Đây sẽ là bổ sung tốt để khiến chi phí vận hành các tác vụ tác tử kéo dài dễ dự đoán hơn. 

Để tìm hiểu thêm về làm việc với công cụ AI, tôi khuyên bạn xem hướng dẫn các công cụ AI miễn phí tốt nhất của chúng tôi. Với kỹ năng lập trình AI rộng hơn, hãy thử khóa học AI-Assisted Coding for Developers để phát triển các kỹ năng giúp trợ lý AI trở thành đối tác đáng tin cậy hơn trong quy trình phát triển của bạn. 

Cuối cùng, bạn cũng có thể khám phá cách xây dựng ứng dụng dùng AI với LLM, prompt, chuỗi và tác tử trong LangChain từ khóa học Developing LLM Applications with LangChain.

Claude Opus 4.7 vs Gemini 3.1 Pro Câu hỏi thường gặp

Claude Opus 4.7 có tốt hơn Gemini 3.1 Pro không?

Tùy trường hợp sử dụng. Opus 4.7 dẫn trước ở benchmark lập trình (87,6% so với 80,6% trên SWE-bench Verified), sử dụng công cụ mang tính tác tử (MCP Atlas 77,3% so với 73,9%) và dung lượng đầu ra (128K so với 65K token).

Ngân sách tác vụ trong Claude Opus 4.7 là gì?

Ngân sách tác vụ là giới hạn token bạn đặt cho toàn bộ vòng lặp tác tử, bao gồm suy nghĩ, lời gọi công cụ, kết quả công cụ và đầu ra cuối cùng. Claude theo dõi mức tiêu thụ ngân sách và điều chỉnh công việc tương ứng.

Gemini 3.1 Pro có giá bao nhiêu so với Claude Opus 4.7?

Gemini 3.1 Pro có giá $2 cho mỗi triệu token đầu vào và $12 cho mỗi triệu token đầu ra. Claude Opus 4.7 có giá $5 cho mỗi triệu token đầu vào và $25 cho mỗi triệu token đầu ra, vì vậy Gemini rẻ hơn 2,5 lần ở đầu vào. Gemini cũng cung cấp batch API giảm 50%, đưa chi phí đầu vào xuống còn $1 cho mỗi triệu token cho khối lượng công việc bất đồng bộ.

Claude Opus 4.7 và Gemini 3.1 Pro so sánh thế nào trên benchmark SWE-bench?

Gemini 3.1 Pro đạt 80,6% trên SWE-bench Verified và 54,2% trên SWE-bench Pro. Claude Opus 4.7 đạt 87,6% trên SWE-bench Verified và 64,3% trên SWE-bench Pro. Khoảng cách 10 điểm trên biến thể Pro là khác biệt ý nghĩa nhất giữa hai mô hình ở tác vụ lập trình.

Mô hình nào có cửa sổ ngữ cảnh dài nhất?

Cả Claude Opus 4.7 và Gemini 3.1 Pro đều hỗ trợ cửa sổ ngữ cảnh 1 triệu token cho đầu vào. Ở đầu ra, Opus 4.7 hỗ trợ tối đa 128.000 token, gấp đôi mức 65.536 token của Gemini 3.1 Pro. Nếu bạn cần tạo tài liệu dài hoặc mã đa tệp phức tạp trong một lần, trần đầu ra của Opus 4.7 là cao hơn trong hai mô hình.


Derrick Mwiti's photo
Author
Derrick Mwiti
Chủ đề
Trí tuệ Nhân tạo
Mô hình Ngôn ngữ Lớn

Các khóa học AI hàng đầu

Courses

Lập trình với AI dành cho Developer

1 giờ 30 phút
9.7K
Nâng cao kỹ năng lập trình của bạn với trí tuệ nhân tạo — hướng dẫn trợ lý lập trình của bạn để viết, kiểm thử và tài liệu hóa mã nguồn một cách hiệu quả.
Xem chi tiếtRight Arrow
Bắt Đầu Khóa Học
Xem thêmRight Arrow
Có liên quan

blogs

Claude Opus 4.6: Tính năng, Điểm chuẩn, Bài kiểm tra thực hành và hơn thế nữa

Mô hình mới nhất của Anthropic dẫn đầu ở mã hóa tác tử và lập luận phức tạp. Thêm vào đó, nó có cửa sổ ngữ cảnh 1M.
Matt Crabtree's photo

Matt Crabtree

10 phút

Xem ThêmXem Thêm