Google đã công bố Gemini 4 Argon vào cuối tháng 9. Argon là mô hình Gemini 4 đầu tiên của Google và là biên giới mới. Nó ra mắt sau GPT-6 Astra của OpenAI bốn tuần, vốn là mẫu chủ lực mới của OpenAI từ đầu tháng 9.
Bảng công bố của Google đặt Argon vượt Astra ở hầu hết các mục, với chi phí chỉ bằng một phần nhỏ so với Astra. Tuy nhiên có một điểm quan trọng hơn mọi benchmark: Argon chưa mở cho số đông. Google đang triển khai trước cho các đội an ninh mạng đã được thẩm định, chưa có ngày dành cho nhà phát triển hoặc người dùng phổ thông.
Tóm tắt nhanh
- Trên bảng benchmark của chính Google, Gemini 4 Argon vượt GPT-6 Astra ở hầu hết các mục, nổi bật ở nhiệm vụ pháp lý, tài chính và quy trình nghiệp vụ.
- GPT-6 Astra giữ lợi thế ở kỹ thuật phần mềm khó nhất, công việc khoa học trên terminal và thao tác máy tính.
- Giá mở đầu của Argon chỉ bằng 1/5 Astra, và giá tiêu chuẩn vẫn chưa đến một nửa.
- Nhưng bạn chưa thể dùng Argon: quyền truy cập chỉ dành cho các đơn vị phòng thủ an ninh mạng đáng tin cậy của Google, tiếp theo là khách hàng API trả phí và người đăng ký AI Ultra.
- Vì vậy, hãy chọn GPT-6 Astra nếu bạn cần một mô hình frontier để chạy sản xuất ngay hôm nay.
Gemini 4 Argon là gì?
Gemini 4 Argon là mô hình frontier mới của Google DeepMind, công bố vào cuối tháng 9. Đây là mô hình đầu tiên trong thế hệ Gemini 4.
Google xây dựng Argon để duy trì lập luận sâu cho các công việc dài, nhiều bước. Điều đó được hỗ trợ bởi giới hạn đầu ra nâng lên 1 triệu token để mô hình có thể suy luận trọn một bài toán khó trong một lượt.
GPT-6 Astra là gì?
GPT-6 Astra là mô hình chủ lực của OpenAI, phát hành đầu tháng 9. Nó đứng đầu họ GPT-6, phía trên GPT-6.1 Sol và GPT-6 Luna.
OpenAI định vị đây là mô hình mạnh nhất cho công việc đòi hỏi cao nhất, từ lập luận phức tạp và lập trình đến sử dụng máy tính và nghiên cứu.
Gemini 4 Argon vs GPT-6 Astra: So sánh trực diện
Trong 19 benchmark ở bảng ra mắt của Google, Argon đạt điểm cao hơn Astra ở 14, Astra thắng 4 và một mục hòa. Tất cả đều từ bảng của Google, nên hãy xem đây là lập luận của Google cho Argon hơn là một xếp hạng độc lập. Tôi đã rút gọn bảng để nêu những bài kiểm thử benchmark nổi tiếng, thú vị và phù hợp nhất cho lần phát hành này.
| Tính năng | Gemini 4 Argon | GPT-6 Astra |
|---|---|---|
| Vals Index | 68,9% | 63,1% |
| AutomationBench | 51,3% | 41,4% |
| Vals Finance Agent v2 | 65,4% | 53,5% |
| Harvey's Legal Agent Benchmark | 19,6% | 5,4% |
| DeepSWE v1.1 | 77,9% | 74,1% |
| FrontierSWE v2 | 55,0% | 65,5% |
| Terminal-bench 4.0 | 57,4% | 58,2% |
| Terminal-Bench Science 0.1 | 57,6% | 68,1% |
| OSWorld-2.0 (tập con ngoại tuyến) | 69,2% | 72,6% |
| Số token đầu ra tối đa | 1M | 128K |
| Tính khả dụng | Chỉ dành cho các đơn vị phòng thủ an ninh mạng đáng tin cậy | Mở rộng cho số đông |
Các khía cạnh dưới đây bao quát phần còn lại của bảng.
Công việc tri thức: pháp lý, tài chính và quy trình doanh nghiệp
Đây là nơi Argon dẫn trước rộng nhất và cũng là trọng tâm ra mắt của Google.
Trên Harvey's Legal Agent Benchmark, bài kiểm tra nghiên cứu và soạn thảo pháp lý, Argon đạt 19,6% so với 5,4% của Astra. Điểm số đều thấp, nhưng số nhiệm vụ hoàn thành gấp hơn ba lần là khoảng cách tương đối lớn nhất trong cả bảng.
Mẫu hình này lặp lại ở nghiên cứu tài chính và tự động hóa doanh nghiệp, nơi Argon dẫn khoảng 10 đến 12 điểm. Nếu các kết quả này giữ vững khi người dùng có thể thử, Argon là mô hình mạnh hơn cho công việc pháp lý và tài chính nặng tài liệu.
Lập trình và kỹ thuật phần mềm
Lập trình là kết quả chia đôi, và tùy thuộc bạn nói đến dạng kỹ thuật nào.
Argon dẫn đầu DeepSWE v1.1, kiểm tra các nhiệm vụ dài hạn trong codebase thực, và nhỉnh hơn Astra ở Vibe Code Bench, thang điểm cho việc xây dựng ứng dụng chạy được.

Astra thắng rõ trên FrontierSWE v2, và hai bên chỉ chênh chưa đến một điểm ở Terminal-bench 4.0.
Các ví dụ của chính Google nghiêng về những cuộc chuyển đổi lớn, gồm C và C++ sang Rust trên các codebase nội bộ của Google.
Tuy vậy, ở benchmark kỹ thuật khó nhất trong bảng, Astra vẫn dẫn trước.
Ngữ cảnh dài và hiểu nội dung thị giác
Argon bứt lên khi đầu vào dài hơn.
Trên GraphWalks, bài kiểm tra lập luận qua các cấu trúc đồ thị trải trên ngữ cảnh dài, hai bên sát nhau đến 128K token, nhưng từ 256K đến 1M token, Argon ghi điểm cao hơn.
Argon cũng dẫn trên LVBench về hiểu video dài, trong khi đọc biểu đồ trên Chartography gần như hòa.
Với những ai nạp cả hợp đồng, codebase hoặc bản ghi vào mô hình, đây là khác biệt thực tế nhất sau yếu tố khả dụng.
Khoa học, toán và sử dụng máy tính
Astra giữ vững ở công việc khoa học trên terminal, dẫn Terminal-Bench Science 0.1 hơn 10 điểm. Argon dẫn LABBench 2, một benchmark nghiên cứu sinh học, và RiemannBench về toán. Về sử dụng máy tính, Astra dẫn OSWorld-2.0 trong khi Argon dẫn Agent's Last Exam, nên không bên nào áp đảo danh mục này.
Tính khả dụng và an toàn
Astra là mô hình bạn có thể triển khai ngay hôm nay. Argon hiện giới hạn trong Chương trình Fairwind của Google dành cho các đơn vị phòng thủ an ninh mạng đáng tin cậy, cùng các đội nội bộ của Google, và Google cho biết khách hàng API trả phí và người đăng ký Google AI Ultra sẽ là tiếp theo nhưng chưa đưa ra ngày.
Câu chuyện an ninh mạng của Argon cũng hai mặt. Google phát hành cho các đơn vị đã thẩm định mà không gắn rào chắn an ninh mạng, và nó đồng hạng nhất với Astra trên CWE-bench v1, bài kiểm tra sửa lỗi bảo mật thực.
Với những người còn lại, Google nói Argon sẽ từ chối các yêu cầu gây hại liên quan đến an ninh mạng và CBRN, và chạy các bộ giám sát có thể dừng thực thi khi mô hình vượt quá ý định của người dùng.
Giá: chi phí bạn thực trả
Argon có giá chỉ bằng 1/5 Astra ở mức mở đầu và chưa đến một nửa ở mức tiêu chuẩn, nhưng Google chưa nói thời gian áp dụng giá mở đầu kéo dài bao lâu.
Mức phí theo token, so sánh cạnh nhau
| Mức phí | Gemini 4 Argon (mở đầu) | Gemini 4 Argon (tiêu chuẩn) | GPT-6 Astra |
|---|---|---|---|
| Đầu vào, mỗi 1M token | $2,00 | $4,00 | $10,00 |
| Đầu ra, mỗi 1M token | $10,00 | $20,00 | $50,00 |
| Đọc đầu vào đã lưu cache, mỗi 1M token | $0,10 (giảm 95% so với đầu vào) | Chưa công bố | $1,00 |
| Phụ phí ngữ cảnh dài | Chưa công bố | Chưa công bố | Trên 272K token đầu vào: gấp 2 lần phí đầu vào và cache, 1,5 lần phí đầu ra cho cả yêu cầu |
Hệ số đều nhau cho đầu vào và đầu ra: 0,2x so với Astra ở mức mở đầu và 0,4x ở mức tiêu chuẩn. Cả hai nhà cung cấp tính phí lập luận như đầu ra, điều này quan trọng hơn với Argon, vì Google nâng giới hạn đầu ra lên 1 triệu token chính là để mô hình "nghĩ" lâu hơn.
Ngay cả ở mức tiêu chuẩn, Argon vẫn thấp hơn nhiều so với chi phí của Astra. Câu hỏi bỏ ngỏ là các prompt dài, nơi chỉ Astra đã công bố biểu giá.
Chi phí cho một khối lượng công việc thực tế
| Khối lượng công việc | Gemini 4 Argon (mở đầu) | Gemini 4 Argon (tiêu chuẩn) | GPT-6 Astra |
|---|---|---|---|
| Trợ lý cân bằng: 1M vào / 250K ra | $4,50 | $9,00 | $22,50 |
| Truy hồi, mỗi yêu cầu dưới 272K: 10M vào / 1M ra | $30 | $60 | $150 |
| Truy hồi, mỗi yêu cầu trên 272K: 10M vào / 1M ra | Chưa công bố | Chưa công bố | $275 |
Mỗi tổng chi phí là (khối lượng ÷ 1M) × mức phí, cộng gộp giữa đầu vào và đầu ra, tính theo mức tiêu chuẩn.
- Trợ lý cân bằng: Argon tiết kiệm $18 mỗi tháng (80%) ở mức mở đầu và $13,50 (60%) ở mức tiêu chuẩn.
- Truy hồi dưới 272K: mức tiết kiệm tương tự 80% và 60%, ở quy mô bắt đầu đáng kể: $120 hoặc $90 mỗi tháng.
- Truy hồi trên 272K: phụ phí của Astra đẩy chi phí lên $275. Google chưa nói Argon có bậc giá ngữ cảnh dài hay không, nên đây là dòng cần kiểm tra khi trang giá của Argon được công bố.
Hai nhà cung cấp dùng tokenizer khác nhau và không bên nào công bố số token cho cùng một khối lượng công việc, nên hãy coi các tổng này là so sánh mức phí chứ không phải hóa đơn thực tế.
Khi nào nên chọn Gemini 4 Argon so với GPT-6 Astra
Hiện tại, điểm tách biệt là khả dụng chứ không phải benchmark: Astra mở rộng cho số đông, còn Argon giới hạn cho các đơn vị phòng thủ an ninh mạng đã thẩm định. Khi Argon mở ra, hệ số giá 0,2x đến 0,4x sẽ khiến nó trở thành mặc định để thử cho công việc tri thức.
Chọn Gemini 4 Argon nếu...
- Công việc của bạn là nghiên cứu pháp lý, phân tích tài chính hoặc tự động hóa nghiệp vụ. Đây là các mảng dẫn trước rộng nhất theo bảng của Google, và khoảng cách về pháp lý là lớn nhất.
- Bạn nạp vào các đầu vào rất dài. Nó giữ vững tốt hơn nhiều so với Astra khi lập luận trên 256K đến 1M token, và dẫn ở video dài.
- Giá cả quan trọng ở chất lượng frontier. Ngay ở mức tiêu chuẩn, chi phí mỗi token vẫn thấp hơn nhiều so với Astra.
Chọn GPT-6 Astra nếu...
- Bạn cần dùng ngay hôm nay. Astra có trong ChatGPT, OpenAI API, Azure, Bedrock, GitHub Copilot và OpenRouter, trong khi Argon chưa có API công khai.
- Công việc khó nhất của bạn là kỹ thuật phần mềm hoặc tính toán khoa học. Nó dẫn Argon ở FrontierSWE v2 và Terminal-Bench Science, mỗi mục hơn 10 điểm.
- Bạn chạy agent thao tác máy tính trên ứng dụng desktop. Nó dẫn OSWorld-2.0, dù Argon thắng Agent's Last Exam, nên hãy thử trên tác vụ của riêng bạn.
Kết luận
Nếu bạn cần một mô hình frontier trong tuần này, GPT-6 Astra là lựa chọn. Nếu công việc của bạn là pháp lý, tài chính hoặc phân tích tài liệu dài, và bạn có thể chờ, hãy lên kế hoạch thử Gemini 4 Argon ngay ngày nó mở. Chúng tôi sẽ cập nhật chính xác thời điểm đó nếu bạn đăng ký The Median, bản tin hàng tuần của chúng tôi:
Cuộc so sánh Argon với Astra này khá thú vị. Google đã ra mắt Argon cùng bảng benchmark cho thấy nó vượt OpenAI ở đa số mục, với mức giá thấp hơn Astra. Nhưng cũng đồng thời chưa có cách cho phần lớn người dùng tiếp cận.
Google đang đặt cược rằng lợi thế sẽ giữ vững cho đến khi mở quyền truy cập.
Câu hỏi thường gặp
Gemini 4 Argon có tốt hơn GPT-6 Astra không?
Trên bảng benchmark của chính Google, Gemini 4 Argon đạt điểm cao hơn GPT-6 Astra ở 14/19 benchmark, với các khoảng cách lớn nhất ở pháp lý, tài chính, tự động hóa doanh nghiệp và công việc ngữ cảnh dài. GPT-6 Astra dẫn ở FrontierSWE v2, Terminal-Bench Science 0.1, OSWorld-2.0 và Terminal-bench 4.0. Tất cả điểm số do Google cung cấp, nên vẫn cần các bài kiểm thử độc lập.
Tôi đã có thể dùng Gemini 4 Argon chưa?
Chưa, trừ khi bạn thuộc Chương trình Fairwind của Google dành cho các đơn vị phòng thủ an ninh mạng đáng tin cậy. Google cho biết khách hàng API trả phí và người đăng ký Google AI Ultra sẽ được truy cập tiếp theo, nhưng chưa đưa ra ngày hay công bố mã mô hình API.
Giá của Gemini 4 Argon so với GPT-6 Astra là bao nhiêu?
Gemini 4 Argon ra mắt với giá mở đầu $2 cho mỗi triệu token đầu vào và $10 cho mỗi triệu token đầu ra, sau đó tăng lên $4 và $20. GPT-6 Astra có giá $10 và $50, vì vậy Argon chỉ bằng 1/5 giá Astra ở mức mở đầu và 40% ở mức tiêu chuẩn. Google chưa nói thời gian áp dụng mức mở đầu kéo dài bao lâu.
Mô hình nào tốt hơn cho lập trình, Gemini 4 Argon hay GPT-6 Astra?
Kết quả chia đôi. Trên bảng của Google, Gemini 4 Argon dẫn DeepSWE v1.1 và Vibe Code Bench, trong khi GPT-6 Astra dẫn FrontierSWE v2 khoảng 10 điểm và nhỉnh hơn Argon ở Terminal-bench 4.0. Với các nhiệm vụ kỹ thuật khó nhất, Astra hiện có kết quả công bố mạnh hơn.
Giới hạn đầu ra của Gemini 4 Argon là bao nhiêu?
Google đã nâng giới hạn đầu ra của Gemini 4 Argon lên 1 triệu token, tăng từ 64K ở các mẫu Gemini trước đó, để có thể suy luận qua các bài toán dài trong một lượt. Mức đầu ra tối đa của GPT-6 Astra là 128K token.