Tháng 2/2025, Claude 3.7 Sonnet đạt 62,3% trên SWE-bench Verified, hoặc 70,3% với giàn khung tùy chỉnh, trong khi mô hình open-weight tốt nhất khi đó, DeepSeek-R1, báo cáo 49,2% trong bài báo.
Đó là khoảng cách 13 đến 21 điểm, tùy vào mức “hào phóng” của giàn khung.
Đến tháng 9/2026, bảng độc lập của Vals AI cho SWE-bench Verified ghi nhận Claude Opus 5 đạt 97,0% và DeepSeek V4 Pro 0813 open-weight đạt 96,4%, và Vals đã lưu trữ (archive) benchmark này vì nó bão hòa.
Giới hạn đã chuyển sang các đánh giá agentic khó hơn như SWE-bench Pro và Terminal-Bench 4.0, các mô hình open-weight bắt kịp trên bộ cũ, và câu hỏi “LLM tốt nhất cho lập trình” trở thành “tốt nhất cho mục đích gì, trên phần cứng nào, với chi phí bao nhiêu”.
Tôi sẽ trả lời câu hỏi đó cho 9 mô hình mà tôi thực sự cân nhắc dùng hiện nay, và câu ngắn gọn là Claude Opus 5.5 là mô hình hầu hết các nhóm nên bắt đầu.
Một lưu ý trước bảng xếp hạng: bài viết này nói về chính các mô hình, không phải công cụ bọc quanh chúng. Nếu bạn cần so sánh Cursor, Copilot và Windsurf, bài tổng hợp trợ lý lập trình AI tốt nhất năm 2026 của chúng tôi có đề cập.
Tóm tắt nhanh: LLM lập trình tốt nhất tháng 9/2026
Claude Opus 5.5 hiện vừa là mô hình lập trình mạnh nhất trên đa số benchmark vừa là lựa chọn mặc định cho đa số lập trình viên, Claude Fable 5.1 là mô hình để nâng cấp khi làm việc tầm nhìn dài, và Qwen3.8-27B là mô hình open-weight để chạy trên một GPU. Dưới đây là lựa chọn tốt nhất theo mục đích:
- Tốt nhất tổng thể cho lập trình agentic: Claude Opus 5.5 (Anthropic), 89,9% SWE-bench Pro và 66,4% Terminal-Bench 4.0, giá $4 đầu vào và $20 đầu ra mỗi triệu token.
- Tốt nhất cho công việc tầm nhìn dài: Claude Fable 5.1 (Anthropic), 81,2% SWE-bench Pro và điểm Terminal-Bench 2.1 cao nhất trên Artificial Analysis (91,4%), giá $10 đầu vào và $50 đầu ra mỗi triệu token.
- Mô hình OpenAI tốt nhất cho lập trình: GPT-6 Astra (OpenAI), đứng đầu bảng agent Terminal-Bench 4.0 của tbench.ai với 58,2%, và ngang Opus 5.5 ở mức 59,6% trong lượt chạy của Artificial Analysis.
- Giá trị tốt nhất từ phòng thí nghiệm frontier: Gemini 3.8 Flash (Google), 89,4% Terminal-Bench 2.1 với $0,75 đầu vào và $3,75 đầu ra mỗi triệu token đến hết 31/12/2026.
- Open-weight tốt nhất qua API: DeepSeek V4.1 Flash, giấy phép MIT, 90,6% Terminal-Bench 2.1, $0,60 mỗi triệu token đầu ra ngoài giờ cao điểm.
- Open-weight tốt nhất bạn không thể chạy tại nhà: Kimi K3 (Moonshot AI), 2,8 nghìn tỷ tham số, 88,3% Terminal-Bench 2.1.
- Mô hình cục bộ tốt nhất trên GPU 24 GB: Qwen3.8-27B (Alibaba), Apache 2.0, 73,0% Terminal-Bench 2.1, 16,5 GB ở UD-Q4_K_M.
- Mô hình cục bộ tốt nhất cho workstation 128 GB: Laguna S 2.1 (Poolside), 118B tham số với chỉ 8B hoạt động, ngữ cảnh 1M.
- Mô hình cục bộ nhanh cho phần cứng cũ: Qwen3-Coder-Next, tổng 80B nhưng 3B hoạt động, 70,6% SWE-bench Verified.
Mọi điểm số trên đây là do nhà cung cấp công bố trừ khi có ghi chú khác. Phần còn lại giải thích vì sao tôi chọn các mô hình đó và chúng vấp ở đâu.
Vì sao danh sách này nói về mô hình chứ không phải trợ lý lập trình?
LLM lập trình là mô hình đọc prompt của bạn và sinh token, còn trợ lý lập trình là bộ khung đưa file vào, chạy lệnh, và hiển thị diff.
Claude Code, Codex, Cursor, GitHub Copilot và Windsurf là các bộ khung. Claude Opus 5.5, GPT-6 Astra và Qwen3.8-27B là mô hình, và bộ khung làm thay đổi điểm số nhiều hơn bạn tưởng.
Bài ra mắt Claude Opus 4.8 của chính Anthropic nêu điều này rõ trong một chú thích.
Bài viết báo cáo điểm Terminal-Bench 2.1 của mọi mô hình trên bộ khung công khai Terminus-2, rồi lưu ý rằng số của GPT-5.5 tăng lên 83,4% khi chạy trong Codex CLI của OpenAI. Cùng trọng số, đường ống khác, kết quả khác.
Đó là lý do các xếp hạng dưới đây đi kèm bộ khung khi có thể. Nếu bạn mới với cách các mô hình này vận hành bên trong, hướng dẫn của chúng tôi về LLM là gì chỉ 15 phút đọc và sẽ giúp phần còn lại dễ theo dõi hơn.
Benchmark nào thực sự quan trọng cho LLM lập trình?
Các benchmark quan trọng cho LLM lập trình năm 2026 là SWE-bench Pro, Terminal-Bench (bản 2.1 và 4.0), và, với các mô hình open-weight còn báo cáo, LiveCodeBench v6. SWE-bench Verified từng là tiêu chuẩn suốt 2 năm và nay quá bão hòa để phân biệt các mô hình top.
Trước khi xếp hạng, dưới đây là ý nghĩa của từng con số trong mục mô hình.
SWE-bench Verified đã bão hòa
SWE-bench Verified là tập 500 issue GitHub được con người xác thực từ các repository Python phổ biến; mô hình nhận repo và mô tả issue và phải tạo bản vá vượt qua các bài kiểm thử ẩn.
OpenAI giới thiệu tập con Verified năm 2024 vì bản gốc SWE-bench chứa các tác vụ có issue thiếu chi tiết hoặc kiểm thử lỗi. Nó vẫn là con số được trích dẫn nhiều nhất, và đó chính là vấn đề.
Bảng xếp hạng Vals AI, chạy mọi mô hình qua cùng một agent bash tối giản, đưa Claude Opus 5 ở 97,0%, DeepSeek V4 Pro 0813 ở 96,4% và GPT-5.6 Sol ở 96,2% trong bản cập nhật 1/9/2026, rồi đánh dấu benchmark đã lưu trữ.
Khi 3 mô hình từ 3 phòng lab cách nhau trong 1 điểm và cách trần 4 điểm, thước đo đã hết khả năng phân biệt. Tôi vẫn trích số này cho các mô hình cũ hơn và nhỏ hơn vì đó là con số trên thẻ của chúng, nhưng tôi không xếp hạng dựa trên nó.
SWE-bench Pro là bản thay thế khó hơn
SWE-bench Pro, do Scale AI duy trì, chứa 1.865 tác vụ trên 41 repository chuyên nghiệp, với 731 tác vụ công khai và các tập riêng giữ lại. Ngày 22/9/2026, Scale phát hành SWE-Bench Pro V2, cắt tập công khai xuống 642 tác vụ sau khi loại 89 tác vụ không hợp lệ, nên hãy kiểm tra phiên bản điểm số được chạy.
Sửa trung bình chạm 107,4 dòng trên 4,1 tệp, và các repository bao gồm nhiều ngôn ngữ chứ không chỉ Python. Khi bài báo SWE-bench Pro ra mắt tháng 9/2025, các mô hình tốt nhất khoảng 23%.
Một năm sau, thẻ hệ thống Fable 5.1 báo cáo 81,2% cho Fable 5.1 và 79,2% cho Opus 5, và bảng ra mắt GPT-5.6 báo 64,6% cho GPT-5.6 Sol. Ba tuần sau thẻ Fable, thẻ hệ thống Opus 5.5 đẩy điểm cao nhất lên 89,9%.
Đó là lượt chạy của nhà cung cấp, trung bình trên 5 lần thử ở mức nỗ lực tối đa trong trường hợp Anthropic. Bảng công khai của Scale chậm hơn vài tháng, nên tôi coi số của vendor là trần và leaderboard là sàn.
Terminal-Bench 2.1 và 4.0
Terminal-Bench cho mô hình một shell trực tiếp trong container và một tác vụ như “huấn luyện mô hình này”, “sửa bản build này” hoặc “khôi phục kho lưu trữ bị lỗi”, rồi chấm điểm các hiện vật nó tạo ra.
Bản 2.1 gồm 89 tác vụ chọn lọc về kỹ nghệ phần mềm, quản trị hệ thống, xử lý dữ liệu và bảo mật, và Artificial Analysis chấm theo pass@1 trung bình trên 3 lượt chạy với bộ khung Terminus 2. Đây là con số tôi cân nặng nhất cho bất kỳ ai xây hoặc dùng agent lập trình.
Terminal-Bench 4.0, do Stanford, Harbor và Viện Laude tổ chức tại tbench.ai, là bộ tiên phong mới.
Thẻ hệ thống Opus 5.5 của Anthropic mô tả nó gồm 66 tác vụ thiên về sinh học tính toán, mô phỏng vật lý, CAD, chứng minh hình thức và công việc hiệu năng GPU, với thời gian chờ dài hơn nên bộ khung ít tác động hơn.
Trên bảng agent tbench.ai, GPT-6 Astra vẫn dẫn đầu ở 58,2% với bộ khung Codex ở mức nỗ lực tối đa, Claude Fable 5.1 ở 57,9%, nhưng Claude Opus 5.5 chưa có mục agent ở đó. Ở các lượt chạy cấp mô hình, Artificial Analysis cho thấy Opus 5.5 và Astra đồng hạng ở 59,6%, và Vals AI đặt Opus 5.5 đầu bảng ở 61,6%, dù Vals lưu ý con số này giảm xuống 53,5% nếu tính các tác vụ mà biện pháp an toàn của họ chuyển cho mô hình dự phòng là thất bại. Đây là nơi ranh giới tiên phong tách khỏi phần còn lại.
LiveCodeBench v6 phát hiện hiện tượng ghi nhớ
LiveCodeBench, giới thiệu trong bài báo năm 2024 của Jain và cộng sự, liên tục thu thập bài từ LeetCode, AtCoder và Codeforces và đóng dấu thời gian cho từng bài để bạn có thể đánh giá mô hình chỉ trên các bài công bố sau mốc cắt dữ liệu huấn luyện.
Phiên bản 6 là cửa sổ hiện tại trên bảng công khai. Nó đo tư duy thuật toán hơn là kỹ nghệ ở quy mô repository, vì vậy vẫn hữu ích cho phong cách phỏng vấn và cấu trúc dữ liệu.
Các phòng lab frontier hầu như không còn báo cáo số này năm 2026, nên con số tôi có là từ mô hình open-weight: bản preview DeepSeek V4 Pro tháng 4 đạt 93,5%, Qwen3.8-27B đạt 90,3%, và Kimi K2.6 đạt 89,6%. Gemini 3.1 Pro báo một thước đo liên quan, Elo LiveCodeBench Pro là 2.887.
Tôi đọc bảng benchmark của vendor như thế nào
Bảng benchmark của vendor là kịch bản tốt nhất: bộ khung của họ, mức nỗ lực của họ, số lần thử của họ. Tôi tìm một phép lặp độc lập trên Artificial Analysis, Vals AI, hoặc bảng tbench.ai trước khi tin vào khoảng cách nhỏ hơn 3 điểm.
Bài nhập môn về benchmark LLM và cách so sánh mô hình của chúng tôi đi qua các bảng chính, và bài về MMLU đo gì là lời nhắc tốt rằng benchmark kiến thức hầu như không cho biết mô hình có sửa được một bài test chập chờn hay không.
Nếu bạn muốn tự xây bộ khung đánh giá, hướng dẫn về chỉ số và phương pháp đánh giá LLM là tài liệu tôi thường chỉ cho đồng nghiệp mới.
Với các benchmark đã rõ, dưới đây là điểm của 9 mô hình, bắt đầu từ nhóm frontier trên đám mây.
Các mô hình frontier trên đám mây tốt nhất cho lập trình là gì?
Các mô hình frontier trên đám mây tốt nhất cho lập trình tháng 9/2026 là Claude Opus 5.5, Claude Fable 5.1, GPT-6 Astra và Gemini 3.8 Flash, và cả 4 đều có cửa sổ ngữ cảnh khoảng 1M token.
Khác biệt là giá, mức nỗ lực và benchmark mà từng phòng lab tối ưu.
Tôi liệt kê theo thứ tự tôi sẽ khuyên cho một nhóm có thể chi trả bất kỳ mô hình nào.
1. Claude Opus 5.5 (Anthropic)
Claude Opus 5.5 là bản flagship cấp Opus mới của Anthropic, phát hành 22/9/2026, và hiện là mô hình lập trình tôi khuyên cho hầu hết mọi người. Tôi đã không ngờ viết điều đó chỉ 2 tháng sau Opus 5. Bài ra mắt nói rằng hiệu năng của nó ở mức Fable 5.1 trên đa số công việc trong khi chi phí vận hành thấp hơn Opus 5 khoảng 40%, và tổng quan mô hình nay bảo nhà phát triển nên bắt đầu với Opus 5.5 và dùng Fable 5.1 cho công việc tầm nhìn dài hoặc khi đánh giá trên Opus 5.5 thiếu hụt.
Thẻ hệ thống Opus 5.5 báo 89,9% trên SWE-bench Pro, 74,2% trên DeepSWE v1.1, và 66,4% trên Terminal-Bench 4.0 ở mức xhigh, vượt Fable 5.1 ở mọi hàng liên quan đến lập trình mà Anthropic công bố. Số độc lập thì sít sao hơn: Artificial Analysis cho nó đồng hạng GPT-6 Astra ở 59,6% trên Terminal-Bench 4.0, và Vals AI đặt nó đầu bảng với 61,6% trên Terminal-Bench 4.0 và 87,6% trên Terminal-Bench 2.1. Cả hai số của Vals tính cả các lượt fallback do biện pháp an toàn; nếu tính các lượt đó là thất bại, điểm giảm xuống 53,5% và 79,8%.
Tính năng chính:
- $4 mỗi triệu token đầu vào và $20 mỗi triệu token đầu ra, thấp hơn Opus 5 khoảng 20%, đọc cache giảm 60% còn $0,20 mỗi triệu
- Ngữ cảnh 1M token, đầu ra 128K, tư duy thích ứng luôn bật và mức nỗ lực mặc định là medium thay vì high
- 57,8% trên CursorBench 4.0 ở mức nỗ lực tối đa, điểm cao nhất bảng của Cursor; ở mức medium đạt 52,5%, vẫn cao hơn Fable 5.1 ở mức tối đa
- Có trên API Claude dưới tên
claude-opus-5-5, cùng Amazon Bedrock, Google Cloud và Microsoft Foundry
Phù hợp nhất: lập trình hằng ngày, di trú toàn codebase, và review code. Nó thay thế Opus 5 hoàn toàn với giá thấp hơn, và Claude Code nay dùng nó làm mặc định cho dòng Opus. Hướng dẫn Claude Opus 5.5 của chúng tôi bao quát đợt ra mắt, và so sánh GPT-6 Sol vs Claude Opus 5.5 có bài thử thực tế.
Đánh đổi: mức tiết kiệm 40% áp dụng ở nỗ lực mặc định. Ở mức tối đa, Artificial Analysis nhận thấy nó dùng nhiều token hơn Opus 5 đáng kể, nên chi phí mỗi tác vụ Intelligence Index ($5,98) gần như ngang Opus 5 ($5,86). Nó cũng đi kèm biện pháp an toàn kiểu Fable chuyển hầu hết tác vụ an ninh mạng về Opus 4.8, và việc di trú code cần cẩn trọng, vì yêu cầu tắt tư duy hoặc ép dùng công cụ nay trả về lỗi.
2. Claude Fable 5.1 (Anthropic)
Claude Fable 5.1 là phiên bản công khai của mô hình cấp Mythos của Anthropic, phát hành 1/9/2026, và là mô hình tôi dùng khi Opus 5.5 “hết đường”. Trang ra mắt nói Fable 5.1 và Claude Mythos 5.1 là cùng mô hình với các biện pháp an toàn khác nhau.
Các số trên thẻ hệ thống Fable 5.1 là 81,2% trên SWE-bench Pro và 55,8% trên Terminal-Bench 4.0. Artificial Analysis đo độc lập 91,4% trên Terminal-Bench 2.1 ở mức nỗ lực tối đa, vẫn là điểm cao nhất trên bảng đó.
Tính năng chính:
- Cửa sổ ngữ cảnh 1M token và đầu ra 128K token
- Tư duy thích ứng luôn bật
- Đọc prompt-cache giảm 75% còn $0,25 mỗi triệu token từ bản 5.1, Anthropic ước tính giảm tới 45% chi phí cho tác vụ agentic
- Lập kế hoạch đa tệp mạnh và tư duy rộng hơn với khả năng dùng công cụ tốt hơn
Phù hợp nhất: pipeline agentic sản xuất, refactor nhiều ngày, và mọi tác vụ mà sai sót đắt hơn tiền token, sau khi đánh giá của bạn cho thấy Opus 5.5 chưa đạt. Hướng dẫn Claude Fable 5.1 của chúng tôi bao quát bản phát hành này, và tổng quan Claude Fable 5 bao quát bản gốc tháng 6.
Đánh đổi: $10 mỗi triệu token đầu vào và $50 mỗi triệu token đầu ra là gấp 2,5 lần Opus 5.5, và trên chính bảng của Anthropic, Fable 5.1 nay xếp sau Opus 5.5 ở SWE-bench Pro, Terminal-Bench 4.0, và CursorBench 4.0. Anthropic nói khoảng cách thực tế hẹp hơn các điểm số thể hiện, nhưng gánh nặng chứng minh đã đảo chiều. Trên CursorBench 3.2.0 cũ hơn, Fable 5.1 ở mức medium đạt 68,0% với $3,53 mỗi tác vụ.
3. GPT-6 Astra (OpenAI)
GPT-6 Astra là mô hình frontier của OpenAI, phát hành 3/9/2026, và vẫn đứng đầu bảng agent Terminal-Bench 4.0 của tbench.ai ở 58,2% với bộ khung Codex ở mức tối đa, dù Opus 5.5 chưa có mục agent ở đó.
Trang mô hình liệt kê cửa sổ ngữ cảnh 1.050.000 token, 128.000 token đầu ra, mốc cắt kiến thức 30/4/2026, và các mức nỗ lực từ none đến max. Giá là $10 mỗi triệu token đầu vào, $1 cho đầu vào cache, và $50 mỗi triệu token đầu ra.
Tài liệu ra mắt của OpenAI dựa nhiều vào đánh giá nội bộ và thẻ hệ thống hơn là các benchmark liên phòng lab. Các đánh giá đó mạnh, nhưng tôi sẽ không gọi Astra là kẻ chiến thắng rõ rệt trước Opus 5.5 hay Fable 5.1. Chúng tôi tổng hợp các con số ra mắt trong tổng quan GPT-6 Astra.
Tính năng chính:
- Responses API cung cấp
hosted_shell,apply_patch,computer_usevàtool_search, chính là bộ công cụ mà Codex dùng. - Đầu vào cache ở $1 mỗi triệu token, bằng 1/10 giá cơ bản, quan trọng cho vòng lặp agent đọc lại cùng repository.
- Astra là mô hình OpenAI đầu tiên đạt tầng an ninh mạng cao nhất trong Preparedness Framework, nên một số prompt liên quan bảo mật bị kiểm soát.
Phù hợp nhất: các nhóm đang ở hệ Codex, GitHub Copilot, hoặc Microsoft, các tác vụ nặng khoa học và kỹ thuật, và ai cần hỗ trợ công cụ bên thứ ba tốt hơn. Nếu bạn muốn phần lớn năng lực với chi phí thấp hơn, GPT-6 Sol, phát hành ngày 22/9 với $2 đầu vào và $10 đầu ra mỗi triệu token, kế nhiệm GPT-5.6 Sol, và khi không có GPT-6 Terra, nó lấp vào mức giá cũ của Terra. Trên biểu đồ của OpenAI, nó đạt 68,8% trên DeepSWE 1.1 và 49,3% trên FrontierCode, dù GPT-5.6 Sol ở mức tối đa vẫn cao hơn trên DeepSWE.
Đánh đổi: mức giá ngang Fable, và Opus 5.5 nay sánh ngang Astra trên Terminal-Bench 4.0 với chi phí mỗi tác vụ khoảng 40% theo tính của Anthropic, còn Artificial Analysis chấm hai bên ngang nhau. Lợi thế rõ nhất của Astra là công việc nặng khoa học, ở 64,6% trên Terminal-Bench-Science và 65,5% trên FrontierSWE v2, đều cao hơn Opus 5.5.
4. Gemini 3.8 Flash (Google)
Gemini 3.8 Flash là mô hình “workhorse” của Google, phát hành 2/9/2026, và là một trong những cách rẻ nhất để có điểm agentic coding cấp frontier (GPT-6 Luna rẻ hơn theo token, nhưng điểm agentic thấp hơn). Báo cáo đánh giá của Google cho thấy 89,4% trên Terminal-Bench 2.1 và 73,7% trên DeepSWE v1.1, một bộ 113 tác vụ tầm nhìn dài nơi Fable 5.1 đạt 67,4%. Cùng bảng đó có Opus 5 nhỉnh hơn chút ở 74,0%, Anthropic báo 74,2% cho Opus 5.5, và hướng dẫn nhà phát triển của Google bổ sung 61,6% trên SWE-bench Pro.
Giá trên trang giá API Gemini là $0,75 mỗi triệu token đầu vào và $3,75 mỗi triệu token đầu ra đến hết 31/12/2026, sau đó là $1,50 và $7,50 từ 1/1/2027. Ngay cả mức 2027, đó vẫn chỉ hơn 1/3 giá đầu ra của Opus 5.5. Cửa sổ ngữ cảnh là 1M token đầu vào với 64K đầu ra.
Tính năng chính:
- Đa phương thức đầu vào tự nhiên, nên bạn có thể đưa sơ đồ kiến trúc hoặc ảnh chụp UI lỗi cạnh đoạn mã.
- Google định vị nó cho khối lượng tác vụ agentic lớn và định giá tương ứng.
- Có biến thể Cyber cho công việc lỗ hổng bảo mật, kiểm soát riêng; chúng tôi đề cập trong tổng quan Gemini 3.8 Flash và Flash Cyber.
Phù hợp nhất: vòng lặp agent khối lượng lớn, đội ngũ nhạy giá, và các tổ chức dùng Vertex AI. Gemini 3.1 Pro, phát hành 19/2/2026, vẫn là mô hình cấp Pro của Google với 54,2% SWE-bench Pro ở $2 đầu vào và $12 đầu ra mỗi triệu token, nhưng riêng cho lập trình, hôm nay tôi sẽ chọn 3.8 Flash thay cho 3.1 Pro.
Đánh đổi: 19,1% trên Terminal-Bench 4.0. Flash mạnh ở công việc terminal phạm vi rõ và yếu ở các tác vụ khoa học tiên phong, nên hãy giữ một mô hình mạnh hơn để “gọi cứu” cho ticket khó nhất.
Như vậy là xong nhóm đám mây. Phần còn lại là các mô hình bạn có thể tải về.
Những LLM lập trình open-weight tốt nhất năm 2026 là gì?
Các LLM lập trình open-weight năm 2026 chia thành 2 nhóm: quy mô trung tâm dữ liệu như DeepSeek V4.1 Flash và Kimi K3 với điểm số sát frontier nhưng cần phần cứng máy chủ nghiêm túc, và các mô hình dưới 120B như Qwen3.8-27B và Laguna S 2.1 có thể chạy trên phần cứng bạn sở hữu.
“Open weight” ở đây nghĩa là trọng số có thể tải về. Giấy phép thực tế từ MIT và Apache 2.0 đến các điều khoản tùy chỉnh.
5. DeepSeek V4.1 Flash (DeepSeek)
DeepSeek V4.1 Flash là bản phát hành 10/9/2026 của DeepSeek, và dù tên là Flash, nay nó là mô hình DeepSeek tôi sẽ chọn đầu tiên. DeepSeek nói nó vượt flagship V4 Pro 0813 của chính mình về hiệu năng, chi phí, tốc độ và thời gian hoàn tất tác vụ. Chỉ số độc lập của Vals AI cũng nghiêng theo hướng đó, xếp nó là open-weight đứng đầu ở 57,9%, so với 52,4% Vals ghi cho V4 Pro 0813 hồi tháng 8.
Đây là mô hình mixture-of-experts (MoE) 552B tham số với khoảng 8B tham số hoạt động mỗi token đầu vào và 16B ở đầu ra, ngữ cảnh 1M token, đầu vào ảnh tự nhiên, và trọng số theo giấy phép MIT. DeepSeek báo 90,6% trên Terminal-Bench 2.1 và 74,2% trên DeepSWE v1.1, điểm vendor open-weight cao nhất cho cả hai. Lượt chạy Terminal-Bench 2.1 của Vals AI thì “khắt khe” hơn ở 74,5%, xếp nhì trong các mô hình open-weight.
Chúng tôi phân tích sâu hơn trong tổng quan DeepSeek V4.1 Flash.
Tính năng chính:
- Giá API trên trang giá của DeepSeek là $0,15 mỗi triệu token đầu vào và $0,60 mỗi triệu token đầu ra ngoài giờ cao điểm, tăng gấp đôi lên $0,30 và $1,20 trong giờ cao điểm ngày thường (01:00–04:00 và 06:00–10:00 UTC). Cache hit giá $0,003 mỗi triệu ngoài giờ cao điểm.
- Phục vụ dưới tên
deepseek-flashtrên API tương thích OpenAI, nên scriptask_coding_model.pysau trong bài sẽ chạy chỉ với đổi base URL. - KV cache cỡ khoảng 1/4 so với V4 Flash, là cách DeepSeek định giá thấp cho công việc ngữ cảnh dài.
Phù hợp nhất: lập trình terminal cận-frontier với chi phí “xu lẻ”, và các job code theo lô có thể lên lịch ngoài giờ cao điểm.
Đánh đổi: nó đạt 31,2% trên Terminal-Bench 4.0 theo báo cáo của chính DeepSeek, nên công việc agent tầm nhìn dài khó nhất vẫn thuộc về các phòng lab frontier. Checkpoint cũng khoảng 510 GB, nên “open weight” ở đây là máy chủ đa GPU. Nếu bạn đang ở V4 Pro 0813, DeepSeek từng thông báo sẽ chuyển hướng mô hình đó sang V4.1 Flash ngày 14/9, rồi đảo ngược, và V4 Pro vẫn được phục vụ ở $0,66/$1,98 ngoài giờ cao điểm cho đến khi có thông báo mới.
6. Kimi K3 (Moonshot AI)
Kimi K3 là flagship open-weight 2,8 nghìn tỷ tham số của Moonshot AI, phát hành tháng 7/2026, và đạt 88,3% trên Terminal-Bench 2.1, xếp nhì trong các mô hình open sau DeepSeek V4.1 Flash với 90,6% do vendor báo.
Thẻ trên Hugging Face liệt kê 104B tham số hoạt động trên 896 expert (16 định tuyến + 2 chia sẻ mỗi token), ngữ cảnh 1.048.576 token, và trọng số MXFP4. Vals AI đo 93,4% trên SWE-bench Verified.
Tính năng chính:
- Ngữ cảnh 1M token với vision tự nhiên.
- Phát hành theo giấy phép Kimi K3, giấy phép tùy chỉnh chứ không phải MIT hay Apache, nên đọc kỹ trước khi dùng thương mại.
- Ngăn xếp suy luận khuyến nghị là vLLM, SGLang và TokenSpeed, và Moonshot hiệu chỉnh một số tác vụ đánh giá GPU cho H20.
Phù hợp nhất: bất kỳ ai muốn coder agentic open mạnh nhất có thể.
Đánh đổi: năng lực gần frontier chỉ có ở quy mô trung tâm dữ liệu. Khoảng cách 3 điểm với Fable 5.1 trên Terminal-Bench 2.1 trông gần, nhưng không so “táo với táo”: Moonshot đo 88,3% trong bộ khung Kimi Code của họ, còn 91,4% của Fable đến từ lượt Terminus 2 của Artificial Analysis. Thực tế, bạn hoặc thuê máy chủ lưu trữ hoặc chạy cụm riêng, cộng giấy phép tùy chỉnh cần pháp lý duyệt trước.
7. Qwen3.8-27B (Alibaba)
Qwen3.8-27B là mô hình dày đặc 27 tỷ tham số phát hành tháng 8/2026 theo Apache 2.0, và là LLM lập trình tốt nhất bạn có thể chạy trên một GPU 24 GB.
Thẻ mô hình báo 61,7% trên SWE-bench Pro, 73,0% trên Terminal-Bench 2.1, 90,3% trên LiveCodeBench v6, và 42,2% trên DeepSWE 1.1, với ngữ cảnh gốc 262.144 token có thể mở rộng lên 1M bằng YaRN. Các số SWE-bench Pro và Terminal-Bench này vượt Laguna S 2.1, mô hình lớn gấp 4 lần, và vượt Gemini 3.1 Pro trên SWE-bench Pro. Cần lưu ý Qwen chạy SWE-bench Pro trên bộ tác vụ đã hiệu chỉnh của riêng họ, nên so sánh chéo phòng lab chỉ mang tính định hướng.
Tính năng chính:
- Bản GGUF UD-Q4_K_M của Unsloth là một tệp 16,5 GB, chừa chỗ cho ngữ cảnh 32K trên card 24 GB. UD-Q4_K_XL là 17,6 GB.
- Kiến trúc dày đặc, nên chậm hơn mỗi token so với MoE 3B hoạt động nhưng nhất quán hơn khi chỉnh sửa đa tệp.
- Apache 2.0, không hạn chế sử dụng trong sản phẩm thương mại.
Phù hợp nhất: nhà phát triển không thể gửi mã ra API ngoài, người làm solo với một GPU dòng RTX, và bất kỳ ai muốn so sánh cục bộ so với Claude trên chính repository của họ trước khi trả tiền cho đám mây.
Đánh đổi: 73,0% so với 91,4% trên Terminal-Bench 2.1 vẫn là chênh 18 điểm, và thể hiện ở việc phải thử lại nhiều hơn trên tác vụ agentic dài.
8. Laguna S 2.1 (Poolside)
Laguna S 2.1 là mô hình lập trình MoE 118B tham số với 8B hoạt động của Poolside, phát hành 21/7/2026, và là lựa chọn open-weight cho Mac Studio, DGX Spark, hoặc workstation đa GPU.
Bài ra mắt của Poolside báo 59,4% trên tập công khai SWE-bench Pro, 70,2% trên Terminal-Bench 2.1 với thinking tối đa (60,4% khi tắt thinking), 78,5% trên SWE-bench Multilingual, và 40,4% trên DeepSWE.
Mô hình được huấn luyện trên 409.000 môi trường, gồm 83.000 tác vụ terminal và 168.000 quy trình kỹ nghệ phần mềm, trên 4.096 H200 trong chưa đầy 9 tuần.
Tính năng chính:
- Cửa sổ ngữ cảnh 1M token, hiếm ở kích thước này.
- Giấy phép OpenMDW-1.1, mang tính cho phép nhưng nên để đội pháp lý đọc.
- Thinking mode bật mặc định và giúp tăng khoảng 10 điểm trên Terminal-Bench 2.1; độ dài hoàn thành trung bình dao động khoảng 23K đến 249K token mỗi tác vụ trong lượt chạy của Poolside, nên cần dự trù chi phí.
Phù hợp nhất: các đội muốn một agent cục bộ kiểu Claude Code trên máy 96 đến 128 GB bộ nhớ hợp nhất, và repository đủ lớn để cần cửa sổ 1M cục bộ.
Đánh đổi: 118B tham số ở 4-bit là khoảng 60 đến 70 GB trọng số trước khi cấp phát KV cache, nên GPU 24 GB là không đủ. Về điểm thô, Qwen3.8-27B nhỉnh hơn, nhưng 8B hoạt động của Laguna giúp nó nhanh hơn nhiều khi trọng số đã vừa, cũng là ý nghĩa của một agent chạy qua đêm.
9. Qwen3-Coder-Next (Alibaba)
Qwen3-Coder-Next là mô hình MoE 80B tham số kích hoạt chỉ 3B tham số mỗi token, phát hành 3/2/2026 theo Apache 2.0, và là coder cục bộ nhanh nhất đủ năng lực cho phần cứng không giữ nổi mô hình dày đặc 27B ở tốc độ.
Thẻ mô hình báo 70,6% trên SWE-bench Verified, 44,3% trên SWE-bench Pro, và 36,2% trên Terminal-Bench 2.0, với 512 expert (10 hoạt động + 1 chia sẻ) và ngữ cảnh 262.144 token. Nó chỉ chạy ở chế độ không thinking.
Tính năng chính:
- GGUF Q4_K_M chính thức khoảng 48 GB, hợp với Mac 64 GB hoặc thiết lập CPU-offload hơn là một GPU tiêu dùng đơn.
- Attention lai (3 lớp Gated DeltaNet trên mỗi lớp attention chuẩn) giúp tiết kiệm bộ nhớ cho ngữ cảnh dài.
- Hỗ trợ trong vLLM, SGLang, Ollama, LM Studio, MLX-LM, llama.cpp và KTransformers, theo thẻ.
Phù hợp nhất: tác vụ tầm nhìn dài chạy qua đêm nơi token/giây quan trọng hơn độ chính xác đỉnh, và laptop 64 GB bộ nhớ hợp nhất.
Đánh đổi: 44,3% trên SWE-bench Pro kém 17 điểm so với Qwen3.8-27B, nên cho một lỗi khó duy nhất tôi sẽ chọn mô hình dày đặc.
Các mô hình open-weight khác đáng xem
Bốn mô hình nữa suýt lọt danh sách, và 2 trong số đó có thể phù hợp với một số đội hơn lựa chọn của tôi:
- DeepSeek V4 Pro 0813 (DeepSeek): tổng 1,6T, 49B hoạt động, ngữ cảnh 1M, giấy phép MIT, 96,4% trên SWE-bench Verified (Vals AI đã lưu trữ). Vẫn phục vụ ở $0,66 đầu vào và $1,98 đầu ra mỗi triệu token ngoài giờ cao điểm, nhưng Vals đo 54,7% trên Terminal-Bench 2.1 so với 87,9% do DeepSeek báo, và DeepSeek nay hướng người dùng sang V4.1 Flash. Bài giải thích DeepSeek V4 của chúng tôi nêu kiến trúc.
- Kimi K2.6 (Moonshot): tổng 1T, 32B hoạt động, ngữ cảnh 256K, giấy phép MIT sửa đổi, 80,2% SWE-bench Verified, 58,6% SWE-bench Pro, và 89,6% LiveCodeBench v6. Giấy phép “sạch” nhất trong nhóm nghìn tỷ tham số sau MIT thuần của DeepSeek V4 Pro.
- MiniMax M3: tổng 428B, 23B hoạt động, ngữ cảnh 1M, đầu vào ảnh và video tự nhiên, 80,5% SWE-bench Verified và 59% SWE-bench Pro. Lựa chọn open nếu tác vụ của bạn trộn mã với ảnh chụp màn hình.
- Qwen3.8-Flash-Next: tổng 125B với 6B hoạt động, 62,5% SWE-bench Pro và 58,7% DeepSWE, theo giấy phép qwen-community-1.0 hạn chế hơn. Mạnh hơn Qwen3.8-27B trên DeepSWE, nhưng giấy phép khiến nó không vào top 9 của tôi.
Nếu một trong các lựa chọn open-weight này phù hợp phần cứng của bạn, phần tiếp theo sẽ chỉ cách chạy.
Chạy mô hình lập trình open-weight cục bộ như thế nào?
Chạy mô hình lập trình open-weight cục bộ gồm 3 bước: tải checkpoint đã lượng tử hóa, phục vụ nó sau một endpoint tương thích OpenAI, và trỏ client hoặc trợ lý lập trình của bạn vào endpoint đó. Tôi sẽ dùng Qwen3.8-27B trong ví dụ này vì nó là mô hình dễ vừa phần cứng tiêu dùng nhất trong 9 mô hình.
Đầu tiên, tải xuống. Thư viện huggingface_hub hỗ trợ truyền tải tiếp tục và cache, hữu ích cho các tệp lớn:
"""Download a quantized coding model from Hugging Face.
Qwen3.8-27B at UD-Q4_K_M is a single 16.5 GB file, which leaves room for
a 32K context on a 24 GB GPU. Swap FILENAME for the UD-Q4_K_XL build if you
have the extra 1 GB to spare.
"""
from huggingface_hub import hf_hub_download
REPO_ID = "unsloth/Qwen3.8-27B-GGUF"
FILENAME = "Qwen3.8-27B-UD-Q4_K_M.gguf"
def fetch(repo_id: str = REPO_ID, filename: str = FILENAME) -> str:
"""Download one file from the Hub and return its local path."""
path = hf_hub_download(repo_id=repo_id, filename=filename)
print(f"Saved to {path}")
return path
if __name__ == "__main__":
fetch()
Lưu lại với tên download_gguf.py và chạy uv run --with huggingface_hub python download_gguf.py. Trên Windows bạn sẽ thấy cảnh báo về symlink trừ khi Bật Chế độ Nhà phát triển.
Thứ hai, phục vụ nó.
Bất kỳ trong số llama-server của llama.cpp, LM Studio, hoặc Ollama sẽ mở một endpoint /v1 tương thích OpenAI. Với llama.cpp, lệnh là một dòng, và 2 cờ làm việc chính: -ngl 99 offload mọi lớp lên GPU và -c 32768 đặt ngữ cảnh 32K.
llama-server -m Qwen3.8-27B-UD-Q4_K_M.gguf -c 32768 -ngl 99 --port 8080
Thứ ba, client. Tôi giữ một script cho mỗi mô hình tôi đánh giá, cục bộ hay hosted, và chuyển mục tiêu bằng 3 biến môi trường. Cùng một tệp nói chuyện với máy chủ cục bộ ở trên, với API của DeepSeek, hoặc của OpenAI:
"""Send one coding prompt to any OpenAI-compatible endpoint.
The same script talks to a local llama.cpp or vLLM server, to DeepSeek's
API, or to OpenAI itself. Only three environment variables change:
LLM_BASE_URL e.g. http://localhost:8080/v1 or https://api.deepseek.com
LLM_MODEL e.g. qwen3.8-27b or deepseek-flash
LLM_API_KEY anything non-empty for a local server
"""
import os
from openai import OpenAI
PROMPT = (
"Write a Python function top_n(df, col, n) that returns the n largest "
"rows of a pandas DataFrame by column col, with a docstring and a "
"ValueError if col is missing."
)
def ask(prompt: str = PROMPT) -> str:
"""Return the model's reply for a single-turn coding request."""
client = OpenAI(
base_url=os.environ["LLM_BASE_URL"],
api_key=os.environ.get("LLM_API_KEY", "local"),
)
response = client.chat.completions.create(
model=os.environ["LLM_MODEL"],
messages=[{"role": "user", "content": prompt}],
temperature=0.2, # keep code generation close to deterministic
)
return response.choices[0].message.content
if __name__ == "__main__":
print(ask())
Lưu thành ask_coding_model.py và chạy với LLM_BASE_URL=http://localhost:8080/v1 LLM_MODEL=qwen3.8-27b uv run --with openai python ask_coding_model.py.
Nếu bạn tiếp tục nối nhiều endpoint kiểu này vào một ứng dụng với định tuyến, retry và gọi công cụ, khóa học của chúng tôi về phát triển ứng dụng LLM với LangChain bao quát các tầng trừu tượng giúp tránh đống if.
Bạn nên chọn LLM lập trình tốt nhất như thế nào?
Chọn LLM lập trình tốt nhất phụ thuộc 4 ràng buộc: mã của bạn có thể rời máy hay không, bạn có bao nhiêu bộ nhớ, bạn sẽ trả bao nhiêu cho mỗi triệu token đầu ra, và một tác vụ cần bao nhiêu ngữ cảnh. Bảng dưới đặt 9 mô hình đã xếp hạng cạnh nhau theo các con số tôi tin tưởng nhất, và hướng dẫn quyết định sau đó ánh xạ các ràng buộc tới lựa chọn.
| Model | Type | Terminal-Bench 2.1 | SWE-bench Pro | Context | Price (per 1M output) or memory | Best for |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 | Cloud | 87,6% (Vals AI) | 89,9% | 1M | $20 | Mặc định cho hầu hết công việc lập trình |
| Claude Fable 5.1 | Cloud | 91,4% (Artificial Analysis) | 81,2% | 1M | $50 | Công việc agentic tầm nhìn dài nhất |
| GPT-6 Astra | Cloud | Không công bố (58,2% tbench.ai / 59,6% Artificial Analysis trên Terminal-Bench 4.0) | Không công bố | 1,05M | $50 | Người dùng Codex, tác vụ khoa học tiên phong |
| Gemini 3.8 Flash | Cloud | 89,4% | 61,6% | 1M | $3,75 đến hết 2026 | Agent khối lượng lớn, nhạy giá |
| DeepSeek V4.1 Flash | Open (MIT) | 90,6% (vendor); 74,5% (Vals AI) | Không công bố | 1M | $0,60 ngoài giờ cao điểm | Open-weight qua API rẻ mà mạnh |
| Kimi K3 | Open (custom) | 88,3% (bộ khung Kimi Code) | Không công bố | 1M | 2,8T tham số, chỉ cluster | Agent tự lưu trữ mạnh nhất |
| Qwen3.8-27B | Open (Apache 2.0) | 73,0% | 61,7% | 262K | 16,5 GB tại UD-Q4_K_M | GPU 24 GB đơn |
| Laguna S 2.1 | Open (OpenMDW-1.1) | 70,2% | 59,4% | 1M | 60 đến 70 GB ở Q4 | Workstation 128 GB, agent cục bộ |
| Qwen3-Coder-Next | Open (Apache 2.0) | 36,2% (2.0) | 44,3% | 262K | Khoảng 48 GB ở Q4 | Mô hình cục bộ nhanh, Mac 64 GB |
Hướng dẫn quyết định
Dưới đây là cách tôi ánh xạ 4 ràng buộc vào các xếp hạng:
- Pipeline lập trình agentic nơi độ đúng quan trọng hơn chi phí: Claude Opus 5.5 ở mức high hoặc xhigh, với Fable 5.1 dự phòng cho tác vụ tầm nhìn dài mà đánh giá cho thấy Opus 5.5 thiếu.
- Lập trình hằng ngày có trợ giúp AI với giá hợp lý: Claude Opus 5.5 ở mức medium mặc định trước, GPT-6 Sol thứ hai nếu bạn ở hệ Codex.
- Khoa học frontier, mô phỏng, hoặc công việc kernel GPU: GPT-6 Astra hoặc Claude Opus 5.5. Astra dẫn trên Terminal-Bench-Science, Opus 5.5 dẫn trên Terminal-Bench 4.0.
- Codebase khổng lồ, prompt 1M token, ngân sách chặt: Gemini 3.8 Flash vì giá, Opus 5.5 khi câu trả lời của Flash bắt đầu “lỏng”.
- Open-weight qua API: DeepSeek V4.1 Flash ngoài giờ cao điểm.
- Cục bộ và riêng tư trên GPU 24 GB đơn: Qwen3.8-27B ở UD-Q4_K_M.
- Cục bộ và riêng tư trên máy 96 đến 128 GB: Laguna S 2.1, hoặc Kimi K3 nếu “máy” nghĩa là “cluster”.
- Cục bộ và nhanh trên laptop 64 GB: Qwen3-Coder-Next.
Nếu bạn muốn khung tổng quát hơn để ghép mô hình với ứng dụng, gồm cả phương án lưu trữ và giấy phép, hướng dẫn của chúng tôi về cách chọn LLM tốt nhất cho ứng dụng của bạn đi rộng hơn lập trình.
Và dù bạn chọn mô hình nào, kỹ năng khai thác giá trị từ nó vẫn như nhau: lộ trình kỹ năng AI cho Kỹ sư Phần mềm và khóa học lập trình có trợ giúp AI cho nhà phát triển của chúng tôi dạy cách nhắc lệnh, kiểm thử và thói quen review biến 91% benchmark thành pull request được merge.
Kết luận
Claude Opus 5.5 là LLM lập trình tốt nhất tháng 9/2026 và, hiếm hoi, cũng là mô hình nên đưa vào hóa đơn nhóm của bạn. Claude Fable 5.1 là lộ trình nâng cấp cho tác vụ dài nhất, và Qwen3.8-27B là mô hình open-weight biến GPU 24 GB thành trợ lý lập trình riêng tư vượt frontier năm ngoái trên SWE-bench Pro. Mọi thứ còn lại là câu chuyện ràng buộc của bạn, và hướng dẫn quyết định ở trên là cách tôi sẽ giải.
Chuyển dịch lớn hơn là benchmark định nghĩa hạng mục này suốt 2 năm, SWE-bench Verified, đã ngừng còn quan trọng đúng lúc open-weight bắt kịp nó.
Đó không phải trùng hợp.
Khi Opus 5 và DeepSeek V4 Pro cách nhau 0,6 điểm trên một bài kiểm tra bão hòa, và một mô hình $20 mỗi triệu nay vượt chính mô hình $50 của Anthropic trên SWE-bench Pro, giá trị đã chuyển sang thiết kế bộ khung, ngân sách nỗ lực và đánh giá trên repository của chính bạn, chính xác là điều mà bảng của vendor không thể làm thay bạn.
Vậy hãy làm việc đó. Lấy script ask_coding_model.py, trỏ nó vào 2 hoặc 3 mô hình này, chạy trên 20 ticket thật từ backlog của bạn ở mức nỗ lực bạn thực sự sẽ trả, và để kết quả đó “bác bỏ” mọi điều tôi viết ở đây. Nếu “vibe coding” hợp gu bạn hơn bộ khung đánh giá, bài viết về vibe coding là gì và nó vấp ở đâu của chúng tôi nhìn thẳng vào đánh đổi, và bảng xếp hạng mô hình vẫn áp dụng.
FAQs
SWE-bench Verified là gì và tại sao nó quan trọng khi đánh giá LLM lập trình?
SWE-bench Verified là tập 500 tác vụ của SWE-bench trong đó người gán nhãn xác nhận mỗi issue GitHub có thể giải được và các bài kiểm thử là công bằng; mô hình phải tạo bản vá vượt qua các bài kiểm thử ẩn. Nó quan trọng vì là phép thử được tin cậy rộng rãi đầu tiên về sửa các repository thật thay vì viết hàm đồ chơi. Năm 2026, các mô hình top đạt trên 96% ở tập này, nên tôi dùng SWE-bench Pro và Terminal-Bench để phân loại chúng.
Các mô hình open-weight có thể cạnh tranh với Claude và GPT cho tác vụ lập trình thực tế năm 2026 không?
Có, trên các benchmark cũ và gần đạt trên các benchmark agentic. Kimi K3 đạt 88,3% và DeepSeek V4 Pro 0813 đạt 87,9% trên Terminal-Bench 2.1, so với 91,4% của Claude Fable 5.1, và Vals AI đo DeepSeek kém Opus 5 chỉ 0,6 điểm trên SWE-bench Verified. Vấn đề là kích thước: các mô hình open đó có 1,6 đến 2,8 nghìn tỷ tham số, nên “open” nghĩa là “rẻ qua API”, không phải “chạy trên laptop của tôi”.
LLM nào tốt nhất cho lập trình nếu tôi không thể chia sẻ mã với API bên ngoài?
Qwen3.8-27B là lựa chọn tốt nhất trên một GPU 24 GB, với 73,0% trên Terminal-Bench 2.1 và 61,7% trên SWE-bench Pro theo giấy phép Apache 2.0. Nếu bạn có 96 đến 128 GB bộ nhớ hợp nhất, Laguna S 2.1 cho bạn ngữ cảnh 1M token và 8B tham số hoạt động để có agent cục bộ nhanh. Với laptop 64 GB, 3B tham số hoạt động của Qwen3-Coder-Next khiến nó là lựa chọn nhanh nhất mà vẫn hữu ích.
Sự khác nhau giữa LLM lập trình và trợ lý lập trình AI như Cursor hay GitHub Copilot là gì?
LLM lập trình là mô hình tạo mã, còn trợ lý lập trình là bộ khung quanh nó đọc file của bạn, chạy lệnh, và hiển thị diff. Cursor, Copilot, Windsurf, Claude Code và Codex đều cho phép hoán đổi mô hình nền, và cùng một mô hình có thể chênh vài điểm giữa các bộ khung. Hãy chọn mô hình theo benchmark và giá, rồi chọn trợ lý theo quy trình làm việc.
Mô hình lập trình tốt nhất thay đổi thường xuyên thế nào, và tôi nên theo kịp ra sao?
Chỉ riêng Anthropic và OpenAI đã phát hành 7 mô hình hạng frontier từ 28/5 đến 24/9/2026 (Opus 4.8, Fable 5, Sonnet 5, GPT-5.6, Opus 5 và 5.5, và Fable 5.1 cộng GPT-6 Astra), nên kỳ vọng “quán quân” đổi mỗi 4–8 tuần. Theo kịp bằng cách theo dõi 3 bảng độc lập, Artificial Analysis, Vals AI và tbench.ai, thay vì các bài ra mắt, và chạy lại đánh giá 20 tác vụ của riêng bạn ở mức nỗ lực bạn trả mỗi khi mô hình bạn dùng có bản mới.
Tôi là một nhà khoa học dữ liệu có kinh nghiệm về phân tích không gian, học máy và đường ống dữ liệu. Tôi đã làm việc với GCP, Hadoop, Hive, Snowflake, Airflow và các quy trình khoa học/kỹ thuật dữ liệu khác.
