Tracks
Google phát hành Gemini 3.8 Flash vào ngày 2 tháng 9, 2026, bản Flash thứ ba trong sáu tuần. Tám ngày sau, DeepSeek đáp lại với DeepSeek V4.1 Flash, một mô hình mixture-of-experts 552B theo giấy phép MIT, kích hoạt 8B tham số ở đầu vào và 16B ở đầu ra.
Cả hai nhà cung cấp đều gọi mô hình của mình là “ngựa thồ” cho agent lập trình và đạt điểm tương tự trên các tiêu chuẩn quan trọng nhất. Điều này khiến lựa chọn khó hơn so với khung mở so với đóng thông thường, vì mô hình rẻ hơn không hề yếu hơn trên các tiêu chuẩn mà cả hai cùng công bố.
Trong bài viết này, tôi sẽ so sánh DeepSeek V4.1 Flash và Gemini 3.8 Flash ở các khía cạnh: tiêu chuẩn, giá, độ mở, đa phương thức, và một bài kiểm thử xây dựng thực tế tôi chạy trên cả hai.
Để tìm hiểu sâu hơn từng mô hình, xem hướng dẫn DeepSeek V4.1 Flash và hướng dẫn Gemini 3.8 Flash và 3.8 Flash Cyber của chúng tôi.
Tóm tắt nhanh
- DeepSeek V4.1 Flash ngang bằng hoặc nhỉnh hơn Gemini 3.8 Flash trên mọi tiêu chuẩn mã hoá dạng agent mà cả hai công bố, và thắng bài kiểm thử lập lịch thực tế của chúng tôi với một nửa số lượt.
- Gemini 3.8 Flash hiện đắt hơn 2,5 lần mỗi token đầu vào và 3,1 lần mỗi token đầu ra, và giá sẽ tăng gấp đôi vào ngày 1 tháng 1, 2027.
- Gemini 3.8 Flash bao quát hơn: nhận đầu vào âm thanh, video, PDF và đi kèm bộ công cụ được Google lưu trữ.
- Chọn DeepSeek V4.1 Flash cho agent mã hoá khối lượng lớn, job theo lô, vòng lặp dùng cache nhiều, hoặc bất cứ thứ gì bạn cần tự lưu trữ.
- Chọn Gemini 3.8 Flash khi đầu vào của bạn là đa phương thức, khi bạn xây dựng trong Google AI Studio hoặc Antigravity, hoặc khi bạn cần agent cho công việc tri thức có điểm theo từng lĩnh vực đã công bố.
DeepSeek V4.1 Flash là gì?
DeepSeek V4.1 Flash là mô hình mixture-of-experts có trọng số mở, theo giấy phép MIT, do DeepSeek phát hành ngày 10 tháng 9, 2026, và là thành viên nhỏ nhất trong một họ kiến trúc mới.
Theo báo cáo kỹ thuật V4.1, bộ nhớ đệm KV của nó cần 890 byte mỗi token, khoảng một phần tư so với DeepSeek V4 Flash, là nguồn gốc của phần lớn tiết kiệm chi phí.
Để xem đầy đủ, đọc hướng dẫn DeepSeek V4.1 Flash, và để thiết lập cục bộ cho thế hệ trước, xem hướng dẫn chạy DeepSeek V4 Flash với Unsloth Studio và OpenCode của chúng tôi.
Gemini 3.8 Flash là gì?
Gemini 3.8 Flash là mô hình cấp Flash mạnh nhất của Google, phát hành ngày 2 tháng 9, 2026, ba tuần sau Gemini 3.7 Flash và xây dựng dựa trên nó.
Lựa chọn thiết kế nổi bật là “làm việc chăm chỉ hơn”: với tác vụ phức tạp, nó chạy thêm bước suy luận và gọi công cụ lặp lại; Google cho biết nó có thể tiêu tốn nhiều token hơn ở mức nỗ lực cao.
Hướng dẫn Gemini 3.8 Flash của chúng tôi bao quát lần ra mắt và biến thể Cyber truy cập hạn chế, còn hướng dẫn API Gemini 3.8 Flash trình bày Interactions API, các mức “thinking” và gọi hàm bằng Python.
DeepSeek V4.1 Flash vs Gemini 3.8 Flash: So sánh trực diện
Trên sáu tiêu chí bên dưới, DeepSeek V4.1 Flash thắng về giá và độ mở, hoà về mã hoá; trong khi Gemini 3.8 Flash thắng về loại đầu vào, công cụ, và kết quả công bố cho công việc tri thức.

| Tính năng | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|
| Ngày phát hành | 10 tháng 9, 2026 | 2 tháng 9, 2026 |
| Trọng số và giấy phép | Mở, MIT | Đóng, lưu trữ |
| Kiến trúc | 552B MoE, 8B hoạt động ở prefill, 16B ở decode | Không công bố; dựa trên Gemini 3.7 Flash |
| Ngữ cảnh / đầu ra tối đa | 1M token / 384K | 1M token / 64K |
| Loại đầu vào | Văn bản, hình ảnh | Văn bản, hình ảnh, video, âm thanh, PDF |
| Terminal-Bench 2.1 | 90,6% | 89,4% |
| DeepSWE v1.1 | 74,2% | 73,7% |
| Thiết lập mức nỗ lực suy luận | low, high, max trên API (số nguyên 1-100 bên dưới) |
low, medium, high |
| Giá API, đầu vào / đầu ra trên mỗi 1M | $0,30 / $1,20 (giờ cao điểm) | $0,75 / $3,75 (đến hết 2026; sau đó gấp 2) |
Lập trình và quy trình agent
DeepSeek V4.1 Flash dẫn đầu trên cả ba tiêu chuẩn agent xuất hiện trong bảng của cả hai nhà cung cấp, dù hai khoảng cách nhỏ đủ để coi là hoà.
Khoảng cách thực sự đáng chú ý là Terminal-Bench 4.0, bộ kiểm thử agent tổng quát khó hơn: 31,2% cho DeepSeek so với 19,1% cho Gemini. Cả hai thừa nhận bộ này phơi bày điểm yếu; DeepSeek nói còn khoảng cách với các mô hình khổng lồ ở tác vụ agent thiên về khoa học, và bảng của Google đặt Claude Opus 5 ở 51,8%.
| Tiêu chuẩn | DeepSeek V4.1 Flash | Gemini 3.8 Flash | Ghi chú |
|---|---|---|---|
| Terminal-Bench 2.1 | 90,6% | 89,4% | Đều do nhà cung cấp chạy; cả hai bảng đặt Claude Opus 5 ở 89,1% |
| DeepSWE v1.1 | 74,2% | 73,7% | Đều do nhà cung cấp chạy; cả hai bảng đặt Claude Opus 5 ở 74,0% |
| Terminal-Bench 4.0 | 31,2% | 19,1% | Bộ chung khó nhất; Opus 5 ở 51,8% trong cả hai bảng |
Hai lưu ý:
- Điểm của DeepSeek ở mức nỗ lực tối đa, mà báo cáo kỹ thuật nói tiêu tốn khoảng 2,5 lần token đầu ra so với mức thấp. Cùng báo cáo lưu ý mức 60 đến 80 thu hồi phần lớn độ chính xác đó với ít hơn một nửa số token, nên chỉ dùng mức tối đa cho tác vụ khó.
- Bộ khung khác nhau, nhưng các cột đối thủ khớp gần như chính xác, nên các bảng này gần tương đồng hơn phần lớn cặp liên-vendor khác.
Với agent lập trình nặng về terminal, coi hai bên là ngang nhau và để giá và triển khai quyết định; ở tác vụ agent khó nhất, lợi thế công bố của DeepSeek là điểm khác biệt duy nhất.
Giá: bạn thực sự trả bao nhiêu
Giá là khía cạnh không có tranh cãi, nên câu hỏi thú vị là khoảng cách thay đổi thế nào theo hình dáng tải công việc của bạn.

DeepSeek V4.1 Flash rẻ hơn ở mọi dòng, và khoảng cách nới rộng khi tải công việc của bạn nghiêng về token đầu ra hoặc tiền tố được cache. Hệ số không đồng đều: 2,5x ở đầu vào, 3,1x ở đầu ra và 12,5x ở lượt đọc từ cache.
Mức giá theo token đặt cạnh nhau
| Mức | DeepSeek V4.1 Flash (giờ cao điểm) | Gemini 3.8 Flash (đến 31/12/2026) |
|---|---|---|
| Đầu vào, mỗi 1M token | $0,30 | $0,75 |
| Đầu ra, mỗi 1M token | $1,20 | $3,75 |
| Đọc đầu vào từ cache, mỗi 1M token | $0,006 | $0,075, cộng $0,50 mỗi 1M token mỗi giờ lưu trữ |
| Tuyến giảm giá | Ngoài giờ cao điểm: giảm 50% mọi mức ngoài 01:00-04:00 và 06:00-10:00 UTC ngày thường | Batch hoặc Flex: giảm 50% ($0,375 / $1,875) |
| Token suy luận tính theo | Đầu ra | Đầu ra |
| Từ 1/1/2027 | Chưa công bố thay đổi | $1,50 / $7,50; đọc cache $0,15 |
Khác biệt có hình dáng “phụ phí đầu ra”. Mức đầu ra của Gemini cao gấp 3,1 lần DeepSeek trong khi đầu vào gấp 2,5 lần, nên công việc nặng sinh và nặng suy nghĩ trả nhiều nhất, và cả hai tính token suy luận theo mức đầu ra.
Một tải công việc thực tế tốn bao nhiêu
| Tải công việc | DeepSeek V4.1 Flash | Gemini 3.8 Flash | Chênh lệch |
|---|---|---|---|
| Trợ lý cân bằng: 1M vào / 250K ra | $0,60 | $1,69 | $1,09, Gemini đắt hơn 181% |
| Nặng sinh: 1M vào / 4M ra | $5,10 | $15,75 | $10,65, Gemini đắt hơn 209% |
| Vòng lặp nặng cache: tiền tố 100K ghi một lần, 1.000 lượt đọc cache, cộng 5K mới vào / 1K ra mỗi yêu cầu | $3,33 | $15,13 | $11,80, Gemini đắt hơn 354% |
Công thức là (khối lượng ÷ 1M) × mức, cộng đầu vào và đầu ra, theo mức cao điểm của DeepSeek và mức giới thiệu của Gemini. Hàng nặng cache dùng mức đọc cache của từng bên cho 1.000 lượt và giả định cache của Gemini giữ 1 giờ, thêm $0,05 lưu trữ.
Hàng nặng cache là tiêu đề, vì mức $0,006 đọc cache của DeepSeek khiến tiền tố 100K token gần như miễn phí khi đọc lại, trong khi Gemini tính $7,50 cho cùng 100M token đã cache.
Lên lịch DeepSeek ngoài giờ cao điểm và mọi hàng giảm một nửa; đợi đến tháng 1 và mọi hàng của Gemini tăng gấp đôi, vậy trợ lý cân bằng thành $3,38 so với $0,60.
Độ mở, kiến trúc và triển khai
DeepSeek V4.1 Flash là mẫu duy nhất trong hai mẫu bạn có thể tải về, và kiến trúc của nó là lý do giá rẻ. Báo cáo kỹ thuật mô tả bộ mã hoá nhân quả 20 lớp cấp cho bộ giải mã 20 lớp, Compressed Sparse Attention 2 với bộ nhớ đệm KV FP4, và cache KV 890 byte mỗi token, giảm từ 3.514 byte của V4 Flash.
Việc phục vụ các trọng số theo MIT vẫn còn sớm: vLLM và SGLang mới hỗ trợ ở bản nightly và preview, và Transformers chưa hỗ trợ.
Nếu bạn cần tuân thủ lưu trú dữ liệu, suy luận on-prem hoặc tinh chỉnh, DeepSeek là lựa chọn duy nhất ở đây. Nếu bạn muốn hạ tầng bằng 0, endpoint GA được Google lưu trữ của Gemini là con đường đơn giản hơn.
Đa phương thức, ngữ cảnh và công cụ tích hợp
Gemini 3.8 Flash nhận văn bản, hình ảnh, video, âm thanh, PDF, trong khi DeepSeek V4.1 Flash nhận văn bản và hình ảnh. Cả hai cung cấp cửa sổ ngữ cảnh 1M token, nhưng DeepSeek cho phép đến 384K token đầu ra, so với 64K của Gemini, điều này quan trọng cho sinh mã dài và viết lại toàn bộ tài liệu.
Trang mô hình của Gemini cũng liệt kê những công cụ lưu trữ mà DeepSeek không có tương đương: thực thi mã, nền tảng Google Search và Maps, tìm kiếm tệp, ngữ cảnh URL, và sử dụng máy tính ở bản xem trước. Phía API của DeepSeek cung cấp đầu ra JSON, gọi công cụ, Responses API, endpoint định dạng Anthropic, và hoàn thành kiểu tiền tố và “điền vào giữa”.
Nếu đầu vào của bạn gồm âm thanh hoặc video, hoặc bạn muốn grounding mà không phải dựng hệ thống truy hồi, hãy chọn Gemini; nếu bạn muốn đầu ra dài và tương thích thả-vào với client OpenAI hoặc Anthropic hiện có, hãy chọn DeepSeek.
Hiệu năng của DeepSeek V4.1 Flash và Gemini 3.8 Flash
Tiêu chuẩn do hai nhà cung cấp khác nhau chỉ nói được phần nào, nên tôi chạy một tác vụ xây dựng trên cả hai mô hình với prompt và bộ công cụ giống hệt nhau.
Bài kiểm thử
Tôi yêu cầu cả hai xây một ứng dụng web một tệp có trạng thái cho bộ lập lịch buổi tập của một dàn nhạc cộng đồng. Hai tính năng được yêu cầu rõ là phát hiện xung đột chồng khoảng thời gian và lưu bền. Cả hai đều gần 90% ở Terminal-Bench 2.1, nhưng 31,2% của DeepSeek so với 19,1% của Gemini ở Terminal-Bench 4.0 gợi ý một khoảng cách ở công việc agent khó hơn, và tác vụ này là cách gọn gàng để tìm dấu hiệu đó.
Cả hai chạy trong OpenCode với bề mặt công cụ ghim giống hệt: chỉ đọc và chỉnh sửa tệp, không shell và không mạng. Cả hai chạy ở mức nỗ lực suy luận high, mỗi bên một lần, không thử lại, và prompt được gửi nguyên vẹn byte-for-byte đến một phiên mới.
Một bất đối xứng cần nhớ: high là mức nỗ lực cao nhất của Gemini, còn trên DeepSeek, nó ánh xạ tới 75 trên thang 1-100, mà mức tối đa khớp với mức dùng cho điểm tiêu chuẩn đã công bố của nó.
Prompt như sau:
Build a single-file HTML page (inline CSS and JS, no build step, no external dependencies, no network) for a rehearsal scheduler used by a community orchestra.
It needs:
- a week view (Mon–Sun) showing rehearsal blocks by section: strings, brass, woodwind, percussion;
- a conflict indicator that flags when two sections are booked in the same room at overlapping times (not merely the same slot);
- an add-rehearsal form with section, room, day, start time, and end time;
- localStorage persistence, so rehearsals survive a page reload.
Ship it as one working file named `index.html`. Do not install packages. Do not open, screenshot, or headless-render the page (no Playwright, Puppeteer, or Chrome).
Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.
Tôi chấm cả hai theo khả năng chạy (trượt/đạt) và theo ba tiêu chí dưới đây, mỗi tiêu chí từ 1 đến 5:
- Tuân thủ đặc tả: Có triển khai đủ các tính năng tôi yêu cầu không?
- Logic xung đột: Có phát hiện và hiển thị chồng lấn chính xác, đồng thời coi các đặt chỗ liền kề hoặc ở phòng khác là không xung đột không?
- Khả dụng và bố cục: Có gói gọn trong một trang, dùng trực quan và trông ổn không?
DeepSeek V4.1 Flash tạo ra gì
DeepSeek hoàn tất trong 2 lượt với một lần gọi công cụ: viết một index.html 13 KB và báo hoàn thành. Trang là bố cục hai cột tối, biểu mẫu thêm buổi tập bên trái, lưới thứ Hai đến Chủ nhật bên phải, với bảng kiểm xung đột bên dưới. Phần chú thích đầu chỉ rõ quy tắc chồng lấn, chồng lấn nghiêm ngặt với đặt chỗ sát nhau được miễn, và kiểm tra đã xác nhận nó chỉ gắn cặp chồng lấn.

Mọi thứ được yêu cầu đều có và hoạt động, bố cục dễ nhìn lướt qua, và một tính năng thêm ngoài mong đợi là xoá mục rất hữu ích. Nó không cho phép chỉnh sửa mục, điều mà prompt cũng không yêu cầu. Đây là điểm 5 sạch cho cả ba tiêu chí.
Gemini 3.8 Flash tạo ra gì
Gemini mất 4 lượt và 3 lần gọi công cụ (glob, đọc rồi ghi) để giao một index.html 76 KB (gần gấp 6 lần tệp của DeepSeek), và chậm hơn nhiều. Kết quả trông trau chuốt hơn: tiêu đề có thương hiệu với bộ đếm cờ chồng lấn trực tiếp, tuần mẫu nạp sẵn với một đặt chỗ trùng vào thứ Tư để chỉ báo xung đột hiện ngay, bộ lọc theo phần và phòng, công tắc chỉ-hiện-xung-đột, chế độ cột và dòng thời gian, chỉnh sửa và xoá mục, trường ghi chú tiết mục, và cảnh báo trực tiếp khi bạn nhập đặt chỗ mới.

Logic xung đột là chính xác, và kiểm tra chỉ gắn cặp chồng lấn. Vấn đề nằm ở các phần thêm: bảng Sections and Balance với số buổi theo từng phần buộc cột biểu mẫu phải cuộn (trái với prompt) và đặt lạc lõng bên dưới, và số lượng điều khiển nhiều khiến tuần khó đọc hơn so với DeepSeek. Vì thế tôi trừ mỗi tiêu chí tuân thủ đặc tả và bố cục một điểm, dù tổng thể rất tốt.
Kết quả
| Chỉ số | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|
| Lượt | 2 | 4 |
| Lần gọi công cụ | 1 | 3 |
| Khả năng chạy | đạt | đạt |
| Tuân thủ đặc tả | 5 | 4 |
| Logic xung đột | 5 | 5 |
| Khả dụng và bố cục | 5 | 4 |
| Điểm tiêu chí (trung bình 3 trục) | 5,0 | 4,3 |
DeepSeek V4.1 Flash thắng bài kiểm thử này. Cả hai đều làm đúng phần khó là logic chồng khoảng, nên khác biệt nằm ở phán đoán: DeepSeek xây đúng yêu cầu trong một lần ghi, còn Gemini xây một “sản phẩm nhỏ”, và một tính năng không yêu cầu đã làm hỏng bố cục bị chấm điểm. Phiên bản của Gemini là thứ tôi sẽ demo cho quản lý dàn nhạc; phiên bản của DeepSeek là thứ tôi muốn được đồng nghiệp bàn giao.
Đây là một lần chạy duy nhất cho một tác vụ ở một mức nỗ lực, nên không nói gì về lượng token hay chi phí, và chỉ thăm dò UI có trạng thái cộng logic chồng lấn, không phải công việc trên kho mã dài hạn.
Khi nào chọn DeepSeek V4.1 Flash vs Gemini 3.8 Flash
Không mô hình nào là mặc định cho tất cả, nên đây là cách quyết theo tải công việc.

Ngã rẽ là đầu vào, hạ tầng và ngân sách: hai bên ngang nhau ở mã hoá dạng agent, nên DeepSeek thắng khi chi phí hoặc kiểm soát quyết định, và Gemini thắng khi dữ liệu hoặc ngăn xếp của bạn là thứ DeepSeek không thể nhận hoặc lưu trữ giúp.
Chọn DeepSeek V4.1 Flash nếu...
- Bạn chạy agent mã hoá ở quy mô. Nó ngang Gemini ở Terminal-Bench 2.1 và DeepSWE v1.1, dẫn trước ở Terminal-Bench 4.0, và tính $1,20 thay vì $3,75 mỗi 1M token đầu ra.
- Vòng lặp agent của bạn đọc lại tiền tố lớn. Đầu vào từ cache giá $0,006 mỗi 1M token so với $0,075 của Gemini cộng lưu trữ theo giờ, khoảng cách 12,5x chi phối hàng nặng cache của chúng tôi.
- Bạn cần tự lưu trữ hoặc tinh chỉnh, và có node để chạy. Trọng số theo MIT chạy trên vLLM và SGLang từ ảnh nightly và preview của họ, nhưng checkpoint ~511 GB, và sơ đồ xác thực là một khay GB200 NVL4 hoặc một node 8×H200.
- Bạn có thể lên lịch ngoài giờ cao điểm hoặc cần đầu ra rất dài. Ngoài giờ cao điểm giảm nửa mọi mức, và trần đầu ra 384K gấp 6 lần 64K của Gemini.
Chọn Gemini 3.8 Flash nếu...
- Đầu vào của bạn là âm thanh, video hoặc PDF. DeepSeek V4.1 Flash chỉ nhận văn bản và hình ảnh.
- Bạn muốn công cụ lưu trữ sẵn, không phải tự dựng. Thực thi mã, nền tảng Google Search và Maps, tìm kiếm tệp, ngữ cảnh URL và sử dụng máy tính đều có trên cùng model ID.
- Bạn xây trong ngăn xếp của Google. GA trên AI Studio và Gemini Enterprise, và nay là mô hình mặc định trong Antigravity.
- Bạn cần agent công việc tri thức có bằng chứng công bố. Google báo 61,4% trên Vals Finance Agent v2 và 10,0% trên Harvey's Legal Agent Benchmark; DeepSeek không công bố tương đương.
Bắt đầu với DeepSeek V4.1 Flash và Gemini 3.8 Flash
Nơi bạn có thể truy cập từng mô hình khác nhau nhiều hơn khả năng của chúng, nên hãy xem ma trận trước các tiêu chuẩn.
| Bề mặt | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|
| Ứng dụng người dùng | Ứng dụng DeepSeek và chat.deepseek.com | Ứng dụng Gemini (Google AI Pro và Ultra), Chế độ AI trong Tìm kiếm, Gemini trong Sheets |
| API chính chủ | Có, DeepSeek API (định dạng yêu cầu OpenAI và Anthropic) | Có, Gemini API qua Google AI Studio (GA) |
| Nền tảng đám mây | Không có niêm yết đám mây chính chủ; được phục vụ bởi Databricks và bên khác, hoặc tự lưu trữ trọng số MIT | Gemini Enterprise trên Google Cloud |
| Agent lập trình | DeepSeek Harness; OpenCode, WorkBuddy và CodeBuddy (đối tác chính thức) | Google Antigravity (mặc định), Android Studio, Stitch; Cursor, OpenCode |
| Bộ định tuyến bên thứ ba | OpenRouter | OpenRouter |
| ID mô hình API | deepseek-flash |
gemini-3.8-flash |
Khác biệt lớn nhất về khả dụng là DeepSeek có thể tải về còn Gemini thì không, trong khi Gemini lại có ứng dụng người dùng và nền tảng doanh nghiệp quản lý. ID bạn gõ là deepseek-flash và gemini-3.8-flash; tên cũ deepseek-v4-flash vẫn hoạt động nhưng được phục vụ bởi V4.1 Flash.
Thực hiện cuộc gọi API đầu tiên
Hai SDK khác nhau nên không chỉ thay một chuỗi là xong. Endpoint của DeepSeek tương thích OpenAI, nghĩa là client chuẩn openai hoạt động với thay đổi base URL, còn Gemini 3.8 Flash dùng Interactions API của google-genai với thinking_level thay cho tham số lấy mẫu.
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-flash", # DeepSeek V4.1 Flash
messages=[{"role": "user", "content": "Refactor this function..."}],
)
print(response.choices[0].message.content)
from google import genai
client = genai.Client() # reads your Google AI Studio API key
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Refactor this function...",
generation_config={"thinking_level": "medium"}, # low, medium, or high
)
print(interaction.output_text)
Để thiết lập đầy đủ, trích xuất PDF và gọi hàm trên Gemini, hãy theo hướng dẫn API Gemini 3.8 Flash; cho chế độ suy nghĩ của DeepSeek và triển khai cục bộ thế hệ trước, xem hướng dẫn DeepSeek V4 API và hướng dẫn chạy DeepSeek V4 Flash với Unsloth Studio và OpenCode.
Kết luận
Nếu tải công việc của bạn là agent mã hoá, job theo lô, hoặc bất cứ thứ gì đọc lại tiền tố dài, hãy dùng DeepSeek V4.1 Flash: nó ngang Gemini 3.8 Flash trên các tiêu chuẩn agent công bố, thắng bài kiểm thử xây dựng của chúng tôi trong 2 lượt, và có giá bằng một phần ba trước khi Gemini tăng giá tháng 1. Nếu đầu vào của bạn là âm thanh, video hoặc PDF, hoặc bạn muốn grounding, thực thi mã và sử dụng máy tính từ một endpoint lưu trữ, hãy dùng Gemini 3.8 Flash và chấp nhận mức giá cao hơn.
Nếu bạn muốn xây hệ thống agent quanh các mô hình như thế này, lộ trình Associate AI Engineer for Developers của chúng tôi bao quát API, dùng công cụ và Model Context Protocol trong 29 giờ, và khoá Building AI Agents with Google ADK là khởi đầu 1 giờ ở phía Gemini.
FAQs
DeepSeek V4.1 Flash có tốt hơn Gemini 3.8 Flash cho lập trình không?
Trên các tiêu chuẩn mã hoá dạng agent mà cả hai công bố, hai bên ngang nhau hoặc DeepSeek V4.1 Flash nhỉnh hơn đôi chút: 90,6% so với 89,4% trên Terminal-Bench 2.1, 74,2% so với 73,7% trên DeepSWE v1.1, và 31,2% so với 19,1% trên Terminal-Bench 4.0. Trong bài xây dựng bộ lập lịch thực tế, DeepSeek đạt 5/5/5 trong 2 lượt và Gemini 4/5/4 trong 4 lượt. Cả hai bộ điểm tiêu chuẩn đều do nhà cung cấp tự chạy.
DeepSeek V4.1 Flash rẻ hơn Gemini 3.8 Flash bao nhiêu?
DeepSeek V4.1 Flash có giá $0,30 mỗi 1M token đầu vào và $1,20 mỗi 1M token đầu ra ở giờ cao điểm, và một nửa ngoài giờ cao điểm. Gemini 3.8 Flash có giá $0,75 và $3,75 đến ngày 31/12/2026, tăng lên $1,50 và $7,50 từ 1/1/2027. Điều đó khiến Gemini đắt hơn 2,5x ở đầu vào và 3,1x ở đầu ra hiện nay, và 5x và 6,25x vào năm sau.
Tôi có thể tự lưu trữ DeepSeek V4.1 Flash hoặc Gemini 3.8 Flash không?
Bạn chỉ có thể tự lưu trữ DeepSeek V4.1 Flash. Trọng số của nó được công bố trên Hugging Face theo giấy phép MIT, và vLLM cùng SGLang có thể phục vụ ngay hôm nay từ các ảnh Docker nightly và preview tương ứng, dù chưa hỗ trợ trong bản phát hành chính thức, và hỗ trợ Transformers vẫn là PR mở. Hãy dự trù một node đầy đủ: checkpoint khoảng 511 GB qua 48 shard, và công thức của vLLM đặt mức VRAM tối thiểu là 614 GB.
ID mô hình API của DeepSeek V4.1 Flash và Gemini 3.8 Flash là gì?
DeepSeek V4.1 Flash là deepseek-flash trên DeepSeek API, nơi chấp nhận yêu cầu định dạng OpenAI tại https://api.deepseek.com và định dạng Anthropic tại https://api.deepseek.com/anthropic. Gemini 3.8 Flash là gemini-3.8-flash trên Gemini API. Cả hai cũng có trên OpenRouter.
Mô hình nào xử lý âm thanh, video và PDF: DeepSeek V4.1 Flash hay Gemini 3.8 Flash?
Gemini 3.8 Flash nhận đầu vào văn bản, hình ảnh, video, âm thanh và PDF, và bổ sung công cụ lưu trữ như thực thi mã, grounding Google Search và sử dụng máy tính ở bản xem trước. DeepSeek V4.1 Flash chỉ nhận văn bản và hình ảnh, nhưng cho phép tối đa 384K token đầu ra so với 64K của Gemini, và cả hai đều có cửa sổ ngữ cảnh 1M token.
Tom là một nhà khoa học dữ liệu và giảng viên kỹ thuật. Anh viết và quản lý các bài hướng dẫn và bài blog về khoa học dữ liệu của DataCamp. Trước đây, Tom làm việc trong lĩnh vực khoa học dữ liệu tại Deutsche Telekom.
