tracks
Google은 2026년 9월 2일, 6주 동안 세 번째 Flash 릴리스를 의미하는 Gemini 3.8 Flash를 출시했습니다. 8일 뒤, DeepSeek은 입력 시 8B, 출력 시 16B 파라미터를 활성화하는 MIT 라이선스의 552B 전문가 혼합(MoE) 모델 DeepSeek V4.1 Flash로 응답했습니다.
두 업체 모두 자사 모델을 코딩 에이전트용 일꾼(workhorse)이라고 부르며, 핵심 벤치마크에서 비슷한 점수를 냅니다. 즉, 흔한 오픈 대 클로즈드 구도로 보기엔 판단이 더 어렵습니다. 두 모델이 공유하는 벤치마크에서 더 저렴한 모델이 더 약하지도 않기 때문입니다.
이 글에서는 벤치마크, 가격, 개방성, 멀티모달리티, 그리고 제가 두 모델로 직접 수행한 빌드 테스트를 기준으로 DeepSeek V4.1 Flash와 Gemini 3.8 Flash를 비교합니다.
각 모델에 대한 더 자세한 내용은 DeepSeek V4.1 Flash 가이드와 Gemini 3.8 Flash 및 3.8 Flash Cyber 가이드를 참고하세요.
요약
- DeepSeek V4.1 Flash는 두 업체가 모두 공개한 에이전틱 코딩 벤치마크 전부에서 Gemini 3.8 Flash와 동률이거나 근소하게 앞서며, 실전 스케줄러 테스트에서는 절반의 턴으로 우승했습니다.
- Gemini 3.8 Flash는 현재 입력 토큰당 2.5배, 출력 토큰당 3.1배 더 비싸며, 2027년 1월 1일에 가격이 두 배로 인상됩니다.
- Gemini 3.8 Flash는 더 폭넓은 모델입니다. 오디오, 비디오, PDF 입력을 받고, Google이 호스팅하는 도구와 함께 제공됩니다.
- 대량 코딩 에이전트, 배치 작업, 캐시를 많이 쓰는 루프, 또는 자체 호스팅이 필요한 경우 DeepSeek V4.1 Flash를 선택하세요.
- 입력이 멀티모달이거나, Google AI Studio나 Antigravity에서 빌드하거나, 공개된 도메인 점수가 있는 지식 작업 에이전트가 필요한 경우 Gemini 3.8 Flash를 선택하세요.
DeepSeek V4.1 Flash란?
DeepSeek V4.1 Flash는 2026년 9월 10일 DeepSeek이 공개한 오픈 웨이트, MIT 라이선스의 전문가 혼합(MoE) 모델로, 새로운 아키텍처 계열 중 가장 작은 구성원입니다.
V4.1 기술 보고서에 따르면, KV 캐시는 토큰당 890바이트가 필요하며, 이는 DeepSeek V4 Flash의 약 4분의 1로, 대부분의 비용 절감이 여기에서 나옵니다.
전체 분석은 DeepSeek V4.1 Flash 가이드를, 이전 세대의 로컬 셋업은 Unsloth Studio와 OpenCode로 DeepSeek V4 Flash 실행하기 튜토리얼을 참고하세요.
Gemini 3.8 Flash란?
Gemini 3.8 Flash는 2026년 9월 2일 출시된 Google의 가장 강력한 Flash급 모델로, Gemini 3.7 Flash 이후 3주 만에 공개되었고 그 위에 구축되었습니다.
이 모델의 핵심 설계 선택은 더 "열심히 일한다"는 점입니다. 복잡한 작업에서 추가 추론 단계를 수행하고 도구 호출을 반복하며, Google은 더 높은 노력 수준에서 더 많은 토큰을 사용할 수 있다고 밝힙니다.
Gemini 3.8 Flash 가이드에서는 출시 내용과 제한 접근의 Cyber 변형을, Gemini 3.8 Flash API 튜토리얼에서는 Interactions API, 생각 레벨, Python에서의 함수 호출을 다룹니다.
DeepSeek V4.1 Flash vs Gemini 3.8 Flash: 정면 비교
아래 여섯 가지 차원에서, DeepSeek V4.1 Flash는 가격과 개방성에서 우승하고 코딩에서는 비긴 반면, Gemini 3.8 Flash는 입력 유형, 도구, 공개 지식 작업 결과에서 앞섭니다.

| 항목 | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|
| 출시일 | September 10, 2026 | September 2, 2026 |
| 가중치와 라이선스 | 오픈, MIT | 클로즈드, 호스팅 |
| 아키텍처 | 552B MoE, 프리필 시 8B 활성, 디코드 시 16B 활성 | 비공개; Gemini 3.7 Flash 기반 |
| 컨텍스트 / 최대 출력 | 1M 토큰 / 384K | 1M 토큰 / 64K |
| 입력 유형 | 텍스트, 이미지 | 텍스트, 이미지, 비디오, 오디오, PDF |
| Terminal-Bench 2.1 | 90.6% | 89.4% |
| DeepSWE v1.1 | 74.2% | 73.7% |
| 추론 노력 설정 | low, high, max on the API (integer 1-100 underneath) |
low, medium, high |
| API 가격, 입력 / 출력 (100만 토큰당) | $0.30 / $1.20 (피크) | $0.75 / $3.75 (2026년까지; 이후 2배) |
코딩과 에이전틱 워크플로
두 업체 표에 공통으로 등장하는 세 가지 에이전틱 벤치마크에서 DeepSeek V4.1 Flash가 모두 앞서며, 이 중 두 개는 사실상 무승부에 가까운 근소 차입니다.
진짜 중요한 차이는 더 어려운 일반 에이전트 모음인 Terminal-Bench 4.0입니다. DeepSeek 31.2% 대 Gemini 19.1%. 두 업체 모두 이 모음이 약점을 드러낸다고 인정합니다. DeepSeek은 과학 지향 에이전틱 작업에서 초거대 모델과의 격차가 남아 있다고 밝히고, Google의 표에서도 Claude Opus 5가 51.8%를 기록합니다.
| 벤치마크 | DeepSeek V4.1 Flash | Gemini 3.8 Flash | 비고 |
|---|---|---|---|
| Terminal-Bench 2.1 | 90.6% | 89.4% | 두 업체 자체 측정; 두 표 모두 Claude Opus 5는 89.1% |
| DeepSWE v1.1 | 74.2% | 73.7% | 두 업체 자체 측정; 두 표 모두 Claude Opus 5는 74.0% |
| Terminal-Bench 4.0 | 31.2% | 19.1% | 가장 어려운 공통 모음; 두 표에서 Opus 5는 51.8% |
주의할 점 두 가지:
- DeepSeek의 점수는 최대 노력 티어에서 측정되었으며, 기술 보고서에 따르면 이는 낮은 설정 대비 출력 토큰이 약 2.5배 듭니다. 다만 같은 보고서는 노력 60~80 구간이 토큰을 절반 이하로 쓰면서 정확도의 대부분을 회복한다고 하니, max는 어려운 작업에 아껴 쓰는 것이 좋습니다.
- 하네스는 다르지만 경쟁 열의 값이 거의 정확히 일치하므로, 이 표들은 공급업체가 다른 조합치고는 비교 가능성이 높은 편입니다.
터미널 중심 코딩 에이전트라면 두 모델을 동급으로 보고, 가격과 배포 방식으로 결정하세요. 가장 어려운 에이전트 작업에서는 DeepSeek의 공개된 우위가 유일한 차별점입니다.
가격: 실제로 지불하는 비용
가격만큼은 경쟁의 여지가 없습니다. 그래서 흥미로운 질문은 워크로드 형태에 따라 격차가 얼마나 달라지느냐입니다.

DeepSeek V4.1 Flash가 모든 항목에서 더 저렴하며, 워크로드가 출력 토큰이나 캐시된 프리픽스에 많이 의존할수록 격차가 더 벌어집니다. 배수는 균일하지 않습니다. 입력 2.5배, 출력 3.1배, 캐시 재읽기 12.5배입니다.
토큰 단가 나란히 보기
| 구분 | DeepSeek V4.1 Flash (피크) | Gemini 3.8 Flash (2026년 12월 31일까지) |
|---|---|---|
| 입력, 100만 토큰당 | $0.30 | $0.75 |
| 출력, 100만 토큰당 | $1.20 | $3.75 |
| 캐시된 입력 재읽기, 100만 토큰당 | $0.006 | $0.075, 추가로 시간당 100만 토큰당 $0.50의 저장 요금 |
| 할인 경로 | 오프피크: 평일 01:00-04:00, 06:00-10:00 UTC 외 시간대 전 요금 50% 할인 | Batch 또는 Flex: 50% 할인 ($0.375 / $1.875) |
| 추론 토큰 과금 기준 | 출력 | 출력 |
| 2027년 1월 1일부터 | 변경 미공개 | $1.50 / $7.50; 캐시 재읽기 $0.15 |
차이는 출력 프리미엄에 가깝습니다. Gemini의 출력 단가는 DeepSeek의 3.1배이고 입력은 2.5배이므로, 생성 중심·사고 중심 작업일수록 비용이 커집니다. 두 업체 모두 추론 토큰은 출력 요율로 과금합니다.
실제 워크로드 비용
| 워크로드 | DeepSeek V4.1 Flash | Gemini 3.8 Flash | 차이 |
|---|---|---|---|
| 균형형 어시스턴트: 입력 100만 / 출력 25만 | $0.60 | $1.69 | $1.09, Gemini 181% 더 비쌈 |
| 생성 중심: 입력 100만 / 출력 400만 | $5.10 | $15.75 | $10.65, Gemini 209% 더 비쌈 |
| 캐시 중심 루프: 10만 프리픽스 1회 기록, 캐시 재읽기 1,000회, 요청당 신규 입력 5천 / 출력 1천 | $3.33 | $15.13 | $11.80, Gemini 354% 더 비쌈 |
계산식은 (볼륨 ÷ 1M) × 단가를 입력과 출력에 각각 더한 값으로, DeepSeek 피크 요율과 Gemini 소개 요율을 사용했습니다. 캐시 중심 행은 각 업체의 캐시 재읽기 단가를 1,000회에 적용하고, Gemini 캐시를 1시간 보관한다고 가정해 저장 비용 $0.05를 더했습니다.
헤드라인은 캐시 중심 행입니다. DeepSeek의 100만 토큰당 $0.006 캐시 재읽기 요율 덕분에 10만 토큰 프리픽스는 재읽기 비용이 거의 들지 않지만, Gemini는 같은 1억 캐시 토큰에 $7.50을 청구합니다.
DeepSeek을 오프피크에 스케줄하면 모든 행이 절반이 되고, 1월이 되면 Gemini의 모든 행이 두 배가 됩니다. 즉, 균형형 어시스턴트는 $0.60 대 $3.38이 됩니다.
개방성, 아키텍처, 배포
DeepSeek V4.1 Flash만 다운로드할 수 있으며, 저렴한 이유는 그 아키텍처에 있습니다. 기술 보고서는 20층 인과적 인코더가 20층 디코더로 이어지는 구조, FP4 KV 캐시를 쓰는 Compressed Sparse Attention 2, 그리고 V4 Flash의 3,514바이트에서 890바이트로 줄어든 토큰당 KV 캐시를 설명합니다.
다만 이 MIT 라이선스 웨이트의 서빙은 아직 초기에 가깝습니다. vLLM과 SGLang 지원은 각각 나이트리/프리뷰 빌드에 있고, Transformers는 아직 미지원입니다.
데이터 레지던시, 온프레미스 추론, 파인튜닝이 필요하다면 여기서는 DeepSeek만 후보입니다. 인프라 없이 쓰고 싶다면, GA 호스팅 엔드포인트가 있는 Gemini가 더 간단한 경로입니다.
멀티모달리티, 컨텍스트, 내장 도구
Gemini 3.8 Flash는 텍스트, 이미지, 비디오, 오디오, PDF를 받는 반면, DeepSeek V4.1 Flash는 텍스트와 이미지만 받습니다. 둘 다 100만 토큰 컨텍스트 윈도우를 제공하지만, DeepSeek은 최대 384K 출력 토큰을 허용하고 Gemini는 64K까지로, 긴 코드 생성이나 전체 문서 재작성에 차이가 납니다.
Gemini의 모델 페이지에는 DeepSeek에 없는 호스팅 도구도 나열되어 있습니다. 코드 실행, Google 검색 및 지도 그라운딩, 파일 검색, URL 컨텍스트, 프리뷰 단계의 컴퓨터 사용 등입니다. DeepSeek의 API 측면에서는 JSON 출력, 도구 호출, Responses API, Anthropic 형식 엔드포인트, 프리픽스 및 중간 채우기(FIM) 완성을 제공합니다.
입력에 오디오나 비디오가 포함되거나, 별도 검색 구축 없이 그라운딩이 필요하다면 Gemini를, 긴 출력을 원하고 기존 OpenAI나 Anthropic 클라이언트 코드와의 드롭인 호환성이 필요하다면 DeepSeek을 선택하세요.
DeepSeek V4.1 Flash와 Gemini 3.8 Flash의 성능
서로 다른 두 업체의 벤치마크만으로는 한계가 있어, 동일한 프롬프트와 동일한 도구 표면으로 두 모델에 같은 빌드 과제를 수행시켰습니다.
테스트
두 모델에 커뮤니티 오케스트라 리허설 스케줄러용 상태 유지 단일 파일 웹앱을 만들라고 요청했습니다. 명시적으로 요구한 두 가지 기능은 구간 겹침 충돌 감지와 영속성입니다. 두 모델 모두 Terminal-Bench 2.1에서 90%에 가깝지만, Terminal-Bench 4.0에서 DeepSeek 31.2% 대 Gemini 19.1%는 더 어려운 에이전틱 작업에서 격차를 시사하며, 이 과제는 그 격차를 간결하게 살펴보는 방법입니다.
두 모델 모두 OpenCode 내부에서 동일하게 고정된 도구 표면으로 실행했습니다. 파일 읽기와 편집만 가능하고, 셸과 네트워크는 불가. 두 모델 모두 high 추론 노력으로, 각 1회 시도, 재시도 없음, 프롬프트는 신규 세션으로 바이트 단위 동일하게 전달했습니다.
유념할 비대칭이 하나 있습니다. high는 Gemini의 최고 노력 티어인 반면, DeepSeek에서는 1~100 스케일에서 75에 해당하며, 이 스케일의 최대치가 공개 벤치마크 점수에 사용된 것과 일치합니다.
프롬프트는 다음과 같습니다.
Build a single-file HTML page (inline CSS and JS, no build step, no external dependencies, no network) for a rehearsal scheduler used by a community orchestra.
It needs:
- a week view (Mon–Sun) showing rehearsal blocks by section: strings, brass, woodwind, percussion;
- a conflict indicator that flags when two sections are booked in the same room at overlapping times (not merely the same slot);
- an add-rehearsal form with section, room, day, start time, and end time;
- localStorage persistence, so rehearsals survive a page reload.
Ship it as one working file named `index.html`. Do not install packages. Do not open, screenshot, or headless-render the page (no Playwright, Puppeteer, or Chrome).
Do not ask me clarifying questions — make reasonable assumptions and note them briefly in a comment at the top of the file.
평가 기준은 실행 가능성(실패/통과)과 아래 세 가지 루브릭으로, 각 1~5점입니다.
- 요구 사항 충족: 요청한 기능을 모두 구현했나요?
- 충돌 로직: 겹치는 구간을 정확히 감지·표시하고, 인접 예약이나 다른 방의 예약은 비충돌로 처리하나요?
- 사용성과 레이아웃: 한 화면에 담기고 직관적으로 사용할 수 있으며 보기 좋은가요?
DeepSeek V4.1 Flash의 결과물
DeepSeek은 1회의 도구 호출로 2턴 만에 13KB의 index.html을 작성하고 종료했습니다. 페이지는 어두운 투패널 레이아웃으로, 왼쪽에 리허설 추가 폼, 오른쪽에 월요일~일요일 그리드, 아래에는 충돌 확인 패널이 있습니다. 헤더 주석은 겹침 규칙을 명시합니다. 맞닿은 예약은 예외로 하는 엄격한 겹침 기준이며, 프로브에서도 겹치는 쌍만 표시하는 것으로 확인됐습니다.

요청한 모든 것이 구현되어 잘 동작하고, 레이아웃은 한눈에 읽히며, 요청하지 않았지만 유용한 항목 삭제가 추가되었습니다. 항목 편집은 지원하지 않지만, 프롬프트에서도 요구하지 않았습니다. 세 루브릭 모두 5점이 충분합니다.
Gemini 3.8 Flash의 결과물
Gemini는 4턴과 3회의 도구 호출(글롭, 읽기, 쓰기)로 76KB의 index.html을 제출했으며(DeepSeek의 거의 6배), 훨씬 느렸습니다. 결과물은 더 다듬어진 느낌입니다. 브랜드 헤더와 실시간 겹침 카운터, 의도적으로 수요일 이중 예약을 넣은 샘플 주간(즉시 충돌 표시), 섹션/방 필터, 충돌만 보기 토글, 열/타임라인 뷰, 항목 편집·삭제, 레퍼토리 메모 필드, 입력 중인 예약에 대한 실시간 경고 프리뷰 등.

충돌 로직은 정확했고, 프로브에서도 겹치는 쌍만 플래그 됐습니다. 문제는 추가 기능입니다. 섹션별 세션 수를 보여주는 Sections and Balance 패널 때문에 폼 열이 스크롤되어야 했고(프롬프트에 어긋남), 전체적으로 컨트롤이 너무 많아 주간 보기가 DeepSeek보다 읽기 어려웠습니다. 이 때문에 요구 사항 충족과 레이아웃에서 각각 1점씩 감점하지만, 전반적 결과는 여전히 우수합니다.
결과
| 지표 | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|
| 턴 수 | 2 | 4 |
| 도구 호출 | 1 | 3 |
| 실행 가능성 | 통과 | 통과 |
| 요구 사항 충족 | 5 | 4 |
| 충돌 로직 | 5 | 5 |
| 사용성과 레이아웃 | 5 | 4 |
| 루브릭 점수(세 축 평균) | 5.0 | 4.3 |
이번 테스트의 승자는 DeepSeek V4.1 Flash입니다. 두 모델 모두 난이도 높은 구간 겹침 로직을 제대로 구현했으므로, 차이는 판단에서 갈렸습니다. DeepSeek은 한 번의 작성으로 요구한 것을 만들었고, Gemini는 작은 제품을 만들었지만 요청하지 않은 기능 하나가 평가 대상 레이아웃에 악영향을 줬습니다. 오케스트라 매니저에게 데모할 것이라면 Gemini 버전을, 동료에게 전달받고 싶다면 DeepSeek 버전을 고르겠습니다.
이는 한 노력 설정에서 하나의 과제를 한 번만 실행한 결과이므로, 토큰 사용량·비용에 대해 말해주지 않으며, 상태 유지 UI와 겹침 로직만 살펴봤을 뿐 장기 리포지토리 작업은 다루지 않습니다.
DeepSeek V4.1 Flash vs Gemini 3.8 Flash: 언제 무엇을 고를까
어느 모델도 모두의 기본값은 아닙니다. 워크로드별로 이렇게 고르세요.

갈림길은 입력, 인프라, 예산입니다. 에이전틱 코딩에서는 두 모델이 동급이므로, 비용이나 통제가 결정 요인일 때는 DeepSeek, 데이터나 스택이 DeepSeek이 처리하거나 호스팅할 수 없는 형태일 때는 Gemini가 답입니다.
다음에 해당하면 DeepSeek V4.1 Flash
- 대량 코딩 에이전트를 운영합니다. Terminal-Bench 2.1과 DeepSWE v1.1에서 Gemini와 동급, Terminal-Bench 4.0에서는 앞서며, 출력 100만 토큰당 $1.20으로 Gemini의 $3.75보다 저렴합니다.
- 에이전트 루프가 큰 프리픽스를 재읽습니다. 캐시 입력은 100만 토큰당 $0.006으로, Gemini의 $0.075+시간당 저장 요금 대비 12.5배 차이가 나며, 이는 캐시 중심 워크로드 행에서 지배적이었습니다.
- 자체 호스팅이나 파인튜닝이 필요하고, 이를 수행할 노드를 보유합니다. MIT 라이선스 웨이트는 vLLM과 SGLang에서 각각 나이트리/프리뷰 이미지로 실행되지만, 체크포인트가 약 511GB이고, 검증된 레이아웃은 GB200 NVL4 트레이 1개 또는 H200 8개 노드 1대입니다.
- 오프피크 스케줄링이 가능하거나 매우 긴 출력이 필요합니다. 오프피크에는 모든 요율이 절반이며, 384K 출력 상한은 Gemini의 64K 대비 6배입니다.
다음에 해당하면 Gemini 3.8 Flash
- 입력이 오디오, 비디오, PDF입니다. DeepSeek V4.1 Flash는 텍스트와 이미지만 받습니다.
- 도구를 직접 구축하지 않고 호스팅 도구를 원합니다. 코드 실행, Google 검색·지도 그라운딩, 파일 검색, URL 컨텍스트, 컴퓨터 사용(프리뷰)이 같은 모델 ID에서 제공됩니다.
- Google 스택에서 빌드합니다. AI Studio와 Gemini Enterprise에서 GA이며, Antigravity의 기본 모델입니다.
- 공개된 근거가 있는 지식 작업 에이전트가 필요합니다. Google은 Vals Finance Agent v2에서 61.4%, Harvey의 Legal Agent Benchmark에서 10.0%를 보고합니다. DeepSeek은 이에 상응하는 공개치를 내지 않았습니다.
DeepSeek V4.1 Flash와 Gemini 3.8 Flash 시작하기
두 모델이 할 수 있는 일보다, 접근 가능한 면이 더 다릅니다. 벤치마크보다 매트릭스를 먼저 확인하세요.
| 접점 | DeepSeek V4.1 Flash | Gemini 3.8 Flash |
|---|---|---|
| 소비자용 앱 | DeepSeek 앱 및 chat.deepseek.com | Gemini 앱(Google AI Pro 및 Ultra), 검색의 AI 모드, Gemini in Sheets |
| 자체 API | 예, DeepSeek API(OpenAI·Anthropic 요청 형식 지원) | 예, Google AI Studio를 통한 Gemini API(GA) |
| 클라우드 플랫폼 | 자체 클라우드 등록 없음; Databricks 등에서 서빙 또는 MIT 웨이트 자체 호스팅 | Google Cloud의 Gemini Enterprise |
| 코딩 에이전트 | DeepSeek Harness; OpenCode, WorkBuddy, CodeBuddy(공식 파트너) | Google Antigravity(기본 모델), Android Studio, Stitch; Cursor, OpenCode |
| 서드파티 라우터 | OpenRouter | OpenRouter |
| API 모델 ID | deepseek-flash |
gemini-3.8-flash |
가장 큰 가용성 차이는 DeepSeek은 다운로드가 가능하고 Gemini는 불가능하다는 점이며, 반대로 Gemini는 소비자 앱과 관리형 엔터프라이즈 플랫폼이 있다는 것입니다. 입력할 ID는 deepseek-flash, gemini-3.8-flash이며, 예전 deepseek-v4-flash 이름도 여전히 해석되지만 실제로는 V4.1 Flash가 서빙합니다.
첫 API 호출 만들기
두 SDK는 달라서 문자열 한 줄 교체로는 되지 않습니다. DeepSeek 엔드포인트는 OpenAI 호환이므로 표준 openai 클라이언트가 베이스 URL 변경만으로 동작합니다. 반면 Gemini 3.8 Flash는 샘플링 파라미터 대신 thinking_level 설정을 사용하는 google-genai Interactions API를 사용합니다.
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
response = client.chat.completions.create(
model="deepseek-flash", # DeepSeek V4.1 Flash
messages=[{"role": "user", "content": "Refactor this function..."}],
)
print(response.choices[0].message.content)
from google import genai
client = genai.Client() # reads your Google AI Studio API key
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Refactor this function...",
generation_config={"thinking_level": "medium"}, # low, medium, or high
)
print(interaction.output_text)
전체 설정, PDF 추출, Gemini의 함수 호출은 Gemini 3.8 Flash API 튜토리얼을 따르세요. DeepSeek의 생각 모드와 이전 세대의 로컬 배포는 DeepSeek V4 API 튜토리얼과 Unsloth Studio와 OpenCode로 DeepSeek V4 Flash 실행하기 가이드를 참고하세요.
마무리
워크로드가 코딩 에이전트, 배치 작업, 긴 프리픽스 재읽기라면 DeepSeek V4.1 Flash를 쓰세요. 공개 에이전틱 벤치마크에서 Gemini 3.8 Flash와 동급이고, 빌드 테스트에서 2턴 만에 승리했으며, 1월 가격 인상 전 기준으로 비용이 3분의 1입니다. 입력이 오디오, 비디오, PDF이거나, 하나의 호스팅 엔드포인트에서 그라운딩, 코드 실행, 컴퓨터 사용이 필요하다면 프리미엄을 감수하고 Gemini 3.8 Flash를 쓰세요.
이런 모델을 중심으로 에이전트 시스템을 구축하고 싶다면, Associate AI Engineer for Developers 트랙에서 API, 도구 사용, Model Context Protocol을 29시간에 걸쳐 다루고, Building AI Agents with Google ADK 코스는 Gemini 측을 1시간 만에 시작할 수 있습니다.
FAQs
코딩에는 DeepSeek V4.1 Flash가 Gemini 3.8 Flash보다 더 낫나요?
두 업체가 공개한 에이전틱 코딩 벤치마크에서 두 모델은 동률이거나 DeepSeek V4.1 Flash가 소폭 앞섭니다. Terminal-Bench 2.1에서 90.6% 대 89.4%, DeepSWE v1.1에서 74.2% 대 73.7%, Terminal-Bench 4.0에서 31.2% 대 19.1%입니다. 실전 스케줄러 빌드에서는 DeepSeek이 2턴에 5/5/5, Gemini가 4턴에 4/5/4를 기록했습니다. 두 벤치마크 세트 모두 업체 자체 측정입니다.
DeepSeek V4.1 Flash는 Gemini 3.8 Flash보다 얼마나 저렴한가요?
DeepSeek V4.1 Flash는 피크 기준 입력 100만 토큰당 $0.30, 출력 100만 토큰당 $1.20이며, 오프피크에는 절반입니다. Gemini 3.8 Flash는 2026년 12월 31일까지 $0.75와 $3.75, 2027년 1월 1일부터 $1.50과 $7.50입니다. 즉, 현재 기준으로 Gemini는 입력 2.5배, 출력 3.1배 더 비싸고, 내년엔 각각 5배와 6.25배가 됩니다.
DeepSeek V4.1 Flash와 Gemini 3.8 Flash 중 무엇을 자체 호스팅할 수 있나요?
자체 호스팅이 가능한 것은 DeepSeek V4.1 Flash뿐입니다. 웨이트는 MIT 라이선스로 Hugging Face에 공개되어 있으며, vLLM과 SGLang에서 각각 나이트리/프리뷰 Docker 이미지로 서빙할 수 있습니다. 다만 정식 릴리스에서는 아직 미지원이고, Transformers 지원은 오픈 PR 상태입니다. 전체 노드를 예상하세요. 체크포인트는 48개 샤드로 약 511GB이고, vLLM 레시피상 VRAM 최소는 614GB입니다.
DeepSeek V4.1 Flash와 Gemini 3.8 Flash의 API 모델 ID는 무엇인가요?
DeepSeek V4.1 Flash는 DeepSeek API에서 deepseek-flash이며, OpenAI 형식 요청은 https://api.deepseek.com, Anthropic 형식은 https://api.deepseek.com/anthropic 에서 받습니다. Gemini 3.8 Flash는 Gemini API에서 gemini-3.8-flash입니다. 둘 다 OpenRouter에도 등록되어 있습니다.
오디오, 비디오, PDF를 처리하는 모델은 DeepSeek V4.1 Flash와 Gemini 3.8 Flash 중 어느 쪽인가요?
Gemini 3.8 Flash는 텍스트, 이미지, 비디오, 오디오, PDF 입력을 받고, 코드 실행, Google 검색 그라운딩, 프리뷰 단계의 컴퓨터 사용 등 호스팅 도구를 제공합니다. DeepSeek V4.1 Flash는 텍스트와 이미지만 받지만, 최대 출력 384K 토큰을 허용하며, 두 모델 모두 100만 토큰 컨텍스트를 제공합니다.