모든 모델

DeepSeek V4 Flash on VM0. 가장 저렴한 가격 티어의 에이전트급 코딩

토큰당 13B를 활성화하는 DeepSeek의 오픈 웨이트 284B Mixture-of-Experts 모델. 0731 빌드는 DeepSeek이 공개한 모든 에이전트 벤치마크에서 V4 Pro를 앞서며, 가격은 100만 토큰당 $0.14 / $0.28입니다.

1M tokens · Text / Code · Prompt cache

DeepSeek V4 Flash는 DeepSeek V4 세대의 효율 담당입니다. 총 284B 파라미터의 Mixture-of-Experts 모델로 토큰당 13B를 활성화하며, MIT 라이선스의 오픈 웨이트로 공개되었습니다. 2026년 7월 31일에 출시된 0731 빌드는 아키텍처를 그대로 두고 에이전트 데이터로 사후 학습만 다시 수행한 결과, DeepSeek이 공개한 아홉 개 에이전트 벤치마크 전부에서 DeepSeek V4 Pro(프리뷰)를 앞섰습니다 — Terminal-Bench 2.1에서 82.7 대 72.1, DeepSWE에서 54.4 대 12.8.

벤더 정가는 100만 토큰당 $0.14 / $0.28이며 캐시 히트는 100만 토큰당 $0.0028, 캐시 쓰기는 과금되지 않습니다. VM0의 현재 라인업에서 가장 저렴한 추론 모델입니다. 100만 토큰 컨텍스트 윈도우와 최대 384K 출력을 지원하고 사고 모드가 기본으로 켜져 있습니다. 텍스트 전용이며 비전은 없습니다. 이미지나 Claude Code 프레임워크가 필요한 단계에는 Claude Sonnet 4.6을, OpenAI 계열의 저가 티어를 원한다면 GPT 5.6 Luna를 선택하세요.

DeepSeek V4 Flash란?

2026년 7월 31일 (DeepSeek-V4-Flash-0731, 퍼블릭 베타) · DeepSeek V4 제품군의 효율 담당: V4 Pro의 49B 대비 활성 파라미터 13B, 에이전트 작업에 맞춰 사후 학습.

DeepSeek V4 Flash는 2026년 4월 24일 V4 제품군의 작은 쪽으로 처음 등장했습니다 — 1.6T 파라미터의 V4 Pro 옆에 놓인, 토큰당 13B를 활성화하는 284B MoE이며 100만 토큰 컨텍스트 윈도우를 갖췄습니다. 2026년 7월 31일 DeepSeek-V4-Flash-0731로 프리뷰를 졸업했는데, 아키텍처는 손대지 않고 사후 학습만 에이전트 성향의 데이터로 다시 돌린 퍼블릭 베타 빌드입니다.

이번 릴리스의 핵심은 그 재학습입니다. DeepSeek 자체 수치로 0731 빌드는 파라미터의 약 4분의 1만 활성화하면서도 공개된 아홉 개 에이전트 벤치마크 전부에서 V4 Pro(프리뷰)를 앞섭니다: Terminal-Bench 2.1은 Flash 프리뷰의 61.8에서 82.7로, DeepSWE는 7.3에서 54.4로, Toolathlon-Verified는 49.7에서 70.3으로 올랐습니다. 그중 몇 개는 Claude Opus 4.8과 몇 점 차이에 불과합니다 — Terminal-Bench 2.1에서 82.7 대 85.0, Agents' Last Exam에서 25.2 대 25.7 — 가격은 극히 일부인데도 말이죠.

유의점도 분명히 짚어둘 만합니다. 모든 점수는 DeepSeek이 직접 보고한 값이며 아직 공개되지 않은 DeepSeek Harness로 측정되었기에 독립적으로 재현된 것은 하나도 없고, 아홉 개 중 둘은 DeepSeek의 내부 세트입니다. 모델은 텍스트 전용이고, 대학원 수준 추론에서는 프런티어에 못 미치며, 장시간 다단계 작업에서는 여전히 V4 Pro에 뒤집니다. 사고 모드는 기본으로 켜져 있고 사고 토큰은 출력으로 과금됩니다.

DeepSeek V4 Flash의 주목할 점

대표적인 아키텍처 및 기능 특징.

V4 Flash는 희소 Mixture-of-Experts 모델입니다: 총 284B 파라미터 중 토큰당 13B를 활성화하며, 각 MoE 레이어는 공유 전문가 1개와 중간 차원 2048의 라우팅 전문가 256개를 두고 토큰마다 6개의 라우팅 전문가가 작동합니다. 앞의 세 MoE 레이어는 해시 라우팅을 사용하고 멀티 토큰 예측 깊이는 1입니다. 공개된 0731 체크포인트가 304B 파라미터인 이유는 284B 베이스 위에 추측 디코딩용 드래프트 모듈이 올라가 있기 때문입니다. 100만 토큰 컨텍스트 윈도우와 최대 384K 출력, 사고/비사고 모드, low·high·max 세 단계의 reasoning_effort 파라미터를 지원합니다. 가중치는 MIT 라이선스로 제한 없이 공개되어 있습니다.

한눈에 보는 사양

제품군DeepSeek V4 시리즈 (Flash)
파라미터총 284B / 활성 13B (MoE)
모달리티텍스트, 코드 (비전 없음)
라이선스MIT, 오픈 웨이트
프롬프트 캐싱지원 (DeepSeek)
컨텍스트 윈도우100만 토큰
최대 출력최대 384K 토큰
추론 강도Low / High / Max
벤더 정가입력 $0.14 / 출력 $0.28 (100만 토큰당)

DeepSeek V4 Flash 벤치마크

DeepSeek-V4-Flash-0731 모델 카드에 실린 DeepSeek 보고 수치로, DeepSeek Harness의 minimal 모드에서 추론 강도 max(temperature 1.0, top_p 0.95)로 측정했습니다. 하네스가 아직 공개되지 않아 어느 것도 독립적으로 재현되지 않았으며, DSBench-FullStack과 DSBench-Hard는 DeepSeek의 내부 테스트 세트입니다.

Terminal-Bench 2.1에이전트형 터미널 작업; V4 Pro(프리뷰) 72.1
82.7
SWE-bench Verified프리뷰 빌드, 벤더 보고
79.0%
Cybergym벤더 보고
76.7
Toolathlon (verified)도구 사용; V4 Pro(프리뷰) 55.9
70.3
DSBench-FullStackDeepSeek 내부 세트
68.7
DSBench-HardDeepSeek 내부 세트
59.6
DeepSWE프리뷰 빌드의 7.3에서 상승
54.4
NL2Repo저장소 구축
54.2
Agents' Last ExamClaude Opus 4.8은 25.7
25.2

DeepSeek V4 Flash 가격

공급사 정가, 100만 토큰당.

입력$0.14
출력$0.28
캐시 읽기$0.003
캐시 쓰기과금되지 않음

DeepSeek V4 Flash는 실제로 어떻게 작동하는가

프로덕션 에이전트 실행에서 관찰된 동작.

에이전트 실행

0731 사후 학습이 겨냥한 것이 바로 이 지점입니다: 터미널을 다루고, 도구를 순서대로 호출하고, 사람 개입 없이 작업을 끝내는 능력. Terminal-Bench 2.1의 82.7과 Toolathlon-Verified의 70.3은 이 가격대에서 프런티어급입니다.

비용 프로필

100만 토큰당 $0.14 / $0.28, 캐시 히트 $0.0028, 캐시 쓰기는 아예 과금되지 않습니다. 현재 라인업에서 가장 저렴한 자리이자 V4 Pro 출력 가격의 약 3분의 1이라, 대량 작업을 맡기기에 적합한 모델입니다.

롱 컨텍스트

입력 100만 토큰, 출력 최대 384K이므로 저장소 전체 읽기나 긴 회의록을 청크 분할 없이 처리합니다. 다만 여러 시간에 걸친 다단계 에이전트 루프의 품질은 여전히 V4 Pro보다 낮습니다.

추론 깊이

low, high, max 세 가지 reasoning_effort 단계가 지연 시간과 숙고를 맞바꿉니다. DeepSeek이 공개한 점수는 모두 max 기준입니다. 대학원 수준 추론은 강점이 아니며, 그 영역은 Claude Opus 5와 GPT 5.6 Sol이 앞섭니다.

모달리티

텍스트와 코드 전용입니다. 스크린샷, 스캔 PDF, 차트가 개입하는 단계에는 Claude Sonnet 4.6이나 GPT 5.6 Luna 같은 비전 모델이 필요합니다.

DeepSeek V4 Flash에 가장 적합한 에이전트 작업

대량 실행 코딩 에이전트

PR 일괄 리뷰, 테스트 작성, 린트 수정 패스, 정기 리팩터링처럼 같은 에이전트가 하루에 수백 번 도는 작업. 출력 100만 토큰당 $0.28이면 실행당 비용이 충분히 낮아 물량이 제약이 되지 않습니다.

터미널·도구 기반 자동화

0731 빌드가 공개한 가장 강한 결과는 터미널 작업과 도구 사용입니다. 빌드 수정, 배포 점검, 로그 트리아지 에이전트가 온종일 하는 일이 바로 그것입니다.

저장소 전체 읽기

100만 토큰 윈도우면 중간 규모 저장소 전체, 긴 인시던트 타임라인, 설계 문서 묶음을 한 번에 담을 수 있어 마이그레이션이나 감사 에이전트가 조각이 아니라 전체를 두고 추론할 수 있습니다.

프런티어 오케스트레이터 아래의 저비용 레이어

계획과 리뷰는 Claude Opus 5나 GPT 5.6 Sol에 맡기고, 파일 읽기·명령 실행·패치 초안 같은 다수의 기계적 단계는 V4 Flash에 넘기세요. 프런티어 요금은 결과를 좌우하는 단계에만 지불하게 됩니다.

DeepSeek V4 Flash를 건너뛰어야 할 때

이미지가 개입하는 작업은 비전이 없으므로 피하고, 대학원 수준 추론도 프런티어 모델이 여전히 뚜렷하게 앞섭니다. 여러 시간 동안 일관성을 유지해야 하는 장시간 실행은 아직 V4 Pro와 Claude Opus의 영역입니다. 그리고 DeepSeek Harness가 공개되기 전까지 발표된 에이전트 점수는 벤더 주장으로 다루세요: 프로덕션 에이전트를 옮기기 전에 자기 저장소에서 직접 벤치마크하시기 바랍니다.

DeepSeek V4 Flash vs 다른 모델

DeepSeek V4 Flash vs DeepSeek V4 Pro

같은 제품군, 반대의 트레이드오프. Pro는 토큰당 49B를 활성화하는 1.6T 플래그십이고, Flash는 13B를 활성화하며 출력 가격은 Pro의 3분의 1입니다. DeepSeek이 공개한 에이전트 벤치마크에서 0731 Flash 빌드가 아홉 개 전부 V4 Pro(프리뷰)보다 높은 점수를 냈으므로, Pro를 고를 이유는 에이전트 처리량이 아니라 긴 다단계 추론의 깊이입니다. V4 Pro는 VM0에서 더 이상 제공되지 않으며 여기 페이지는 참고 자료입니다.

DeepSeek V4 Flash vs GPT 5.6 Luna

둘 다 각 제품군의 저가 티어이며 모두 Codex 프레임워크에서 동작합니다. Luna는 멀티모달이고 OpenAI 생태계의 지원을 받습니다. Flash는 텍스트 전용 오픈 웨이트로, 출력 가격이 Luna의 4분의 1 미만이면서 공개된 에이전트 벤치마크 점수는 훨씬 높습니다. 비전이나 OpenAI 특유의 동작이 필요하면 Luna를, 작업이 코드와 도구라면 Flash를 고르세요.

DeepSeek V4 Flash vs Claude Sonnet 4.6

Sonnet 4.6은 비전과 Claude Code 프레임워크, Anthropic의 도구 라우팅 신뢰성을 갖춘 코어 에이전트 모델이고, Flash는 Sonnet 출력 가격의 약 50분의 1인 비용 절감형 텍스트 전용 모델입니다. 실행의 성패를 가르는 단계에는 Sonnet을 두고, 그 아래 물량은 Flash에 맡기세요.

결론: DeepSeek V4 Flash를 사용해야 할까?

DeepSeek V4 Flash는 VM0에서 제대로 된 코딩 에이전트를 돌리는 가장 저렴한 방법입니다: 프런티어에 근접한 에이전트 벤치마크, 100만 토큰 윈도우, 출력 100만 토큰당 $0.28. 벤더 수치는 자기 저장소에서 검증하고 비전과 최고 난도 추론은 다른 모델에 맡기면, 완료 작업당 비용에서 이기기 어려운 선택지입니다.

자주 묻는 질문

DeepSeek V4 Flash의 컨텍스트 윈도우는 얼마인가요?

입력 100만 토큰, 응답당 최대 384K 토큰 출력입니다. DeepSeek은 highmax 추론 강도에서 384K 출력 상한을 권장합니다.

DeepSeek V4 Flash의 비용은 얼마인가요?

벤더 정가는 입력 100만 토큰당 $0.14, 출력 100만 토큰당 $0.28이며 캐시 히트는 100만 토큰당 $0.0028, 캐시 쓰기는 과금되지 않습니다. VM0에서는 네 단계 중 가장 저렴한 $ 가격 티어에 속합니다. DeepSeek은 베이징 시간 09:00~12:00과 14:00~18:00에 자사 정가를 두 배로 올리는 피크 시간 정책을 예고했지만 아직 시행되지 않았습니다.

DeepSeek V4 Flash가 DeepSeek V4 Pro보다 나은가요?

DeepSeek이 0731 빌드에 대해 공개한 아홉 개 에이전트 벤치마크 기준으로는 그렇습니다. Pro의 49B에 비해 13B만 활성화하면서도 전부 더 높은 점수를 냈습니다. 장시간 다단계 추론에서는 Pro가 앞섭니다. V4 Pro는 VM0에서 더 이상 제공되지 않습니다.

DeepSeek V4 Flash는 비전을 지원하나요?

아니요. 텍스트와 코드만 받습니다. 스크린샷, 차트, PDF 기반 단계는 Claude Sonnet 4.6이나 GPT 5.6 Luna 같은 멀티모달 모델로 보내세요.

DeepSeek V4 Flash는 VM0에서 어떤 프레임워크를 쓰나요?

Codex입니다. VM0는 DeepSeek의 Responses API를 통해 라우팅하며, 현재 이를 지원하는 DeepSeek 모델은 V4 Flash뿐입니다. VM0 크레딧으로 과금되는 Built-in 모델로 실행하거나 자신의 DeepSeek API 키를 사용할 수 있습니다.

대안

VM0에서 DeepSeek V4 Flash 사용하기

VM0에서 DeepSeek V4 Flash에 접근하는 두 가지 방법

VM0는 DeepSeek V4 Flash을(를) VM0 크레딧으로 청구되는 Built-in 모델로, 그리고 DeepSeek API key를 사용하는 BYOK 방식으로 지원합니다. Built-in 경로는 VM0 Managed 라우팅과 아래에 설명된 가격 티어를 사용하고, BYOK 경로는 상위 벤더가 직접 청구하며 VM0의 크레딧 환산을 완전히 건너뜁니다.

VM0의 추천

VM0는 DeepSeek V4 Flash를 핵심 에이전트 모델이 아닌 비용 절감 옵션으로 자리매김합니다. 대량 분류, 사전 필터링, 지연 시간이 중요한 짧은 응답, 또는 고정된 레거시 에이전트 같은 비핵심 작업의 단위 비용을 최적화하는 데 사용하고, 실행을 결정하는 단계에는 Claude Opus 4.7, Claude Opus 4.6, 또는 Claude Sonnet 4.6를 유지하세요.

크레딧과 $ 가격 티어

VM0는 모든 Built-in 모델을 $, $$, $$$, $$$$의 4단계 크레딧 스케일로 책정하며, 모델 선택기의 배지와 zero model lsprice tier 줄에 표시됩니다. DeepSeek V4 Flash은(는) $ 티어입니다. 이 티어가 VM0 크레딧 잔액에서 차감되는 비용이고, 위 표의 벤더 정가는 VM0가 크레딧으로 환산하기 전에 상위 제공업체가 청구하는 금액입니다.

July 31, 2026부터 VM0에서 사용 가능.