Alle Modelle

DeepSeek V4 Flash auf VM0. Agentenreifes Coding in der günstigsten Preisstufe

DeepSeeks Open-Weight-Mixture-of-Experts-Modell mit 284B Parametern und 13B aktiv pro Token. Der 0731-Build schlägt V4 Pro in jedem von DeepSeek veröffentlichten Agenten-Benchmark, zu $0,14 / $0,28 pro 1M Tokens.

1M tokens · Text / Code · Prompt cache

DeepSeek V4 Flash ist die Effizienzhälfte von DeepSeeks V4-Generation: ein Mixture-of-Experts-Modell mit 284B Parametern, das 13B pro Token aktiviert und unter der MIT-Lizenz mit offenen Gewichten veröffentlicht wurde. Der 0731-Build vom 31. Juli 2026 ließ die Architektur unverändert und wiederholte nur das Post-Training auf Agentendaten — damit zieht er in allen neun von DeepSeek veröffentlichten Agenten-Benchmarks an DeepSeek V4 Pro (Preview) vorbei: 82,7 gegen 72,1 in Terminal-Bench 2.1 und 54,4 gegen 12,8 in DeepSWE.

Der Listenpreis liegt bei $0,14 / $0,28 pro 1M Tokens, Cache-Treffer kosten $0,0028 / 1M und Cache-Schreibvorgänge sind kostenlos. Damit ist es das günstigste Reasoning-Modell im aktuellen VM0-Lineup. Es bietet ein Kontextfenster von 1M Tokens, bis zu 384K Ausgabe und standardmäßig aktivierten Thinking-Modus. Es ist reiner Text: kein Vision. Greif zu Claude Sonnet 4.6, wenn ein Schritt Bilder oder das Claude-Code-Framework braucht, und zu GPT 5.6 Luna, wenn du die günstige Stufe der OpenAI-Familie willst.

Was ist DeepSeek V4 Flash?

31. Juli 2026 (DeepSeek-V4-Flash-0731, Public Beta) · Die Effizienzhälfte der DeepSeek-V4-Familie: 13B aktive Parameter gegenüber 49B bei V4 Pro, nachtrainiert für Agentenarbeit.

DeepSeek V4 Flash erschien am 24. April 2026 als kleinere Hälfte der V4-Familie — ein MoE mit 284B Parametern, 13B aktiv pro Token und einem Kontextfenster von 1M Tokens, neben dem 1,6T Parameter großen V4 Pro. Am 31. Juli 2026 verließ es als DeepSeek-V4-Flash-0731 die Preview: ein Public-Beta-Build, der die Architektur unangetastet ließ und allein das Post-Training wiederholte, diesmal auf agentenlastigen Daten.

Dieses Nachtraining ist die ganze Geschichte des Releases. Nach DeepSeeks eigenen Zahlen schlägt der 0731-Build V4 Pro (Preview) in allen neun veröffentlichten Agenten-Benchmarks, obwohl er rund ein Viertel der Parameter aktiviert: Terminal-Bench 2.1 steigt von 61,8 in der Flash-Preview auf 82,7, DeepSWE von 7,3 auf 54,4, Toolathlon-Verified von 49,7 auf 70,3. Mehrere Werte liegen wenige Punkte hinter Claude Opus 4.8 — 82,7 gegen 85,0 in Terminal-Bench 2.1, 25,2 gegen 25,7 in Agents' Last Exam — bei einem Bruchteil des Preises.

Die Einschränkungen gehören klar benannt. Alle Scores stammen von DeepSeek selbst und wurden mit dem DeepSeek Harness erhoben, der noch nicht veröffentlicht ist; unabhängig reproduziert wurde also keiner, und zwei der neun Sets sind DeepSeeks interne. Das Modell ist reiner Text, bleibt bei Reasoning auf Graduiertenniveau hinter der Spitze und liegt bei langen mehrstufigen Aufgaben weiterhin hinter V4 Pro. Der Thinking-Modus ist standardmäßig an, und Thinking-Tokens werden als Ausgabe abgerechnet.

Das zeichnet DeepSeek V4 Flash aus

Architektur- und Funktionsmerkmale im Überblick.

V4 Flash ist ein spärliches Mixture-of-Experts-Modell: 284B Parameter insgesamt, 13B davon pro Token aktiviert. Jede MoE-Schicht enthält 1 Shared Expert und 256 geroutete Experten mit einer Zwischendimension von 2048, wobei pro Token 6 geroutete Experten feuern. Die ersten drei MoE-Schichten nutzen Hash-Routing, die Multi-Token-Prediction-Tiefe beträgt 1. Der veröffentlichte 0731-Checkpoint kommt auf 304B Parameter, weil er zusätzlich zum 284B-Basismodell ein Draft-Modul für spekulatives Decoding mitbringt. Unterstützt werden ein Kontextfenster von 1M Tokens mit bis zu 384K Ausgabe, Thinking- und Non-Thinking-Modus sowie ein Parameter reasoning_effort mit den Stufen low, high und max. Die Gewichte stehen unter MIT-Lizenz und sind frei zugänglich.

Technische Daten auf einen Blick

FamilieDeepSeek-V4-Reihe (Flash)
Parameter284B gesamt / 13B aktiv (MoE)
ModalitätenText, Code (kein Vision)
LizenzMIT, offene Gewichte
Prompt-CachingUnterstützt (DeepSeek)
Kontextfenster1M Tokens
Maximale AusgabeBis zu 384K Tokens
Reasoning-AufwandLow / High / Max
Listenpreis des Anbieters$0,14 Eingabe / $0,28 Ausgabe pro 1M

DeepSeek V4 Flash Benchmarks

Von DeepSeek berichtete Werte aus der Modellkarte zu DeepSeek-V4-Flash-0731, erhoben mit dem DeepSeek Harness im Minimal-Modus bei maximalem Reasoning-Aufwand (Temperatur 1,0, top_p 0,95). Der Harness ist nicht veröffentlicht, also wurde keiner dieser Werte unabhängig reproduziert; DSBench-FullStack und DSBench-Hard sind interne Testsets von DeepSeek.

Terminal-Bench 2.1agentische Terminalarbeit; V4 Pro (Preview) 72,1
82,7
SWE-bench VerifiedPreview-Build, Herstellerangabe
79,0 %
CybergymHerstellerangabe
76,7
Toolathlon (verified)Tool-Nutzung; V4 Pro (Preview) 55,9
70,3
DSBench-FullStackinternes DeepSeek-Set
68,7
DSBench-Hardinternes DeepSeek-Set
59,6
DeepSWEzuvor 7,3 im Preview-Build
54,4
NL2RepoRepository-Aufbau
54,2
Agents' Last ExamClaude Opus 4.8 erreicht 25,7
25,2

DeepSeek V4 Flash Preise

Listenpreis des Anbieters, pro 1 Mio. Tokens.

Input$0.14
Output$0.28
Cache Read$0.003
Cache WriteNicht abgerechnet

Wie sich DeepSeek V4 Flash in der Praxis verhält

Beobachtetes Verhalten aus produktiven Agent-Durchläufen.

Agentische Ausführung

Genau darauf zielt das 0731-Post-Training: ein Terminal bedienen, Tools in Folge aufrufen und eine Aufgabe ohne Menschen in der Schleife abschließen. 82,7 in Terminal-Bench 2.1 und 70,3 in Toolathlon-Verified sind für diesen Preis Spitzenklasse.

Kostenprofil

$0,14 / $0,28 pro 1M Tokens, Cache-Treffer zu $0,0028 / 1M und Cache-Schreibvorgänge gar nicht berechnet. Das ist die günstigste Position im aktuellen Lineup und rund ein Drittel des Ausgabepreises von V4 Pro — das Modell für Arbeit in großem Volumen.

Langer Kontext

1M Tokens hinein, bis zu 384K hinaus: ein ganzes Repository oder lange Transkripte passen ohne Chunking. Bei langen, vielstufigen Agentenschleifen liegt die Qualität weiterhin hinter V4 Pro.

Reasoning-Tiefe

Drei reasoning_effort-Stufen — low, high und max — tauschen Latenz gegen Bedenkzeit; DeepSeeks veröffentlichte Scores stammen alle von max. Reasoning auf Graduiertenniveau ist nicht seine Stärke; dort bleiben Claude Opus 5 und GPT 5.6 Sol vorn.

Modalitäten

Nur Text und Code. Sobald ein Screenshot, ein gescanntes PDF oder ein Diagramm im Spiel ist, braucht es ein Vision-Modell wie Claude Sonnet 4.6 oder GPT 5.6 Luna.

Beste Agent-Aufgaben für DeepSeek V4 Flash

Coding-Agenten mit hohem Volumen

Massenhafte PR-Reviews, Testerstellung, Lint-und-Fix-Durchläufe und geplante Refactorings, bei denen derselbe Agent hunderte Male am Tag läuft. Bei $0,28 pro 1M Ausgabe-Tokens bleiben die Kosten pro Lauf so niedrig, dass das Volumen aufhört, die Grenze zu sein.

Terminal- und tool-getriebene Automatisierung

Die stärksten veröffentlichten Ergebnisse des 0731-Builds betreffen Terminalarbeit und Tool-Nutzung — genau das, was ein Build-Fix-, Deployment-Check- oder Log-Triage-Agent den ganzen Tag tut.

Repository-weites Lesen

Ein Fenster von 1M Tokens fasst ein mittelgroßes Repository, eine lange Incident-Chronologie oder einen kompletten Satz Design-Dokumente in einem Durchgang, sodass ein Migrations- oder Audit-Agent über das Ganze statt Stück für Stück nachdenken kann.

Die günstige Schicht unter einem Frontier-Orchestrator

Lass Claude Opus 5 oder GPT 5.6 Sol planen und prüfen und gib die vielen mechanischen Schritte — Dateien lesen, Befehle ausführen, Patches entwerfen — an V4 Flash. Den Frontier-Tarif zahlst du dann nur für die Schritte, die den Lauf entscheiden.

Wann du DeepSeek V4 Flash überspringen solltest

Lass V4 Flash bei allem außen vor, was Bilder einbezieht, denn es hat kein Vision, und bei Reasoning auf Graduiertenniveau, wo die Spitzenmodelle klar vorn liegen. Lange Läufe, die über Stunden kohärent bleiben müssen, bleiben Terrain von V4 Pro und Claude Opus. Und behandle die veröffentlichten Agenten-Scores als Herstellerangaben, solange der DeepSeek Harness nicht erschienen ist: benchmarke sie auf deinem eigenen Repository, bevor du einen Produktions-Agenten umziehst.

DeepSeek V4 Flash vs andere Modelle

DeepSeek V4 Flash vs DeepSeek V4 Pro

Gleiche Familie, umgekehrter Kompromiss. Pro ist das 1,6T-Flaggschiff mit 49B aktiv pro Token; Flash aktiviert 13B und liegt bei einem Drittel von Pros Ausgabepreis. In DeepSeeks veröffentlichten Agenten-Benchmarks schlägt der 0731-Flash-Build V4 Pro (Preview) inzwischen in allen neun, das Argument für Pro ist also Tiefe bei langem mehrstufigem Reasoning, nicht Agenten-Durchsatz. V4 Pro wird auf VM0 nicht mehr angeboten — seine Seite hier ist Referenzmaterial.

DeepSeek V4 Flash vs GPT 5.6 Luna

Beide sind die günstige Stufe ihrer Familie und beide laufen auf dem Codex-Framework. Luna ist multimodal und vom OpenAI-Ökosystem getragen; Flash ist reiner Text, Open Weight, liegt bei unter einem Viertel von Lunas Ausgabepreis und zeigt deutlich stärkere veröffentlichte Agenten-Benchmarks. Nimm Luna, wenn du Vision oder OpenAI-spezifisches Verhalten brauchst, und Flash, wenn es um Code und Tools geht.

DeepSeek V4 Flash vs Claude Sonnet 4.6

Sonnet 4.6 ist ein Kern-Agentenmodell mit Vision, dem Claude-Code-Framework und Anthropics zuverlässigem Tool-Routing; Flash ist ein kostensparendes, reines Textmodell zu etwa einem Fünfzigstel von Sonnets Ausgabepreis. Behalte Sonnet für die Schritte, die einen Lauf entscheiden, und gib Flash das Volumen darunter.

Fazit: Solltest du DeepSeek V4 Flash nutzen?

DeepSeek V4 Flash ist der günstigste Weg, auf VM0 einen kompetenten Coding-Agenten zu betreiben: Agenten-Benchmarks nahe der Spitze, ein 1M-Token-Fenster und $0,28 pro 1M Ausgabe-Tokens. Prüf die Herstellerzahlen auf deinem eigenen Repository, halte Vision und das schwerste Reasoning woanders — dann ist es bei den Kosten pro erledigter Aufgabe schwer zu schlagen.

Häufig gestellte Fragen

Wie groß ist das Kontextfenster von DeepSeek V4 Flash?

1M Tokens Eingabe und bis zu 384K Tokens Ausgabe pro Antwort. DeepSeek empfiehlt die vollen 384K Ausgabe bei den Reasoning-Stufen high und max.

Was kostet DeepSeek V4 Flash?

Der Listenpreis des Anbieters liegt bei $0,14 pro 1M Eingabe-Tokens und $0,28 pro 1M Ausgabe, Cache-Treffer bei $0,0028 pro 1M, Cache-Schreibvorgänge sind kostenlos. Auf VM0 gehört es zur Preisstufe $, der günstigsten der vier. DeepSeek hat eine Peak-Hour-Regel angekündigt, die die eigenen Listenpreise zwischen 9:00–12:00 und 14:00–18:00 Uhr Pekinger Zeit verdoppeln würde; sie ist noch nicht in Kraft.

Ist DeepSeek V4 Flash besser als DeepSeek V4 Pro?

In den neun Agenten-Benchmarks, die DeepSeek für den 0731-Build veröffentlicht hat: ja — es liegt in jedem einzelnen vorn, obwohl es 13B statt Pros 49B Parameter aktiviert. Bei langem mehrstufigem Reasoning behält Pro die Nase vorn. V4 Pro wird auf VM0 nicht mehr angeboten.

Unterstützt DeepSeek V4 Flash Vision?

Nein. Es nimmt nur Text und Code. Schritte mit Screenshots, Diagrammen oder PDFs gehören zu einem multimodalen Modell wie Claude Sonnet 4.6 oder GPT 5.6 Luna.

Welches Framework nutzt DeepSeek V4 Flash auf VM0?

Codex. VM0 routet es über DeepSeeks Responses API, die derzeit nur V4 Flash unter den DeepSeek-Modellen unterstützt. Du kannst es als Built-in-Modell in VM0-Credits betreiben oder deinen eigenen DeepSeek-API-Key mitbringen.

Alternativen

DeepSeek V4 Flash auf VM0 nutzen

Zwei Wege, um DeepSeek V4 Flash auf VM0 zu nutzen

VM0 unterstützt DeepSeek V4 Flash als Built-in-Modell, das in VM0-Credits abgerechnet wird, und über Bring-your-own mit einem DeepSeek API key. Der Built-in-Weg nutzt VM0-Managed-Routing und die unten erklärte Preisstufe; beim Bring-your-own-Weg rechnet der vorgelagerte Anbieter direkt mit dir ab und die Umrechnung in VM0-Credits entfällt vollständig.

VM0s Empfehlung

VM0 positioniert DeepSeek V4 Flash als kostensparende Option statt als Core-Agent-Modell. Nutze es zur Optimierung der Stückkosten bei Nicht-Kernarbeit wie Massenklassifikation, Vorfiltern, latenzkritischen Kurzantworten oder fest zugewiesenen Legacy-Agents, während Claude Opus 4.7, Claude Opus 4.6 oder Claude Sonnet 4.6 die entscheidenden Schritte übernehmen.

Credits und die Preisstufe $

VM0 bepreist jedes Built-in-Modell auf einer vierstufigen Credit-Skala — $, $$, $$$, $$$$ — die als Badge im Modell-Picker und in der Zeile price tier von zero model ls erscheint. DeepSeek V4 Flash steht bei $. Diese Stufe bestimmt, was von deinem VM0-Credit-Guthaben abgeht; der Listenpreis des Anbieters in der Tabelle oben ist das, was der vorgelagerte Provider berechnet, bevor VM0 daraus Credits macht.

Verfügbar auf VM0 seit July 31, 2026.