Tous les modèles

DeepSeek V4 Flash sur VM0. Du code agentique au palier le moins cher

Le modèle Mixture-of-Experts open-weight de DeepSeek : 284 Md de paramètres, 13 Md actifs par token. La version 0731 dépasse V4 Pro sur tous les benchmarks agentiques publiés par DeepSeek, à 0,14 $ / 0,28 $ par million de tokens.

1M tokens · Text / Code · Prompt cache

DeepSeek V4 Flash est la moitié « efficacité » de la génération V4 de DeepSeek : un modèle Mixture-of-Experts de 284 Md de paramètres qui en active 13 Md par token, publié sous licence MIT avec des poids ouverts. La version 0731, livrée le 31 juillet 2026, a conservé l'architecture et refait uniquement le post-entraînement sur des données agentiques, ce qui lui a permis de dépasser DeepSeek V4 Pro (Preview) sur les neuf benchmarks agentiques publiés par DeepSeek — 82,7 contre 72,1 sur Terminal-Bench 2.1, et 54,4 contre 12,8 sur DeepSWE.

Le prix catalogue est de 0,14 $ / 0,28 $ par million de tokens, avec les lectures de cache à 0,0028 $ / M et aucune facturation des écritures de cache, ce qui en fait le modèle de raisonnement le moins cher de la gamme VM0 actuelle. Il offre une fenêtre de contexte d'un million de tokens, jusqu'à 384 K en sortie, et le mode réflexion activé par défaut. Il est uniquement textuel : pas de vision. Passez à Claude Sonnet 4.6 quand une étape exige des images ou le framework Claude Code, et à GPT 5.6 Luna si vous voulez le palier économique de la famille OpenAI.

Qu'est-ce que DeepSeek V4 Flash ?

31 juillet 2026 (DeepSeek-V4-Flash-0731, bêta publique) · La moitié « efficacité » de la famille DeepSeek V4 : 13 Md de paramètres actifs contre 49 Md pour V4 Pro, post-entraînée pour le travail agentique.

DeepSeek V4 Flash est apparu le 24 avril 2026 comme la plus petite moitié de la famille V4 — un MoE de 284 Md de paramètres, 13 Md actifs par token et une fenêtre de contexte d'un million de tokens, aux côtés du V4 Pro de 1,6 T de paramètres. Il est sorti de preview le 31 juillet 2026 sous le nom DeepSeek-V4-Flash-0731, une version en bêta publique qui laisse l'architecture intacte et ne refait que la passe de post-entraînement, cette fois sur des données orientées agents.

Ce ré-entraînement résume toute la sortie. Selon les chiffres de DeepSeek, la version 0731 dépasse V4 Pro (Preview) sur les neuf benchmarks agentiques publiés tout en activant environ un quart des paramètres : Terminal-Bench 2.1 passe de 61,8 en preview à 82,7, DeepSWE de 7,3 à 54,4, Toolathlon-Verified de 49,7 à 70,3. Plusieurs de ces scores arrivent à quelques points de Claude Opus 4.8 — 82,7 contre 85,0 sur Terminal-Bench 2.1, 25,2 contre 25,7 sur Agents' Last Exam — pour une fraction du prix.

Les réserves méritent d'être dites clairement. Tous les scores sont annoncés par DeepSeek et obtenus avec le DeepSeek Harness, qui n'a pas été publié : aucun n'a donc été reproduit de façon indépendante, et deux des neuf jeux de tests sont internes à DeepSeek. Le modèle est uniquement textuel, reste en retrait sur le raisonnement de niveau doctoral et demeure derrière V4 Pro sur les tâches longues à plusieurs étapes. Le mode réflexion est activé par défaut, et les tokens de réflexion sont facturés comme de la sortie.

Ce qui distingue DeepSeek V4 Flash

Principales caractéristiques d'architecture et de capacités.

V4 Flash est un modèle Mixture-of-Experts creux : 284 Md de paramètres au total, dont 13 Md activés par token. Chaque couche MoE comporte 1 expert partagé et 256 experts routés avec une dimension intermédiaire de 2048, et 6 experts routés s'activent par token. Les trois premières couches MoE utilisent un routage par hachage et la profondeur de prédiction multi-token est de 1. Le checkpoint 0731 publié pèse 304 Md de paramètres car il embarque un module de brouillon pour le décodage spéculatif par-dessus la base de 284 Md. Il prend en charge une fenêtre de contexte d'un million de tokens avec jusqu'à 384 K en sortie, les modes réflexion et sans réflexion, ainsi qu'un paramètre reasoning_effort à trois niveaux : low, high et max. Les poids sont sous licence MIT et accessibles sans restriction.

Spécifications en un coup d'œil

FamilleSérie DeepSeek V4 (Flash)
Paramètres284 Md au total / 13 Md actifs (MoE)
ModalitésTexte, code (pas de vision)
LicenceMIT, poids ouverts
Mise en cache des promptsPrise en charge (DeepSeek)
Fenêtre de contexte1 M de tokens
Sortie maximaleJusqu'à 384 K tokens
Effort de raisonnementLow / High / Max
Prix catalogue du fournisseur0,14 $ en entrée / 0,28 $ en sortie par million

Benchmarks de DeepSeek V4 Flash

Chiffres annoncés par DeepSeek, tirés de la fiche du modèle DeepSeek-V4-Flash-0731, obtenus avec le DeepSeek Harness en mode minimal et un effort de raisonnement max (température 1,0, top_p 0,95). Le harness n'ayant pas été publié, aucun de ces résultats n'a été reproduit indépendamment ; DSBench-FullStack et DSBench-Hard sont des jeux de tests internes à DeepSeek.

Terminal-Bench 2.1travail agentique en terminal ; V4 Pro (Preview) 72,1
82,7
SWE-bench Verifiedversion preview, annoncé par le fournisseur
79,0 %
Cybergymannoncé par le fournisseur
76,7
Toolathlon (verified)usage d'outils ; V4 Pro (Preview) 55,9
70,3
DSBench-FullStackjeu interne DeepSeek
68,7
DSBench-Hardjeu interne DeepSeek
59,6
DeepSWEcontre 7,3 pour la version preview
54,4
NL2Repoconstruction de dépôt
54,2
Agents' Last ExamClaude Opus 4.8 obtient 25,7
25,2

Tarification de DeepSeek V4 Flash

Prix catalogue fournisseur, par million de tokens.

Entrée$0.14
Sortie$0.28
Lecture cache$0.003
Écriture cacheNon facturé

Comment DeepSeek V4 Flash se comporte en pratique

Comportement observé lors d'exécutions d'agents en production.

Exécution agentique

C'est exactement la cible du post-entraînement 0731 : piloter un terminal, enchaîner les appels d'outils et terminer une tâche sans humain dans la boucle. 82,7 sur Terminal-Bench 2.1 et 70,3 sur Toolathlon-Verified le placent en très bonne compagnie pour ce prix.

Profil de coût

0,14 $ / 0,28 $ par million de tokens, lectures de cache à 0,0028 $ / M et écritures de cache non facturées. C'est la position la moins chère de la gamme actuelle et environ un tiers du prix de sortie de V4 Pro : le modèle à mettre sur le travail à gros volume.

Contexte long

Un million de tokens en entrée, jusqu'à 384 K en sortie : la lecture d'un dépôt entier ou de longues transcriptions passe sans découpage. La qualité sur les boucles agentiques longues et très étagées reste en deçà de V4 Pro.

Profondeur de raisonnement

Trois niveaux de reasoning_effortlow, high et max — échangent latence contre délibération, et les scores publiés par DeepSeek sont tous en max. Le raisonnement de niveau doctoral n'est pas son point fort ; c'est là que Claude Opus 5 et GPT 5.6 Sol gardent l'avantage.

Modalités

Texte et code uniquement. Dès qu'une capture d'écran, un PDF scanné ou un graphique entre en jeu, il faut un modèle avec vision comme Claude Sonnet 4.6 ou GPT 5.6 Luna.

Meilleures tâches d'agent pour DeepSeek V4 Flash

Agents de code à gros volume

Revue de PR en masse, écriture de tests, passes lint-et-correction et refactorisations planifiées, là où le même agent tourne des centaines de fois par jour. À 0,28 $ par million de tokens en sortie, le coût par exécution reste assez bas pour que le volume cesse d'être la contrainte.

Automatisation pilotée par terminal et outils

Les meilleurs résultats publiés de la version 0731 portent sur le travail en terminal et l'usage d'outils, c'est-à-dire exactement ce que fait toute la journée un agent de correction de build, de vérification de déploiement ou de tri de logs.

Lecture à l'échelle du dépôt

Une fenêtre d'un million de tokens absorbe un dépôt de taille moyenne, une longue chronologie d'incident ou un jeu complet de documents de conception en une passe : un agent de migration ou d'audit peut raisonner sur l'ensemble plutôt que morceau par morceau.

La couche économique sous un orchestrateur de pointe

Laissez Claude Opus 5 ou GPT 5.6 Sol planifier et relire, et confiez à V4 Flash les nombreuses étapes mécaniques — lire des fichiers, exécuter des commandes, rédiger des correctifs. Vous ne payez le tarif haut de gamme que sur les étapes qui décident du résultat.

Quand éviter DeepSeek V4 Flash

Écartez V4 Flash dès qu'il y a des images dans la boucle, puisqu'il n'a pas de vision, et sur le raisonnement de niveau doctoral, où les modèles de pointe gardent une avance nette. Les exécutions longues qui doivent rester cohérentes pendant des heures restent le terrain de V4 Pro et de Claude Opus. Et traitez les scores agentiques publiés comme des déclarations du fournisseur tant que le DeepSeek Harness n'est pas sorti : mesurez-les sur votre propre dépôt avant d'y basculer un agent de production.

DeepSeek V4 Flash vs autres modèles

DeepSeek V4 Flash vs DeepSeek V4 Pro

Même famille, arbitrage inverse. Pro est le vaisseau amiral de 1,6 T avec 49 Md actifs par token ; Flash en active 13 Md et coûte un tiers du prix de sortie de Pro. Sur les benchmarks agentiques publiés par DeepSeek, la version 0731 de Flash dépasse désormais V4 Pro (Preview) sur les neuf, si bien que l'argument en faveur de Pro tient à la profondeur du raisonnement long, pas au débit agentique. V4 Pro n'est plus proposé sur VM0 — sa page ici est purement documentaire.

DeepSeek V4 Flash vs GPT 5.6 Luna

Tous deux sont le palier économique de leur famille et tournent sur le framework Codex. Luna est multimodal et porté par l'écosystème OpenAI ; Flash est uniquement textuel, open-weight, coûte moins du quart du prix de sortie de Luna et affiche des scores agentiques publiés bien plus élevés. Choisissez Luna s'il vous faut la vision ou des comportements propres à OpenAI, Flash quand le travail porte sur du code et des outils.

DeepSeek V4 Flash vs Claude Sonnet 4.6

Sonnet 4.6 est un modèle d'agent central, avec la vision, le framework Claude Code et la fiabilité d'Anthropic sur le routage d'outils ; Flash est un modèle économique, uniquement textuel, à environ un cinquantième du prix de sortie de Sonnet. Gardez Sonnet sur les étapes qui décident d'une exécution et confiez le volume à Flash en dessous.

En résumé : devriez-vous utiliser DeepSeek V4 Flash ?

DeepSeek V4 Flash est le moyen le moins cher de faire tourner un agent de code compétent sur VM0 : des benchmarks agentiques proches de la pointe, une fenêtre d'un million de tokens et 0,28 $ par million de tokens en sortie. Vérifiez les chiffres du fournisseur sur votre propre dépôt, laissez la vision et le raisonnement le plus difficile ailleurs, et il devient difficile à battre au coût par tâche accomplie.

Questions fréquentes

Quelle est la fenêtre de contexte de DeepSeek V4 Flash ?

Un million de tokens en entrée et jusqu'à 384 K tokens de sortie par réponse. DeepSeek recommande le plafond de 384 K en sortie aux niveaux d'effort high et max.

Combien coûte DeepSeek V4 Flash ?

Le prix catalogue est de 0,14 $ par million de tokens en entrée et 0,28 $ par million en sortie, avec les lectures de cache à 0,0028 $ par million et aucune facturation des écritures de cache. Sur VM0, il occupe le palier $, le moins cher des quatre. DeepSeek a annoncé une politique d'heures pleines qui doublerait ses propres prix catalogue entre 9 h–12 h et 14 h–18 h heure de Pékin ; elle n'est pas encore entrée en vigueur.

DeepSeek V4 Flash est-il meilleur que DeepSeek V4 Pro ?

Sur les neuf benchmarks agentiques publiés par DeepSeek pour la version 0731, oui : il devance V4 Pro (Preview) sur chacun, tout en activant 13 Md de paramètres contre 49 Md pour Pro. Pro conserve l'avantage sur le raisonnement long à plusieurs étapes. V4 Pro n'est plus proposé sur VM0.

DeepSeek V4 Flash gère-t-il la vision ?

Non. Il n'accepte que du texte et du code. Routez les étapes fondées sur des captures d'écran, des graphiques ou des PDF vers un modèle multimodal comme Claude Sonnet 4.6 ou GPT 5.6 Luna.

Quel framework DeepSeek V4 Flash utilise-t-il sur VM0 ?

Codex. VM0 le route via l'API Responses de DeepSeek, que V4 Flash est actuellement le seul modèle DeepSeek à prendre en charge. Vous pouvez l'utiliser comme modèle Built-in facturé en crédits VM0, ou apporter votre propre clé d'API DeepSeek.

Alternatives

Utiliser DeepSeek V4 Flash sur VM0

Deux façons d'accéder à DeepSeek V4 Flash sur VM0

VM0 prend en charge DeepSeek V4 Flash comme modèle Built-in facturé en crédits VM0, et en bring-your-own avec une DeepSeek API key. La voie Built-in passe par le routage VM0 Managed et le palier tarifaire expliqué ci-dessous ; la voie bring-your-own vous facture directement chez le fournisseur en amont et évite entièrement la conversion en crédits VM0.

La recommandation de VM0

VM0 positionne DeepSeek V4 Flash comme une option économique plutôt qu'un modèle d'agent central. Utilisez-le pour optimiser le coût unitaire sur le travail non central, comme la classification en masse, les pré-filtres, les réponses courtes critiques en latence, ou les agents legacy figés, tout en gardant Claude Opus 4.7, Claude Opus 4.6 ou Claude Sonnet 4.6 sur les étapes qui décident de l'exécution.

Crédits et palier tarifaire $

VM0 classe chaque modèle Built-in sur une échelle de crédits à quatre paliers — $, $$, $$$, $$$$ — affichée comme badge dans le sélecteur de modèles et sur la ligne price tier de zero model ls. DeepSeek V4 Flash se situe au palier $. C'est ce palier qui est débité de votre solde de crédits VM0 ; le prix catalogue du fournisseur dans le tableau ci-dessus correspond à ce que facture le prestataire en amont avant que VM0 ne le convertisse en crédits.

Disponible sur VM0 depuis le July 31, 2026.