DeepSeek V4 Flash en VM0. Programación agéntica en el nivel de precio más barato
El modelo Mixture-of-Experts de pesos abiertos de DeepSeek: 284 B de parámetros con 13 B activos por token. La compilación 0731 supera a V4 Pro en todos los benchmarks agénticos publicados por DeepSeek, a 0,14 $ / 0,28 $ por millón de tokens.
1M tokens · Text / Code · Prompt cache
DeepSeek V4 Flash es la mitad eficiente de la generación V4 de DeepSeek: un modelo Mixture-of-Experts de 284 B de parámetros que activa 13 B por token, publicado bajo licencia MIT con pesos abiertos. La compilación 0731, lanzada el 31 de julio de 2026, mantuvo la arquitectura intacta y repitió solo el post-entrenamiento con datos agénticos, lo que la llevó a superar a DeepSeek V4 Pro (Preview) en los nueve benchmarks agénticos publicados por DeepSeek: 82,7 frente a 72,1 en Terminal-Bench 2.1 y 54,4 frente a 12,8 en DeepSWE.
El precio de lista es de 0,14 $ / 0,28 $ por millón de tokens, con aciertos de caché a 0,0028 $ / M y sin cargo por escrituras de caché, lo que lo convierte en el modelo de razonamiento más barato del catálogo actual de VM0. Tiene una ventana de contexto de un millón de tokens, hasta 384 K de salida y el modo de pensamiento activado por defecto. Es solo texto: sin visión. Recurre a Claude Sonnet 4.6 cuando un paso necesite imágenes o el framework Claude Code, y a GPT 5.6 Luna si prefieres el nivel económico de la familia OpenAI.
¿Qué es DeepSeek V4 Flash?
31 de julio de 2026 (DeepSeek-V4-Flash-0731, beta pública) · La mitad eficiente de la familia DeepSeek V4: 13 B de parámetros activos frente a los 49 B de V4 Pro, post-entrenada para trabajo agéntico.
DeepSeek V4 Flash apareció el 24 de abril de 2026 como la mitad pequeña de la familia V4: un MoE de 284 B de parámetros con 13 B activos por token y una ventana de contexto de un millón de tokens, junto al V4 Pro de 1,6 T de parámetros. Salió de preview el 31 de julio de 2026 como DeepSeek-V4-Flash-0731, una compilación en beta pública que dejó la arquitectura sin tocar y repitió únicamente la fase de post-entrenamiento, esta vez con datos orientados a agentes.
Ese reentrenamiento es toda la historia del lanzamiento. Según las cifras de la propia DeepSeek, la compilación 0731 supera a V4 Pro (Preview) en los nueve benchmarks agénticos publicados mientras activa aproximadamente una cuarta parte de los parámetros: Terminal-Bench 2.1 pasa de 61,8 en la preview de Flash a 82,7, DeepSWE de 7,3 a 54,4 y Toolathlon-Verified de 49,7 a 70,3. Varios de esos valores quedan a pocos puntos de Claude Opus 4.8 — 82,7 frente a 85,0 en Terminal-Bench 2.1, 25,2 frente a 25,7 en Agents' Last Exam — por una fracción del precio.
Conviene decir las reservas con claridad. Todas las puntuaciones las reporta DeepSeek y se obtuvieron con el DeepSeek Harness, que no se ha publicado, así que ninguna se ha reproducido de forma independiente, y dos de los nueve conjuntos son internos de DeepSeek. El modelo es solo texto, queda por detrás de la frontera en razonamiento de nivel doctoral y sigue por detrás de V4 Pro en tareas largas de muchos pasos. El modo de pensamiento está activado por defecto y los tokens de pensamiento se facturan como salida.
Qué destaca de DeepSeek V4 Flash
Características principales de arquitectura y capacidades.
V4 Flash es un modelo Mixture-of-Experts disperso: 284 B de parámetros en total con 13 B activados por token, donde cada capa MoE tiene 1 experto compartido y 256 expertos enrutados con dimensión intermedia de 2048, y 6 expertos enrutados se activan por token. Las tres primeras capas MoE usan enrutamiento por hash y la profundidad de predicción multi-token es 1. El checkpoint 0731 publicado suma 304 B de parámetros porque incorpora un módulo de borrador para decodificación especulativa sobre la base de 284 B. Admite una ventana de contexto de un millón de tokens con hasta 384 K de salida, modos con y sin pensamiento, y un parámetro reasoning_effort con los niveles low, high y max. Los pesos están bajo licencia MIT y sin restricciones de acceso.
Especificaciones rápidas
Benchmarks de DeepSeek V4 Flash
Cifras reportadas por DeepSeek en la ficha del modelo DeepSeek-V4-Flash-0731, obtenidas con el DeepSeek Harness en modo minimal y esfuerzo de razonamiento máximo (temperatura 1,0, top_p 0,95). El harness no se ha publicado, así que ninguna se ha reproducido de forma independiente, y DSBench-FullStack y DSBench-Hard son conjuntos de prueba internos de DeepSeek.
Precios de DeepSeek V4 Flash
Precio de lista del proveedor, por 1M de tokens.
Cómo se comporta DeepSeek V4 Flash en la práctica
Comportamiento observado en ejecuciones de agentes en producción.
Ejecución agéntica
Es justo el objetivo del post-entrenamiento 0731: manejar una terminal, encadenar llamadas a herramientas y terminar una tarea sin humano en el bucle. 82,7 en Terminal-Bench 2.1 y 70,3 en Toolathlon-Verified lo colocan en muy buena compañía para este precio.
Perfil de coste
0,14 $ / 0,28 $ por millón de tokens, aciertos de caché a 0,0028 $ / M y escrituras de caché sin cargo alguno. Es la posición más barata del catálogo actual y en torno a un tercio del precio de salida de V4 Pro, así que es el modelo al que dirigir el trabajo de gran volumen.
Contexto largo
Un millón de tokens de entrada y hasta 384 K de salida, así que la lectura de un repositorio completo o de transcripciones largas cabe sin trocear. La calidad en bucles agénticos largos y de muchos pasos sigue por detrás de V4 Pro.
Profundidad de razonamiento
Tres niveles de reasoning_effort — low, high y max — intercambian latencia por deliberación, y las puntuaciones publicadas por DeepSeek son todas con max. El razonamiento de nivel doctoral no es su fuerte; ahí siguen por delante Claude Opus 5 y GPT 5.6 Sol.
Modalidades
Solo texto y código. En cuanto entra una captura de pantalla, un PDF escaneado o un gráfico, hace falta un modelo con visión como Claude Sonnet 4.6 o GPT 5.6 Luna.
Mejores tareas para DeepSeek V4 Flash
Agentes de código de gran volumen
Revisión masiva de PR, escritura de pruebas, pasadas de lint y corrección y refactorizaciones programadas, donde el mismo agente se ejecuta cientos de veces al día. A 0,28 $ por millón de tokens de salida, el coste por ejecución se mantiene tan bajo que el volumen deja de ser la restricción.
Automatización con terminal y herramientas
Los mejores resultados publicados de la compilación 0731 son en trabajo de terminal y uso de herramientas, que es exactamente lo que hace todo el día un agente de arreglo de builds, verificación de despliegues o triaje de logs.
Lectura de todo el repositorio
Una ventana de un millón de tokens admite un repositorio mediano completo, una cronología larga de incidentes o un conjunto entero de documentos de diseño en una sola pasada, de modo que un agente de migración o auditoría puede razonar sobre el conjunto en lugar de trozo a trozo.
La capa barata bajo un orquestador de frontera
Deja que Claude Opus 5 o GPT 5.6 Sol planifiquen y revisen, y pasa a V4 Flash los muchos pasos mecánicos: leer archivos, ejecutar comandos, redactar parches. Solo pagas la tarifa de frontera en los pasos que deciden la ejecución.
Cuándo evitar DeepSeek V4 Flash
Deja fuera a V4 Flash en cualquier cosa con imágenes de por medio, ya que no tiene visión, y en razonamiento de nivel doctoral, donde los modelos de frontera siguen claramente por delante. Las ejecuciones largas que deben mantener la coherencia durante horas siguen siendo terreno de V4 Pro y Claude Opus. Y trata las puntuaciones agénticas publicadas como afirmaciones del proveedor mientras no se publique el DeepSeek Harness: mídelas en tu propio repositorio antes de mover allí un agente de producción.
DeepSeek V4 Flash vs otros modelos
DeepSeek V4 Flash vs DeepSeek V4 Pro
Misma familia, compromiso inverso. Pro es el buque insignia de 1,6 T con 49 B activos por token; Flash activa 13 B y cuesta un tercio del precio de salida de Pro. En los benchmarks agénticos publicados por DeepSeek, la compilación 0731 de Flash ya supera a V4 Pro (Preview) en los nueve, así que el motivo para elegir Pro es la profundidad en razonamiento largo de muchos pasos, no el rendimiento agéntico. V4 Pro ya no se ofrece en VM0: su página aquí es material de referencia.
DeepSeek V4 Flash vs GPT 5.6 Luna
Ambos son el nivel barato de su familia y ambos funcionan sobre el framework Codex. Luna es multimodal y viene respaldado por el ecosistema de OpenAI; Flash es solo texto, de pesos abiertos, cuesta menos de una cuarta parte del precio de salida de Luna y presenta puntuaciones agénticas publicadas mucho más altas. Elige Luna si necesitas visión o comportamientos propios de OpenAI, y Flash cuando el trabajo sea código y herramientas.
DeepSeek V4 Flash vs Claude Sonnet 4.6
Sonnet 4.6 es un modelo de agente central con visión, el framework Claude Code y la fiabilidad de Anthropic en el enrutamiento de herramientas; Flash es un modelo de ahorro, solo texto, a alrededor de una cincuentava parte del precio de salida de Sonnet. Deja a Sonnet en los pasos que deciden una ejecución y dale a Flash el volumen que hay debajo.
Conclusión: ¿deberías usar DeepSeek V4 Flash?
DeepSeek V4 Flash es la forma más barata de ejecutar un agente de código competente en VM0: benchmarks agénticos cercanos a la frontera, ventana de un millón de tokens y 0,28 $ por millón de tokens de salida. Verifica las cifras del proveedor en tu propio repositorio, deja la visión y el razonamiento más difícil en otro sitio, y resulta difícil de superar en coste por tarea completada.
Preguntas frecuentes
¿Cuál es la ventana de contexto de DeepSeek V4 Flash?
Un millón de tokens de entrada y hasta 384 K tokens de salida por respuesta. DeepSeek recomienda el techo completo de 384 K de salida en los niveles de esfuerzo high y max.
¿Cuánto cuesta DeepSeek V4 Flash?
El precio de lista del proveedor es de 0,14 $ por millón de tokens de entrada y 0,28 $ por millón de salida, con aciertos de caché a 0,0028 $ por millón y sin cargo por escrituras de caché. En VM0 está en el nivel de precio $, el más barato de los cuatro. DeepSeek ha anunciado una política de horas punta que duplicaría sus propios precios de lista entre las 9:00–12:00 y las 14:00–18:00 hora de Pekín; todavía no ha entrado en vigor.
¿Es DeepSeek V4 Flash mejor que DeepSeek V4 Pro?
En los nueve benchmarks agénticos que DeepSeek publicó para la compilación 0731, sí: puntúa más alto que V4 Pro (Preview) en todos, activando 13 B de parámetros frente a los 49 B de Pro. Pro conserva la ventaja en razonamiento largo de muchos pasos. V4 Pro ya no se ofrece en VM0.
¿DeepSeek V4 Flash admite visión?
No. Solo acepta texto y código. Envía los pasos basados en capturas, gráficos o PDF a un modelo multimodal como Claude Sonnet 4.6 o GPT 5.6 Luna.
¿Qué framework usa DeepSeek V4 Flash en VM0?
Codex. VM0 lo enruta a través de la API Responses de DeepSeek, que ahora mismo solo admite V4 Flash entre los modelos de DeepSeek. Puedes ejecutarlo como modelo Built-in facturado en créditos VM0 o traer tu propia clave de API de DeepSeek.
Alternativas
Usar DeepSeek V4 Flash en VM0
Dos formas de acceder a DeepSeek V4 Flash en VM0
VM0 admite DeepSeek V4 Flash como modelo Built-in facturado en créditos VM0 y también mediante bring-your-own con una DeepSeek API key. La vía Built-in usa el enrutamiento VM0 Managed y el nivel de precio que se explica abajo; la vía bring-your-own te factura directamente el proveedor original y se salta por completo la conversión a créditos VM0.
Recomendación de VM0
VM0 posiciona DeepSeek V4 Flash como una opción de ahorro en lugar de un modelo principal de agente. Úsalo para optimizar el coste unitario en trabajo no principal, como clasificación masiva, prefiltros, respuestas cortas con requisitos de latencia o agentes heredados fijos, manteniendo Claude Opus 4.7, Claude Opus 4.6 o Claude Sonnet 4.6 en los pasos que deciden la ejecución.
Créditos y el nivel de precio $
VM0 sitúa cada modelo Built-in en una escala de créditos de cuatro niveles — $, $$, $$$, $$$$ — que aparece como distintivo en el selector de modelos y en la línea price tier de zero model ls. DeepSeek V4 Flash está en $. Ese nivel es lo que se descuenta de tu saldo de créditos VM0; el precio de lista del proveedor en la tabla de arriba es lo que cobra el proveedor original antes de que VM0 lo convierta en créditos.
Disponible en VM0 desde July 31, 2026.