DeepSeek V4 Flash na VM0. Programação agêntica na faixa de preço mais barata
O modelo Mixture-of-Experts de pesos abertos da DeepSeek: 284 bilhões de parâmetros com 13 bilhões ativos por token. A build 0731 supera o V4 Pro em todos os benchmarks agênticos publicados pela DeepSeek, a US$ 0,14 / US$ 0,28 por milhão de tokens.
1M tokens · Text / Code · Prompt cache
O DeepSeek V4 Flash é a metade eficiente da geração V4 da DeepSeek: um modelo Mixture-of-Experts de 284 bilhões de parâmetros que ativa 13 bilhões por token, lançado sob a licença MIT com pesos abertos. A build 0731, publicada em 31 de julho de 2026, manteve a arquitetura e refez apenas o pós-treinamento com dados agênticos, o que a levou a superar o DeepSeek V4 Pro (Preview) nos nove benchmarks agênticos divulgados pela DeepSeek — 82,7 contra 72,1 no Terminal-Bench 2.1 e 54,4 contra 12,8 no DeepSWE.
O preço de tabela é de US$ 0,14 / US$ 0,28 por milhão de tokens, com acertos de cache a US$ 0,0028 / M e sem cobrança pelas gravações de cache, o que o torna o modelo de raciocínio mais barato do catálogo atual da VM0. Traz janela de contexto de um milhão de tokens, até 384 K de saída e o modo de raciocínio ligado por padrão. É só texto: sem visão. Prefira o Claude Sonnet 4.6 quando a etapa exigir imagens ou o framework Claude Code, e o GPT 5.6 Luna se quiser a faixa econômica da família OpenAI.
O que é o DeepSeek V4 Flash?
31 de julho de 2026 (DeepSeek-V4-Flash-0731, beta pública) · A metade eficiente da família DeepSeek V4: 13 bilhões de parâmetros ativos contra os 49 bilhões do V4 Pro, pós-treinada para trabalho agêntico.
O DeepSeek V4 Flash surgiu em 24 de abril de 2026 como a metade menor da família V4 — um MoE de 284 bilhões de parâmetros com 13 bilhões ativos por token e janela de contexto de um milhão de tokens, ao lado do V4 Pro de 1,6 trilhão. Saiu da preview em 31 de julho de 2026 como DeepSeek-V4-Flash-0731, uma build em beta pública que deixou a arquitetura intocada e refez apenas a etapa de pós-treinamento, desta vez com dados voltados a agentes.
Esse retreinamento é toda a história do lançamento. Pelos números da própria DeepSeek, a build 0731 supera o V4 Pro (Preview) nos nove benchmarks agênticos divulgados mesmo ativando cerca de um quarto dos parâmetros: o Terminal-Bench 2.1 vai de 61,8 na preview do Flash para 82,7, o DeepSWE de 7,3 para 54,4 e o Toolathlon-Verified de 49,7 para 70,3. Vários desses valores ficam a poucos pontos do Claude Opus 4.8 — 82,7 contra 85,0 no Terminal-Bench 2.1, 25,2 contra 25,7 no Agents' Last Exam — por uma fração do preço.
Vale dizer as ressalvas com clareza. Todas as notas são reportadas pela DeepSeek e obtidas com o DeepSeek Harness, que não foi publicado, então nenhuma foi reproduzida de forma independente, e dois dos nove conjuntos são internos da DeepSeek. O modelo é só texto, fica atrás da fronteira em raciocínio de nível de pós-graduação e ainda perde para o V4 Pro em tarefas longas de muitas etapas. O modo de raciocínio vem ligado por padrão e os tokens de raciocínio são cobrados como saída.
O que se destaca no DeepSeek V4 Flash
Principais recursos de arquitetura e capacidade.
O V4 Flash é um modelo Mixture-of-Experts esparso: 284 bilhões de parâmetros no total, com 13 bilhões ativados por token, em que cada camada MoE tem 1 especialista compartilhado e 256 especialistas roteados com dimensão intermediária de 2048, e 6 especialistas roteados são acionados por token. As três primeiras camadas MoE usam roteamento por hash e a profundidade de predição multi-token é 1. O checkpoint 0731 publicado chega a 304 bilhões de parâmetros porque traz um módulo de rascunho para decodificação especulativa sobre a base de 284 bilhões. Suporta janela de contexto de um milhão de tokens com até 384 K de saída, modos com e sem raciocínio e um parâmetro reasoning_effort com os níveis low, high e max. Os pesos estão sob licença MIT e sem restrição de acesso.
Especificações em resumo
Benchmarks do DeepSeek V4 Flash
Números reportados pela DeepSeek no cartão do modelo DeepSeek-V4-Flash-0731, obtidos com o DeepSeek Harness em modo minimal e esforço de raciocínio máximo (temperatura 1,0, top_p 0,95). O harness não foi publicado, então nenhum desses resultados foi reproduzido de forma independente; DSBench-FullStack e DSBench-Hard são conjuntos de teste internos da DeepSeek.
Preços do DeepSeek V4 Flash
Preço de tabela do provedor, por 1M de tokens.
Como o DeepSeek V4 Flash se comporta na prática
Comportamento observado em execuções de agentes em produção.
Execução agêntica
É exatamente o alvo do pós-treinamento 0731: operar um terminal, encadear chamadas de ferramentas e concluir uma tarefa sem humano no circuito. 82,7 no Terminal-Bench 2.1 e 70,3 no Toolathlon-Verified o colocam em ótima companhia para esse preço.
Perfil de custo
US$ 0,14 / US$ 0,28 por milhão de tokens, acertos de cache a US$ 0,0028 / M e gravações de cache sem cobrança alguma. É a posição mais barata do catálogo atual e cerca de um terço do preço de saída do V4 Pro, então é o modelo para apontar ao trabalho de alto volume.
Contexto longo
Um milhão de tokens de entrada e até 384 K de saída, de modo que a leitura de um repositório inteiro ou de transcrições longas cabe sem fatiar. A qualidade em ciclos agênticos longos e de muitas etapas ainda fica atrás do V4 Pro.
Profundidade de raciocínio
Três níveis de reasoning_effort — low, high e max — trocam latência por deliberação, e as notas publicadas pela DeepSeek são todas em max. Raciocínio de nível de pós-graduação não é seu forte; aí Claude Opus 5 e GPT 5.6 Sol seguem à frente.
Modalidades
Apenas texto e código. Quando entra uma captura de tela, um PDF digitalizado ou um gráfico, é preciso um modelo com visão como Claude Sonnet 4.6 ou GPT 5.6 Luna.
Melhores tarefas de agente para o DeepSeek V4 Flash
Agentes de código de alto volume
Revisão de PRs em massa, escrita de testes, passagens de lint e correção e refatorações agendadas, em que o mesmo agente roda centenas de vezes por dia. A US$ 0,28 por milhão de tokens de saída, o custo por execução fica baixo o bastante para o volume deixar de ser a restrição.
Automação por terminal e ferramentas
Os melhores resultados publicados da build 0731 são em trabalho de terminal e uso de ferramentas — exatamente o que um agente de correção de build, verificação de deploy ou triagem de logs faz o dia inteiro.
Leitura do repositório inteiro
Uma janela de um milhão de tokens comporta um repositório de porte médio completo, uma longa linha do tempo de incidente ou um conjunto inteiro de documentos de projeto em uma única passagem, permitindo que um agente de migração ou auditoria raciocine sobre o todo em vez de pedaço por pedaço.
A camada barata sob um orquestrador de fronteira
Deixe Claude Opus 5 ou GPT 5.6 Sol planejar e revisar e entregue ao V4 Flash as muitas etapas mecânicas: ler arquivos, rodar comandos, rascunhar patches. Você paga a tarifa de fronteira só nas etapas que decidem a execução.
Quando dispensar o DeepSeek V4 Flash
Deixe o V4 Flash de fora de qualquer coisa com imagens no circuito, já que ele não tem visão, e do raciocínio de nível de pós-graduação, onde os modelos de fronteira seguem claramente à frente. Execuções longas que precisam manter coerência por horas continuam sendo território do V4 Pro e do Claude Opus. E trate as notas agênticas publicadas como afirmações do fornecedor enquanto o DeepSeek Harness não sair: meça no seu próprio repositório antes de mover para lá um agente de produção.
DeepSeek V4 Flash vs outros modelos
DeepSeek V4 Flash vs DeepSeek V4 Pro
Mesma família, troca inversa. O Pro é a nau capitânia de 1,6 trilhão com 49 bilhões ativos por token; o Flash ativa 13 bilhões e custa um terço do preço de saída do Pro. Nos benchmarks agênticos publicados pela DeepSeek, a build 0731 do Flash já supera o V4 Pro (Preview) em todos os nove, então o argumento a favor do Pro é profundidade em raciocínio longo de muitas etapas, não vazão agêntica. O V4 Pro não é mais oferecido na VM0 — a página aqui é material de referência.
DeepSeek V4 Flash vs GPT 5.6 Luna
Ambos são a faixa barata de sua família e ambos rodam no framework Codex. O Luna é multimodal e apoiado pelo ecossistema da OpenAI; o Flash é só texto, de pesos abertos, custa menos de um quarto do preço de saída do Luna e apresenta notas agênticas publicadas bem mais altas. Escolha o Luna quando precisar de visão ou de comportamentos específicos da OpenAI, e o Flash quando o trabalho for código e ferramentas.
DeepSeek V4 Flash vs Claude Sonnet 4.6
O Sonnet 4.6 é um modelo agêntico central com visão, o framework Claude Code e a confiabilidade da Anthropic no roteamento de ferramentas; o Flash é um modelo de economia, só texto, a cerca de um cinquentavo do preço de saída do Sonnet. Mantenha o Sonnet nas etapas que decidem uma execução e dê ao Flash o volume abaixo dela.
Conclusão: você deveria usar o DeepSeek V4 Flash?
O DeepSeek V4 Flash é a forma mais barata de rodar um agente de código competente na VM0: benchmarks agênticos próximos da fronteira, janela de um milhão de tokens e US$ 0,28 por milhão de tokens de saída. Verifique os números do fornecedor no seu próprio repositório, deixe visão e o raciocínio mais difícil para outro modelo, e ele fica difícil de bater em custo por tarefa concluída.
Perguntas frequentes
Qual é a janela de contexto do DeepSeek V4 Flash?
Um milhão de tokens de entrada e até 384 K tokens de saída por resposta. A DeepSeek recomenda o teto completo de 384 K de saída nos níveis de esforço high e max.
Quanto custa o DeepSeek V4 Flash?
O preço de tabela do fornecedor é de US$ 0,14 por milhão de tokens de entrada e US$ 0,28 por milhão de saída, com acertos de cache a US$ 0,0028 por milhão e sem cobrança pelas gravações de cache. Na VM0 ele fica na faixa de preço $, a mais barata das quatro. A DeepSeek anunciou uma política de horário de pico que dobraria seus próprios preços de tabela entre 9h–12h e 14h–18h no horário de Pequim; ainda não entrou em vigor.
O DeepSeek V4 Flash é melhor que o DeepSeek V4 Pro?
Nos nove benchmarks agênticos que a DeepSeek publicou para a build 0731, sim: ele pontua mais que o V4 Pro (Preview) em todos, ativando 13 bilhões de parâmetros contra os 49 bilhões do Pro. O Pro mantém a vantagem em raciocínio longo de muitas etapas. O V4 Pro não é mais oferecido na VM0.
O DeepSeek V4 Flash tem suporte a visão?
Não. Ele aceita apenas texto e código. Direcione etapas baseadas em capturas de tela, gráficos ou PDFs para um modelo multimodal como Claude Sonnet 4.6 ou GPT 5.6 Luna.
Qual framework o DeepSeek V4 Flash usa na VM0?
Codex. A VM0 o roteia pela Responses API da DeepSeek, que hoje só é suportada pelo V4 Flash entre os modelos da DeepSeek. Você pode executá-lo como modelo Built-in cobrado em créditos VM0 ou trazer sua própria chave de API da DeepSeek.
Alternativas
Usando o DeepSeek V4 Flash na VM0
Duas formas de acessar o DeepSeek V4 Flash na VM0
A VM0 oferece o DeepSeek V4 Flash como modelo Built-in cobrado em créditos VM0 e também via bring-your-own com uma DeepSeek API key. O caminho Built-in usa o roteamento VM0 Managed e a faixa de preço explicada abaixo; o caminho bring-your-own cobra direto do fornecedor original e pula por completo a conversão em créditos VM0.
A recomendação da VM0
A VM0 posiciona o DeepSeek V4 Flash como uma opção de economia de custo, e não como um modelo de agente central. Use-o para otimizar o custo unitário em trabalho não central, como classificação em massa, pré-filtros, respostas curtas críticas em latência ou agentes legados fixados, mantendo o Claude Opus 4.7, o Claude Opus 4.6 ou o Claude Sonnet 4.6 nos passos que decidem a execução.
Créditos e a faixa de preço $
A VM0 posiciona todo modelo Built-in em uma escala de créditos de quatro faixas — $, $$, $$$, $$$$ — exibida como selo no seletor de modelos e na linha price tier do zero model ls. DeepSeek V4 Flash fica em $. Essa faixa é o que sai do seu saldo de créditos VM0; o preço de tabela do fornecedor mostrado acima é o que o provedor original cobra antes de a VM0 converter em créditos.
Disponível na VM0 desde July 31, 2026.