Tutti i modelli

DeepSeek V4 Flash su VM0. Coding agentico nella fascia di prezzo più bassa

Il modello Mixture-of-Experts open-weight di DeepSeek: 284 miliardi di parametri con 13 miliardi attivi per token. La build 0731 batte V4 Pro in ogni benchmark agentico pubblicato da DeepSeek, a 0,14 $ / 0,28 $ per milione di token.

1M tokens · Text / Code · Prompt cache

DeepSeek V4 Flash è la metà efficiente della generazione V4 di DeepSeek: un modello Mixture-of-Experts da 284 miliardi di parametri che ne attiva 13 miliardi per token, rilasciato con licenza MIT e pesi aperti. La build 0731, uscita il 31 luglio 2026, ha lasciato invariata l'architettura e ha rifatto solo il post-addestramento su dati agentici, superando così DeepSeek V4 Pro (Preview) in tutti e nove i benchmark agentici pubblicati da DeepSeek: 82,7 contro 72,1 su Terminal-Bench 2.1 e 54,4 contro 12,8 su DeepSWE.

Il prezzo di listino è di 0,14 $ / 0,28 $ per milione di token, con cache hit a 0,0028 $ / M e nessun addebito sulle scritture di cache: è il modello di ragionamento più economico dell'attuale offerta VM0. Ha una finestra di contesto da un milione di token, fino a 384 K in output e la modalità di ragionamento attiva per impostazione predefinita. È solo testo: niente vision. Passa a Claude Sonnet 4.6 quando un passaggio richiede immagini o il framework Claude Code, e a GPT 5.6 Luna se vuoi la fascia economica della famiglia OpenAI.

Cos'è DeepSeek V4 Flash?

31 luglio 2026 (DeepSeek-V4-Flash-0731, beta pubblica) · La metà efficiente della famiglia DeepSeek V4: 13 miliardi di parametri attivi contro i 49 di V4 Pro, post-addestrata per il lavoro agentico.

DeepSeek V4 Flash è comparso il 24 aprile 2026 come la metà più piccola della famiglia V4: un MoE da 284 miliardi di parametri con 13 miliardi attivi per token e una finestra di contesto da un milione di token, accanto al V4 Pro da 1,6 mila miliardi. È uscito dalla preview il 31 luglio 2026 come DeepSeek-V4-Flash-0731, una build in beta pubblica che ha lasciato intatta l'architettura e ha rieseguito solo la fase di post-addestramento, stavolta su dati orientati agli agenti.

Quel ri-addestramento è tutta la storia del rilascio. Secondo i numeri della stessa DeepSeek, la build 0731 batte V4 Pro (Preview) in tutti e nove i benchmark agentici pubblicati pur attivando circa un quarto dei parametri: Terminal-Bench 2.1 passa da 61,8 della preview di Flash a 82,7, DeepSWE da 7,3 a 54,4, Toolathlon-Verified da 49,7 a 70,3. Diversi di questi valori restano a pochi punti da Claude Opus 4.8 — 82,7 contro 85,0 su Terminal-Bench 2.1, 25,2 contro 25,7 su Agents' Last Exam — a una frazione del prezzo.

Vale la pena dire chiaramente i limiti. Tutti i punteggi sono dichiarati da DeepSeek ed eseguiti con il DeepSeek Harness, che non è stato rilasciato: nessuno è quindi stato riprodotto in modo indipendente, e due dei nove set sono interni a DeepSeek. Il modello è solo testo, resta indietro rispetto alla frontiera sul ragionamento di livello dottorale ed è ancora dietro a V4 Pro sui compiti lunghi a più passaggi. La modalità di ragionamento è attiva per impostazione predefinita e i token di ragionamento sono fatturati come output.

Cosa rende notevole DeepSeek V4 Flash

Caratteristiche principali di architettura e capacità.

V4 Flash è un modello Mixture-of-Experts sparso: 284 miliardi di parametri totali con 13 miliardi attivati per token, dove ogni livello MoE ha 1 esperto condiviso e 256 esperti instradati con dimensione intermedia 2048, e 6 esperti instradati si attivano per token. I primi tre livelli MoE usano routing per hash e la profondità di predizione multi-token è 1. Il checkpoint 0731 pubblicato arriva a 304 miliardi di parametri perché include un modulo draft per il decoding speculativo sopra la base da 284 miliardi. Supporta una finestra di contesto da un milione di token con output fino a 384 K, modalità con e senza ragionamento e un parametro reasoning_effort con i livelli low, high e max. I pesi sono sotto licenza MIT e liberamente accessibili.

Specifiche in breve

FamigliaSerie DeepSeek V4 (Flash)
Parametri284 mld totali / 13 mld attivi (MoE)
ModalitàTesto, codice (niente vision)
LicenzaMIT, pesi aperti
Caching dei promptSupportato (DeepSeek)
Finestra di contesto1 mln di token
Output massimoFino a 384 K token
Sforzo di ragionamentoLow / High / Max
Prezzo di listino del fornitore0,14 $ input / 0,28 $ output per milione

Benchmark di DeepSeek V4 Flash

Valori dichiarati da DeepSeek nella scheda del modello DeepSeek-V4-Flash-0731, ottenuti con il DeepSeek Harness in modalità minimal e sforzo di ragionamento massimo (temperatura 1,0, top_p 0,95). L'harness non è stato rilasciato, quindi nessuno di questi risultati è stato riprodotto in modo indipendente; DSBench-FullStack e DSBench-Hard sono set di test interni a DeepSeek.

Terminal-Bench 2.1lavoro agentico da terminale; V4 Pro (Preview) 72,1
82,7
SWE-bench Verifiedbuild preview, dato del fornitore
79,0 %
Cybergymdato del fornitore
76,7
Toolathlon (verified)uso di strumenti; V4 Pro (Preview) 55,9
70,3
DSBench-FullStackset interno DeepSeek
68,7
DSBench-Hardset interno DeepSeek
59,6
DeepSWEda 7,3 della build preview
54,4
NL2Repocostruzione di repository
54,2
Agents' Last ExamClaude Opus 4.8 ottiene 25,7
25,2

Prezzi di DeepSeek V4 Flash

Prezzo di listino del provider, per 1M di token.

Input$0.14
Output$0.28
Lettura cache$0.003
Scrittura cacheNon fatturato

Come si comporta DeepSeek V4 Flash nella pratica

Comportamento osservato dalle esecuzioni di agenti in produzione.

Esecuzione agentica

È esattamente l'obiettivo del post-addestramento 0731: guidare un terminale, chiamare strumenti in sequenza e portare a termine un compito senza una persona nel ciclo. 82,7 su Terminal-Bench 2.1 e 70,3 su Toolathlon-Verified lo mettono in ottima compagnia per questo prezzo.

Profilo di costo

0,14 $ / 0,28 $ per milione di token, cache hit a 0,0028 $ / M e scritture di cache non fatturate. È la posizione più economica dell'offerta attuale e circa un terzo del prezzo di output di V4 Pro: il modello a cui affidare il lavoro ad alto volume.

Contesto lungo

Un milione di token in ingresso e fino a 384 K in uscita: la lettura di un intero repository o di lunghe trascrizioni entra senza spezzettare. La qualità sui cicli agentici lunghi e a molti passaggi resta dietro a V4 Pro.

Profondità di ragionamento

Tre livelli di reasoning_effortlow, high e max — scambiano latenza con riflessione, e i punteggi pubblicati da DeepSeek sono tutti a max. Il ragionamento di livello dottorale non è il suo forte: lì restano avanti Claude Opus 5 e GPT 5.6 Sol.

Modalità

Solo testo e codice. Appena entrano in gioco uno screenshot, un PDF scansionato o un grafico serve un modello con vision come Claude Sonnet 4.6 o GPT 5.6 Luna.

I migliori task per agenti con DeepSeek V4 Flash

Agenti di coding ad alto volume

Revisione di PR in blocco, scrittura di test, passaggi di lint-e-fix e refactoring pianificati, dove lo stesso agente gira centinaia di volte al giorno. A 0,28 $ per milione di token in output il costo per esecuzione resta abbastanza basso da togliere al volume il ruolo di vincolo.

Automazione guidata da terminale e strumenti

I risultati pubblicati più forti della build 0731 riguardano il lavoro da terminale e l'uso di strumenti, cioè esattamente ciò che fa tutto il giorno un agente che corregge build, verifica deploy o smista log.

Lettura dell'intero repository

Una finestra da un milione di token accoglie un repository di medie dimensioni per intero, una lunga cronologia di incidenti o un set completo di documenti di progettazione in un solo passaggio, così un agente di migrazione o audit può ragionare sull'insieme anziché pezzo per pezzo.

Lo strato economico sotto un orchestratore di frontiera

Lascia pianificare e rivedere a Claude Opus 5 o GPT 5.6 Sol e affida a V4 Flash i molti passaggi meccanici: leggere file, eseguire comandi, abbozzare patch. La tariffa di frontiera la paghi solo sui passaggi che decidono l'esito.

Quando evitare DeepSeek V4 Flash

Lascia fuori V4 Flash da tutto ciò che coinvolge immagini, dato che non ha vision, e dal ragionamento di livello dottorale, dove i modelli di frontiera restano nettamente avanti. Le esecuzioni lunghe che devono restare coerenti per ore rimangono territorio di V4 Pro e Claude Opus. E tratta i punteggi agentici pubblicati come dichiarazioni del fornitore finché il DeepSeek Harness non esce: misurali sul tuo repository prima di spostarci un agente di produzione.

DeepSeek V4 Flash vs altri modelli

DeepSeek V4 Flash vs DeepSeek V4 Pro

Stessa famiglia, compromesso opposto. Pro è l'ammiraglia da 1,6 mila miliardi con 49 miliardi attivi per token; Flash ne attiva 13 miliardi e costa un terzo del prezzo di output di Pro. Nei benchmark agentici pubblicati da DeepSeek la build 0731 di Flash supera ormai V4 Pro (Preview) in tutti e nove, quindi la ragione per scegliere Pro è la profondità sul ragionamento lungo a più passaggi, non la produttività agentica. V4 Pro non è più offerto su VM0: la sua pagina qui è materiale di riferimento.

DeepSeek V4 Flash vs GPT 5.6 Luna

Entrambi sono la fascia economica della loro famiglia ed entrambi girano sul framework Codex. Luna è multimodale e sostenuto dall'ecosistema OpenAI; Flash è solo testo, open-weight, costa meno di un quarto del prezzo di output di Luna e mostra punteggi agentici pubblicati molto più alti. Scegli Luna se ti serve la vision o un comportamento specifico di OpenAI, Flash quando il lavoro è codice e strumenti.

DeepSeek V4 Flash vs Claude Sonnet 4.6

Sonnet 4.6 è un modello agentico centrale con vision, il framework Claude Code e l'affidabilità di Anthropic nel routing degli strumenti; Flash è un modello di risparmio, solo testo, a circa un cinquantesimo del prezzo di output di Sonnet. Tieni Sonnet sui passaggi che decidono un'esecuzione e dai a Flash il volume sottostante.

In sintesi: dovresti usare DeepSeek V4 Flash?

DeepSeek V4 Flash è il modo più economico di far girare un agente di coding capace su VM0: benchmark agentici vicini alla frontiera, finestra da un milione di token e 0,28 $ per milione di token in output. Verifica i numeri del fornitore sul tuo repository, lascia altrove la vision e il ragionamento più difficile, e sul costo per attività completata è difficile da battere.

Domande frequenti

Qual è la finestra di contesto di DeepSeek V4 Flash?

Un milione di token in ingresso e fino a 384 K token di output per risposta. DeepSeek consiglia il tetto pieno di 384 K in output ai livelli di sforzo high e max.

Quanto costa DeepSeek V4 Flash?

Il prezzo di listino del fornitore è di 0,14 $ per milione di token in ingresso e 0,28 $ per milione in uscita, con cache hit a 0,0028 $ per milione e nessun addebito sulle scritture di cache. Su VM0 rientra nella fascia di prezzo $, la più economica delle quattro. DeepSeek ha annunciato una politica di ore di punta che raddoppierebbe i propri prezzi di listino tra le 9:00–12:00 e le 14:00–18:00 ora di Pechino; non è ancora in vigore.

DeepSeek V4 Flash è migliore di DeepSeek V4 Pro?

Sui nove benchmark agentici che DeepSeek ha pubblicato per la build 0731 sì: ottiene punteggi più alti di V4 Pro (Preview) in ognuno, pur attivando 13 miliardi di parametri contro i 49 di Pro. Pro mantiene il vantaggio sul ragionamento lungo a più passaggi. V4 Pro non è più offerto su VM0.

DeepSeek V4 Flash supporta la vision?

No. Accetta solo testo e codice. Instrada i passaggi basati su screenshot, grafici o PDF verso un modello multimodale come Claude Sonnet 4.6 o GPT 5.6 Luna.

Quale framework usa DeepSeek V4 Flash su VM0?

Codex. VM0 lo instrada tramite la Responses API di DeepSeek, che al momento è supportata solo da V4 Flash tra i modelli DeepSeek. Puoi eseguirlo come modello Built-in fatturato in crediti VM0 oppure portare la tua chiave API DeepSeek.

Alternative

Usare DeepSeek V4 Flash su VM0

Due modi per accedere a DeepSeek V4 Flash su VM0

VM0 supporta DeepSeek V4 Flash come modello Built-in fatturato in crediti VM0 e tramite bring-your-own con una DeepSeek API key. Il percorso Built-in usa il routing VM0 Managed e la fascia di prezzo spiegata qui sotto; il percorso bring-your-own ti fa fatturare direttamente dal fornitore a monte e salta del tutto la conversione in crediti VM0.

La raccomandazione di VM0

VM0 posiziona DeepSeek V4 Flash come opzione per risparmiare sui costi anziché come modello agente core. Usalo per ottimizzare il costo unitario sul lavoro non-core, come classificazione in blocco, pre-filtri, risposte brevi critiche per la latenza o agenti legacy fissati, mantenendo Claude Opus 4.7, Claude Opus 4.6 o Claude Sonnet 4.6 sui passi che decidono l'esecuzione.

Crediti e la fascia di prezzo $

VM0 colloca ogni modello Built-in su una scala di crediti a quattro fasce — $, $$, $$$, $$$$ — mostrata come badge nel selettore dei modelli e sulla riga price tier di zero model ls. DeepSeek V4 Flash si trova a $. È questa fascia a determinare quanto viene scalato dal tuo saldo di crediti VM0; il prezzo di listino del fornitore nella tabella qui sopra è quanto addebita il provider a monte prima che VM0 lo converta in crediti.

Disponibile su VM0 dal July 31, 2026.