DeepSeek V4 Flash di VM0. Coding agentik pada tingkat harga termurah
Model Mixture-of-Experts open-weight dari DeepSeek: 284 miliar parameter dengan 13 miliar aktif per token. Build 0731 mengungguli V4 Pro pada setiap benchmark agentik yang dipublikasikan DeepSeek, dengan harga $0,14 / $0,28 per 1 juta token.
1M tokens · Text / Code · Prompt cache
DeepSeek V4 Flash adalah sisi efisiensi dari generasi V4 DeepSeek: model Mixture-of-Experts berukuran 284 miliar parameter yang mengaktifkan 13 miliar per token, dirilis di bawah Lisensi MIT dengan bobot terbuka. Build 0731 yang dirilis pada 31 Juli 2026 mempertahankan arsitekturnya dan hanya mengulang pasca-pelatihan dengan data agentik, sehingga melampaui DeepSeek V4 Pro (Preview) pada seluruh sembilan benchmark agentik yang dipublikasikan DeepSeek — 82,7 berbanding 72,1 di Terminal-Bench 2.1, dan 54,4 berbanding 12,8 di DeepSWE.
Harga daftar vendor adalah $0,14 / $0,28 per 1 juta token, dengan cache hit $0,0028 / 1 juta dan tanpa biaya untuk penulisan cache, sehingga menjadikannya model penalaran termurah di jajaran VM0 saat ini. Model ini memiliki jendela konteks satu juta token, keluaran hingga 384 K, dan mode berpikir aktif secara bawaan. Hanya teks: tanpa vision. Gunakan Claude Sonnet 4.6 bila sebuah langkah membutuhkan gambar atau framework Claude Code, dan GPT 5.6 Luna bila Anda menginginkan tingkat hemat dari keluarga OpenAI.
Apa itu DeepSeek V4 Flash?
31 Juli 2026 (DeepSeek-V4-Flash-0731, beta publik) · Sisi efisiensi keluarga DeepSeek V4: 13 miliar parameter aktif berbanding 49 miliar milik V4 Pro, dilatih ulang untuk kerja agentik.
DeepSeek V4 Flash pertama muncul pada 24 April 2026 sebagai bagian yang lebih kecil dari keluarga V4 — MoE 284 miliar parameter dengan 13 miliar aktif per token dan jendela konteks satu juta token, berdampingan dengan V4 Pro berukuran 1,6 triliun parameter. Model ini keluar dari preview pada 31 Juli 2026 sebagai DeepSeek-V4-Flash-0731, build beta publik yang membiarkan arsitekturnya utuh dan hanya menjalankan ulang tahap pasca-pelatihan, kali ini dengan data bernuansa agen.
Pelatihan ulang itulah inti dari rilis ini. Menurut angka DeepSeek sendiri, build 0731 mengungguli V4 Pro (Preview) pada seluruh sembilan benchmark agentik yang dipublikasikan meski hanya mengaktifkan sekitar seperempat parameter: Terminal-Bench 2.1 naik dari 61,8 pada preview Flash menjadi 82,7, DeepSWE dari 7,3 menjadi 54,4, dan Toolathlon-Verified dari 49,7 menjadi 70,3. Beberapa angka itu hanya terpaut beberapa poin dari Claude Opus 4.8 — 82,7 berbanding 85,0 di Terminal-Bench 2.1, 25,2 berbanding 25,7 di Agents' Last Exam — dengan harga yang jauh lebih rendah.
Catatannya perlu disampaikan terus terang. Semua skor dilaporkan sendiri oleh DeepSeek dan dijalankan dengan DeepSeek Harness yang belum dirilis, sehingga tidak satu pun telah direproduksi secara independen, dan dua dari sembilan set adalah set internal DeepSeek. Model ini hanya teks, tertinggal dari model terdepan pada penalaran tingkat pascasarjana, dan masih kalah dari V4 Pro pada tugas panjang bertahap banyak. Mode berpikir aktif secara bawaan, dan token berpikir ditagih sebagai keluaran.
Apa yang menonjol dari DeepSeek V4 Flash
Fitur arsitektur dan kapabilitas utama.
V4 Flash adalah model Mixture-of-Experts yang jarang: total 284 miliar parameter dengan 13 miliar diaktifkan per token, di mana setiap lapisan MoE memiliki 1 expert bersama dan 256 expert terrute dengan dimensi antara 2048, dan 6 expert terrute aktif per token. Tiga lapisan MoE pertama memakai hash routing, dan kedalaman prediksi multi-token adalah 1. Checkpoint 0731 yang dipublikasikan berukuran 304 miliar parameter karena menyertakan modul draft untuk speculative decoding di atas basis 284 miliar. Model ini mendukung jendela konteks satu juta token dengan keluaran hingga 384 K, mode berpikir dan non-berpikir, serta parameter reasoning_effort dengan tingkat low, high, dan max. Bobotnya berlisensi MIT dan terbuka tanpa pembatasan.
Spesifikasi sekilas
Benchmark DeepSeek V4 Flash
Angka yang dilaporkan DeepSeek dari kartu model DeepSeek-V4-Flash-0731, dijalankan dengan DeepSeek Harness pada mode minimal dan tingkat penalaran max (temperature 1,0, top_p 0,95). Harness tersebut belum dirilis sehingga tidak satu pun angka ini direproduksi secara independen; DSBench-FullStack dan DSBench-Hard adalah set uji internal DeepSeek.
Harga DeepSeek V4 Flash
Harga daftar vendor, per 1J token.
Bagaimana DeepSeek V4 Flash berperilaku dalam praktik
Perilaku yang diamati dari eksekusi agen produksi.
Eksekusi agentik
Inilah sasaran pasca-pelatihan 0731: mengendalikan terminal, memanggil alat secara berurutan, dan menuntaskan tugas tanpa manusia di dalam alurnya. Skor 82,7 di Terminal-Bench 2.1 dan 70,3 di Toolathlon-Verified menempatkannya di jajaran atas untuk harga sekelas ini.
Profil biaya
$0,14 / $0,28 per 1 juta token, cache hit $0,0028 / 1 juta, dan penulisan cache tidak ditagih sama sekali. Itu posisi termurah di jajaran saat ini dan sekitar sepertiga harga keluaran V4 Pro, sehingga inilah model untuk pekerjaan bervolume besar.
Konteks panjang
Satu juta token masuk dan hingga 384 K keluar, sehingga pembacaan seluruh repositori atau transkrip panjang muat tanpa dipecah. Kualitas pada loop agentik panjang dengan banyak langkah masih di bawah V4 Pro.
Kedalaman penalaran
Tiga tingkat reasoning_effort — low, high, dan max — menukar latensi dengan waktu berpikir, dan seluruh skor yang dipublikasikan DeepSeek diambil pada max. Penalaran tingkat pascasarjana bukan kekuatannya; di sana Claude Opus 5 dan GPT 5.6 Sol tetap unggul.
Modalitas
Hanya teks dan kode. Begitu ada tangkapan layar, PDF hasil pindai, atau grafik dalam alurnya, Anda butuh model vision seperti Claude Sonnet 4.6 atau GPT 5.6 Luna.
Tugas agen terbaik untuk DeepSeek V4 Flash
Agen coding bervolume tinggi
Tinjauan PR massal, penulisan tes, siklus lint-dan-perbaiki, serta refactor terjadwal, di mana agen yang sama berjalan ratusan kali sehari. Dengan $0,28 per 1 juta token keluaran, biaya per eksekusi tetap cukup rendah sehingga volume berhenti menjadi kendala.
Otomasi berbasis terminal dan alat
Hasil terkuat yang dipublikasikan untuk build 0731 ada pada kerja terminal dan penggunaan alat — persis yang dikerjakan sepanjang hari oleh agen perbaikan build, pemeriksaan deployment, atau triase log.
Pembacaan seluruh repositori
Jendela satu juta token menampung satu repositori berukuran menengah secara utuh, linimasa insiden yang panjang, atau satu set lengkap dokumen desain dalam sekali jalan, sehingga agen migrasi atau audit dapat menalar atas keseluruhannya, bukan sepotong-sepotong.
Lapisan murah di bawah orkestrator kelas atas
Biarkan Claude Opus 5 atau GPT 5.6 Sol merencanakan dan meninjau, lalu serahkan banyak langkah mekanis — membaca berkas, menjalankan perintah, menyusun patch — kepada V4 Flash. Tarif kelas atas hanya Anda bayar pada langkah yang menentukan hasil.
Kapan melewatkan DeepSeek V4 Flash
Hindari V4 Flash untuk apa pun yang melibatkan gambar karena ia tidak punya vision, serta untuk penalaran tingkat pascasarjana, di mana model terdepan masih unggul jelas. Eksekusi panjang yang harus tetap koheren berjam-jam masih menjadi wilayah V4 Pro dan Claude Opus. Perlakukan pula skor agentik yang dipublikasikan sebagai klaim vendor selama DeepSeek Harness belum dirilis: ujilah pada repositori Anda sendiri sebelum memindahkan agen produksi ke sana.
DeepSeek V4 Flash vs model lain
DeepSeek V4 Flash vs DeepSeek V4 Pro
Keluarga sama, pertukaran berlawanan. Pro adalah andalan 1,6 triliun parameter dengan 49 miliar aktif per token; Flash mengaktifkan 13 miliar dan berharga sepertiga harga keluaran Pro. Pada benchmark agentik yang dipublikasikan DeepSeek, build 0731 Flash kini mengungguli V4 Pro (Preview) di seluruh sembilan pengujian, sehingga alasan memilih Pro adalah kedalaman penalaran panjang bertahap banyak, bukan throughput agentik. V4 Pro tidak lagi tersedia di VM0 — halamannya di sini hanya bahan rujukan.
DeepSeek V4 Flash vs GPT 5.6 Luna
Keduanya adalah tingkat hemat di keluarganya masing-masing dan sama-sama berjalan di framework Codex. Luna multimodal dan ditopang ekosistem OpenAI; Flash hanya teks, berbobot terbuka, berharga kurang dari seperempat harga keluaran Luna, dan mencatat skor benchmark agentik yang jauh lebih tinggi. Pilih Luna bila Anda butuh vision atau perilaku khas OpenAI, dan Flash bila pekerjaannya kode dan alat.
DeepSeek V4 Flash vs Claude Sonnet 4.6
Sonnet 4.6 adalah model agen inti dengan vision, framework Claude Code, dan keandalan perutean alat dari Anthropic; Flash adalah model hemat biaya yang hanya teks, dengan harga sekitar seperlima puluh harga keluaran Sonnet. Simpan Sonnet untuk langkah yang menentukan hasil, dan berikan volume di bawahnya kepada Flash.
Kesimpulan: haruskah Anda menggunakan DeepSeek V4 Flash?
DeepSeek V4 Flash adalah cara termurah menjalankan agen coding yang kompeten di VM0: benchmark agentik yang mendekati kelas terdepan, jendela satu juta token, dan $0,28 per 1 juta token keluaran. Verifikasi angka vendor pada repositori Anda sendiri, serahkan vision dan penalaran tersulit ke model lain, dan biaya per tugas yang selesai akan sulit ditandingi.
Pertanyaan yang sering diajukan
Berapa jendela konteks DeepSeek V4 Flash?
Satu juta token masukan, dan hingga 384 K token keluaran per respons. DeepSeek menyarankan batas keluaran penuh 384 K pada tingkat penalaran high dan max.
Berapa biaya DeepSeek V4 Flash?
Harga daftar vendor adalah $0,14 per 1 juta token masukan dan $0,28 per 1 juta keluaran, dengan cache hit $0,0028 per 1 juta dan tanpa biaya penulisan cache. Di VM0 model ini berada pada tingkat harga $, termurah di antara empat tingkat. DeepSeek telah mengumumkan kebijakan jam sibuk yang akan menggandakan harga daftar mereka antara pukul 09.00–12.00 dan 14.00–18.00 waktu Beijing; kebijakan itu belum berlaku.
Apakah DeepSeek V4 Flash lebih baik daripada DeepSeek V4 Pro?
Pada sembilan benchmark agentik yang dipublikasikan DeepSeek untuk build 0731, ya: skornya lebih tinggi daripada V4 Pro (Preview) di setiap pengujian, meski hanya mengaktifkan 13 miliar parameter berbanding 49 miliar milik Pro. Pro tetap unggul pada penalaran panjang bertahap banyak. V4 Pro tidak lagi ditawarkan di VM0.
Apakah DeepSeek V4 Flash mendukung vision?
Tidak. Model ini hanya menerima teks dan kode. Arahkan langkah berbasis tangkapan layar, grafik, atau PDF ke model multimodal seperti Claude Sonnet 4.6 atau GPT 5.6 Luna.
Framework apa yang dipakai DeepSeek V4 Flash di VM0?
Codex. VM0 meruteakannya melalui Responses API milik DeepSeek, yang saat ini hanya didukung oleh V4 Flash di antara model-model DeepSeek. Jalankan sebagai model Built-in yang ditagih dalam kredit VM0, atau bawa kunci API DeepSeek Anda sendiri.
Alternatif
Menggunakan DeepSeek V4 Flash di VM0
Dua cara mengakses DeepSeek V4 Flash di VM0
VM0 mendukung DeepSeek V4 Flash sebagai model Built-in yang ditagih dalam kredit VM0, dan melalui bring-your-own dengan DeepSeek API key. Jalur Built-in memakai perutean VM0 Managed dan tingkat harga yang dijelaskan di bawah; jalur bring-your-own menagih Anda langsung dari vendor hulu dan sepenuhnya melewati konversi kredit VM0.
Rekomendasi VM0
VM0 memposisikan DeepSeek V4 Flash sebagai opsi penghemat biaya alih-alih model agen inti. Gunakan untuk mengoptimalkan biaya satuan pada pekerjaan non-inti, seperti klasifikasi massal, pra-filter, balasan singkat yang kritis terhadap latensi, atau agen lawas yang di-pin, sambil tetap menjaga Claude Opus 4.7, Claude Opus 4.6, atau Claude Sonnet 4.6 pada langkah-langkah yang menentukan eksekusi.
Kredit dan tingkat harga $
VM0 menempatkan setiap model Built-in pada skala kredit empat tingkat — $, $$, $$$, $$$$ — yang muncul sebagai lencana di pemilih model dan pada baris price tier di zero model ls. DeepSeek V4 Flash berada di $. Tingkat inilah yang dipotong dari saldo kredit VM0 Anda; harga daftar vendor pada tabel di atas adalah tarif yang ditagihkan penyedia hulu sebelum VM0 mengonversinya menjadi kredit.
Tersedia di VM0 sejak July 31, 2026.