DeepSeek-V4-Flash bringt das 1-Million-Token-Kontextfenster der V4-Generation in einen deutlich kleineren, schnelleren Rahmen. Mit 284 Milliarden Parametern total und nur 13 Milliarden aktiven Parametern pro Token liefert Flash Reasoning nahe V4-Pro – bei höherem Durchsatz und geringeren Kosten. Ideal für produktive Inferenz mit langem Kontext, wenn nicht die absolute Spitzenqualität, sondern das Preis-Leistungs-Verhältnis zählt.
DeepSeek-V4-Flash
DeepSeek AI
April 2026
MIT (Open Source)
MoE, kosteneffiziente V4-Variante, drei Reasoning-Modi
284 Mrd. total (13 Mrd. aktiv pro Token)
4-Attention-Familie (CSA + HCA), mHC, Muon-Optimizer, text-only
1.000.000 Token
Offizielle Angaben aus der DeepSeek-V4 Model-Card, gemessen im Modus Think Max:
| Benchmark | DeepSeek-V4-Flash | Kategorie |
|---|---|---|
| MMLU-Pro | 86,2 | Wissen |
| GPQA Diamond | 88,1 | Wissen/Reasoning |
| LiveCodeBench | 91,6 | Coding |
| SWE-bench Verified | 79,0 | Coding |
| HMMT 2026 Feb | 94,8 | Mathematik |
| Terminal Bench 2.0 | 56,9 | Terminal-Agenten |
Quelle: offizielle DeepSeek-V4 Model-Card. Werte im Modus Think Max. Im Standardmodus deutlich niedriger.
Flash oder Pro? Wir helfen Ihnen, das richtige Verhältnis aus Kosten, Geschwindigkeit und Reasoning-Tiefe zu finden.
V4-Flash nutzt dieselbe hybride Attention-Familie wie V4-Pro (Compressed und Heavily Compressed Attention mit Token-Kompression), ist aber deutlich kompakter dimensioniert.
Für kostenbewusste Produktions-Workloads mit langem Kontext.
Günstiger und schneller als V4-Pro
Voller 1-Million-Token-Kontext
Auf einem Node realistischer betreibbar
Offen unter MIT-Lizenz
Schwächer als V4-Pro bei Spitzen-Reasoning
Nicht multimodal (text-only)
Bei reinem Faktenwissen und komplexesten Agenten-Workflows hinter V4-Pro
Wir dimensionieren DeepSeek-V4-Flash für Ihren Durchsatz und übernehmen Betrieb und Skalierung – DSGVO-konform aus dem deutschen Rechenzentrum.