DeepSeek-V4-Flash bringt das 1-Million-Token-Kontextfenster der V4-Generation in einen deutlich kleineren, schnelleren Rahmen. Mit 284 Milliarden Parametern total und nur 13 Milliarden aktiven Parametern pro Token liefert Flash Reasoning nahe V4-Pro – bei höherem Durchsatz und geringeren Kosten. Ideal für produktive Inferenz mit langem Kontext, wenn nicht die absolute Spitzenqualität, sondern das Preis-Leistungs-Verhältnis zählt.
DeepSeek-V4-Flash
DeepSeek AI
April 2026
MIT (Open Source)
MoE, schnelle/kosteneffiziente Variante mit Reasoning
284 Mrd. total (13 Mrd. aktiv pro Token)
V4-Attention-Familie (CSA/HCA + DSA), text-only
1.000.000 Token
Flash oder Pro? Wir helfen Ihnen, das richtige Verhältnis aus Kosten, Geschwindigkeit und Reasoning-Tiefe zu finden.
V4-Flash nutzt dieselbe V4-Attention-Familie wie V4-Pro (Compressed/Heavily Compressed Attention plus DSA mit Token-Kompression), ist aber deutlich kompakter dimensioniert.
Damit lässt sich das 1M-Kontextfenster realistischer auf einem einzelnen Multi-GPU-Node betreiben – ein pragmatischer Mittelweg für produktive Long-Context-Anwendungen.
Für kostenbewusste Produktions-Workloads mit langem Kontext.
Günstiger und schneller als V4-Pro
Voller 1-Million-Token-Kontext
Auf einem Node realistischer betreibbar
Offen unter MIT-Lizenz
Schwächer als V4-Pro bei Spitzen-Reasoning
Nicht multimodal (text-only)
Weniger detaillierte offizielle Benchmarks
Wir dimensionieren DeepSeek-V4-Flash für Ihren Durchsatz und übernehmen Betrieb und Skalierung – DSGVO-konform aus dem deutschen Rechenzentrum.