DeepSeek-V4-Pro ist das Flaggschiff der V4-Generation: ein 1,6-Billionen-Parameter-MoE mit nur 49 Milliarden aktiven Parametern pro Token und einem Standard-Kontextfenster von einer Million Token. Eine hybride Attention aus Compressed Sparse Attention und Heavily Compressed Attention macht diesen riesigen Kontext praktikabel: Bei 1 Million Token benötigt V4-Pro nur 27 % der Inferenz-FLOPs und 10 % des KV-Caches von DeepSeek-V3.2.
DeepSeek-V4-Pro (Preview)
DeepSeek AI
April 2026
MIT (Open Source)
MoE-Flaggschiff, drei Reasoning-Modi (Non-think / Think High / Think Max)
1,6 Bio. total (49 Mrd. aktiv pro Token)
Architektur | Hybrid-Attention aus CSA + HCA, mHC-Residuals, Muon-Optimizer, text-only
1.000.000 Token
Offizielle Angaben aus der DeepSeek-V4-Pro Model-Card, gemessen im Modus Think Max (höchster Reasoning-Effort):
| Benchmark | DeepSeek-V4-Pro | Kategorie |
|---|---|---|
| SWE-bench Verified | 80,6 % | Coding |
| GPQA-Diamond | 90,1 | Wissen/Reasoning |
| LiveCodeBench | 93,5 | Coding |
| MMLU-Pro | 87,5 | Wissen |
| HMMT 2026 Feb | 95,2 | Mathematik |
Quelle: offizielle DeepSeek-V4-Pro Model-Card. Werte im Modus Think Max. Im Standardmodus (Non-think) fallen sie deutlich niedriger aus. Als Preview gekennzeichnet.
V4-Pro ist ein Frontier-Modell mit entsprechendem Infrastrukturbedarf. Wir prüfen mit Ihnen Nutzen, Hardware und Betriebskonzept.
DeepSeek-V4-Pro kombiniert Compressed Sparse Attention und Heavily Compressed Attention zu einer hybriden Attention mit Token-Kompression. Ergänzt wird sie durch Manifold-Constrained Hyper-Connections (mHC), die die Signalweitergabe über die Schichten stabilisieren, und den Muon-Optimizer für schnellere Konvergenz. Vortrainiert wurde auf über 32 Billionen Token.
Das Modell ist rein textbasiert (nicht multimodal). Die Gewichte liegen als FP4/FP8-Mischpräzision vor: MoE-Experten in FP4, die übrigen Parameter in FP8.
Für Organisationen, die Frontier-Qualität und sehr lange Kontexte selbst betreiben wollen.
1-Million-Token-Kontext als Standard
Frontier-Benchmarks bei offener MIT-Lizenz
Effiziente CSA/HCA-Attention
Starke Agenten- und Tool-Use-Leistung
Kein Standard-Chat-Template – Integration erfordert DeepSeeks eigene Encoding-Skripte
Enormer Hardware- und Speicherbedarf
Nicht multimodal (text-only)
Als Preview gekennzeichnet – Reifegrad beachten
Wir planen mit Ihnen die Cluster-Auslegung für DeepSeek-V4-Pro und übernehmen Deployment, Quantisierung und Betrieb – auf Wunsch vollständig in Deutschland.