Kimi K3 ist Moonshots Frontier-Generation und ein deutlicher Sprung gegenüber der K2-Reihe: ein Sparse-Mixture-of-Experts mit 2,8 Billionen Parametern total, von denen pro Token 104 Milliarden aktiv sind – 16 von 896 Experten. Moonshot bezeichnet K3 als erstes offenes Modell der 3-Billionen-Klasse. Das Modell versteht Text und Bilder im selben Netz, verarbeitet bis zu 1.048.576 Token Kontext und setzt auf neue Architektur-Bausteine wie Kimi Delta Attention und das Stable-LatentMoE-Framework. Laut Moonshot ergibt sich daraus rund die 2,5-fache Skalierungseffizienz gegenüber Kimi K2.
Kimi K3
Moonshot AI
Juli 2026
Kimi K3 License
Sparse MoE, nativ multimodal, Reasoning durchgängig aktiv
2,8 Bio. total (104 Mrd. aktiv) + MoonViT-V2 ≈ 401 Mio.
93 Layer (69 KDA + 24 Gated MLA), Stable LatentMoE mit 896 Experten (16 aktiv + 2 shared), SiTU-GLU
1.048.576 Token
Offizielle Angaben aus der Kimi-K3-Model-Card (Auswahl, jeweils bei reasoning_effort = max):
| Bereich | Kimi K3 | Kategorie |
|---|---|---|
| GPQA Diamond | 93,5 | Wissen/Reasoning |
| Terminal-Bench 2.1 | 88,3 | Terminal-Agenten |
| FrontierSWE | 81,2 | Coding |
| SWE-Marathon | 42,0 | Long-Horizon-Coding |
| BrowseComp | 91,2 | Web-Agentik |
| MCPMark-Verified | 94,5 | Tool-Use |
| OmniDocBench | 91,1 | Dokumente |
| Video-MME (mit Untertiteln) | 90,0 | Video |
Quelle: offizielle Moonshot Model-Card. Die Coding- und Agenten-Werte wurden überwiegend mit Moonshots eigener Kimi-Code-Harness ermittelt, einzelne Werte stammen von Artificial Analysis (Stand 23.07.2026). Vergleichswerte konkurrierender Modelle in der Model-Card beziehen sich auf den Stand Juli 2026.
K3 ist ein Frontier-Modell mit erheblichem Infrastrukturbedarf. Wir prüfen mit Ihnen Nutzen, Hardware und Betriebskonzept – auch im Vergleich zu kompakteren K2-Varianten.
Kimi K3 kombiniert Kimi Delta Attention (KDA) und Gated MLA in einem hybriden Attention-Stack – 69 KDA- und 24 Gated-MLA-Layer bei insgesamt 93 Schichten. Attention Residuals sorgen für den Informationsfluss über die Tiefe, das Stable-LatentMoE-Framework ermöglicht stabiles Training bei 896 Experten. Als Aktivierungsfunktion kommt SiTU-GLU zum Einsatz, das Vokabular umfasst 160.000 Token.
Durch Quantization-Aware-Training ab der SFT-Phase mit MXFP4-Gewichten und MXFP8-Aktivierungen bleibt die Inferenz trotz der Modellgröße handhabbar und auf breiter Hardware lauffähig. Eine Besonderheit im Betrieb: K3 wurde im „preserved thinking history“-Modus trainiert – bei mehrstufigen Dialogen und Tool-Calls muss die vollständige Assistant-Nachricht inklusive reasoning_content zurückgegeben werden, sonst verliert das Modell seinen Reasoning-Kontext.
Moonshot positioniert K3 für besonders anspruchsvolle, langlaufende Aufgaben.
Frontier-Leistung bei offenen Gewichten
Sehr effiziente Sparsity (16 von 896 Experten aktiv)
Über 1 Million Token Kontext, nativ multimodal
Einstellbare Denk-Tiefe in drei Stufen
MXFP4-Quantisierung bereits im Training angelegt
Enormer Hardware-Bedarf – Betrieb nur mit Frontier-Cluster sinnvoll
Eigene Lizenz statt Modified MIT wie bei der K2-Reihe – Lizenztext prüfen
Benchmarks überwiegend mit herstellereigener Harness ermittelt
Reasoning ist nicht abschaltbar – höherer Token-Verbrauch auch bei einfachen Aufgaben
Die Model-Summary führt als Modalität Text und Bild. Video-Fähigkeiten werden separat beworben und in Video-Benchmarks belegt
Wir planen mit Ihnen die Cluster-Auslegung für Kimi K3 und übernehmen Deployment und Betrieb, sobald die Gewichte verfügbar sind – DSGVO-konform aus Deutschland.