Kimi-K2.5 erweitert die 1-Billion-MoE-Basis erstmals um echte Multimodalität: Ein MoonViT-Vision-Encoder ermöglicht Bild- und Video-Input, während Vision, Reasoning und Tool-Use in einem Modell zusammenkommen. Ein umschaltbarer Instant- und Thinking-Modus deckt sowohl schnelle Antworten als auch tiefe Analyse ab – ideal für multimodale Agenten mit visueller Wahrnehmung.
Kimi-K2.5
Moonshot AI
Januar 2026
Modified MIT
MoE, multimodal (Vision), Instant & Thinking
1 Bio. total (32 Mrd. aktiv) + MoonViT ≈ 400M
K2-Basis + MoonViT-Vision-Encoder
256.000 Token
Werte aus unabhängigen Vergleichsmessungen von Z.AI und Alibaba:
| Benchmark | Kimi-K2.5 | Kategorie |
|---|---|---|
| GPQA-Diamond | 87,6 | Wissen/Reasoning |
| MMLU-Pro | 87,1 | Wissen |
| SWE-bench Verified | 76,8 | Coding |
| SWE-bench Multilingual | 73,0 | Coding |
| BrowseComp | 60,6 | Web-Agentik |
| Terminal-Bench 2.0 | 50,8 | Terminal-Agenten |
Quelle: Vergleichsmessungen aus den Model-Cards von GLM-5 (Z.AI) und Qwen3.5 (Alibaba). Fremdgemessene Werte, nicht herstellereigen.
Multimodale 1T-MoEs sind anspruchsvoll im Betrieb. Wir planen mit Ihnen Vision-Pipeline und Hardware.
Kimi-K2.5 kombiniert die bewährte 1-Billion-MoE-Basis mit dem MoonViT-Vision-Encoder für Bild- und Video-Verständnis. Für das Deployment wird eine aktuelle Transformers-Version benötigt.
Der umschaltbare Instant-/Thinking-Modus erlaubt es, je nach Aufgabe zwischen schneller Antwort und tiefer visueller Analyse zu wählen.
Für multimodale Agenten und visuelle Analyse.
Native Vision + Reasoning kombiniert
Langer Kontext (256K)
Instant- und Thinking-Modus
Offen (Modified MIT)
Hoher Hardware-Bedarf
Vision-Toolchain (neuere Transformers) nötig
Vision-Benchmarks weniger breit dokumentiert als Text-Benchmarks
Wir setzen Kimi-K2.5 inklusive Vision-Pipeline auf und betreiben es DSGVO-konform aus Deutschland.