Kimi-K2.5

Das erste multimodale K2: Vision, Reasoning und Tool-Use vereint

Multimodale K2-Generation (2026)

Das erste multimodale K2: Vision, Reasoning und Tool-Use vereint

Kimi-K2.5 erweitert die 1-Billion-MoE-Basis erstmals um echte Multimodalität: Ein MoonViT-Vision-Encoder ermöglicht Bild- und Video-Input, während Vision, Reasoning und Tool-Use in einem Modell zusammenkommen. Ein umschaltbarer Instant- und Thinking-Modus deckt sowohl schnelle Antworten als auch tiefe Analyse ab – ideal für multimodale Agenten mit visueller Wahrnehmung.

Name:

Kimi-K2.5

Entwickler:

Moonshot AI

Veröffentlichung:

Januar 2026

Lizenz:

Modified MIT

Modelltyp:

MoE, multimodal (Vision), Instant & Thinking

Parameter:

1 Bio. total (32 Mrd. aktiv) + MoonViT ≈ 400M

Architektur:

K2-Basis + MoonViT-Vision-Encoder

Kontextlänge:

256.000 Token

Spezialitäten von Kimi-K2.5

Erstes multimodales K2

Verarbeitet Bild- und Video-Input dank MoonViT-Vision-Encoder.

Vision + Reasoning

Kombiniert visuelle Wahrnehmung, Reasoning und Tool-Use in einem Modell.

Zwei Modi

Instant-Modus für Tempo, Thinking-Modus für Tiefe.

Visuelle Agentik

Agentische Suche mit visueller Wahrnehmung (Screenshots, UI, Dokumente).
Individuelle KI-Beratung

Ist Kimi-K2.5 das passende Modell für Sie?

Multimodale 1T-MoEs sind anspruchsvoll im Betrieb. Wir planen mit Ihnen Vision-Pipeline und Hardware.

Die Post-Training Pipeline für Kimi-K2.5

Trainingsdaten & Trainingsprozess

Kimi-K2.5 kombiniert die bewährte 1-Billion-MoE-Basis mit dem MoonViT-Vision-Encoder für Bild- und Video-Verständnis. Für das Deployment wird eine aktuelle Transformers-Version benötigt.

Der umschaltbare Instant-/Thinking-Modus erlaubt es, je nach Aufgabe zwischen schneller Antwort und tiefer visueller Analyse zu wählen.

Hardware & Deployment

  • vLLM, SGLang, KTransformers
  • Hardwarebedarf wie 1T-MoE (≈ 1 TB FP8, 8× H200-Klasse)
  • Aktuelle Transformers-Version für Vision erforderlich
Anwendungsfälle

Empfohlene Anwendungsfälle

Für multimodale Agenten und visuelle Analyse.

Multimodale Agenten (Screenshots, UI, Dokumente)
Diagramm- und Video-Analyse
Dokumentenverständnis
Visuelle Recherche
Multimodales Coding (UI → Code)
Moonshot AI
Kimi-K2.5

Stärken & Schwächen von Kimi-K2.5

Mit dem richtigen Modell Ergebnisse maximieren

Multimodale KI, souverän betrieben

Wir setzen Kimi-K2.5 inklusive Vision-Pipeline auf und betreiben es DSGVO-konform aus Deutschland.