GLM-4.5V ist Z.AIs offenes Vision-Language-Modell auf Basis von GLM-4.5-Air. Es kombiniert einen ViT-Encoder mit dem GLM-4.5-Air-Decoder, wurde per skalierbarem Reinforcement Learning verstärkt und erreichte zum Release State-of-the-Art über mehr als 40 öffentliche Multimodal-Benchmarks. Besonders stark ist es beim Verständnis von Bildern, Videos, Dokumenten und grafischen Oberflächen – inklusive umschaltbarem Thinking-Modus für tiefere visuelle Analyse.
GLM-4.5V
Z.AI (Zhipu AI)
August 2025
MIT
Multimodal (VLM), MoE, mit Thinking-Modus
106 Mrd. total (12 Mrd. aktiv), Basis GLM-4.5-Air
ViT-Encoder + MLP-Projektor + GLM-4.5-Air-Decoder, RL-verstärkt
bis 64.000 Token
Offizielle Positionierung von Z.AI:
| Aspekt | GLM-4.5V | Bezug |
|---|---|---|
| Multimodal-Benchmarks | SOTA auf 41–42 Benchmarks | u. a. MMBench, AI2D, MMStar, MathVista |
Quelle: Z.AI / MarkTechPost. Einzelscores nicht durchgängig beziffert.
Für Dokumenten-, Chart- und GUI-Aufgaben ist GLM-4.5V stark. Wir planen mit Ihnen die Vision-Pipeline.
GLM-4.5V setzt einen ViT-Encoder und einen MLP-Projektor vor den GLM-4.5-Air-Decoder und wurde per skalierbarem Reinforcement Learning verstärkt – für robustes visuelles Reasoning.
Der umschaltbare Thinking-Modus erlaubt tiefere Analyse dort, wo einfache Wahrnehmung nicht ausreicht.
Für bild-, dokumenten- und GUI-zentrierte Anwendungen.
Starkes offenes VLM mit Agenten-Fokus
Thinking-Modus für visuelle Tiefe
Gut self-hostbar
Offen unter MIT-Lizenz
64K-Kontext kleiner als reine Textmodelle
Vision-Pipeline erhöht Deployment-Komplexität
Einzelscores teils uneinheitlich dokumentiert
Wir setzen GLM-4.5V für Ihre Dokumenten- und GUI-Workflows auf – sicher aus Deutschland.