GLM-4.5V

Offenes Vision-Language-Modell mit Thinking-Modus und GUI-Verständnis

GLM-4.5-Generation (Vision)

Das GLM-4.5V Modell im Überblick

GLM-4.5V ist Z.AIs offenes Vision-Language-Modell auf Basis von GLM-4.5-Air. Es kombiniert einen ViT-Encoder mit dem GLM-4.5-Air-Decoder, wurde per skalierbarem Reinforcement Learning verstärkt und erreichte zum Release State-of-the-Art über mehr als 40 öffentliche Multimodal-Benchmarks. Besonders stark ist es beim Verständnis von Bildern, Videos, Dokumenten und grafischen Oberflächen – inklusive umschaltbarem Thinking-Modus für tiefere visuelle Analyse.

Name:

GLM-4.5V

Entwickler:

Z.AI (Zhipu AI)

Veröffentlichung:

August 2025

Lizenz:

MIT

Modelltyp:

Multimodal (VLM), MoE, mit Thinking-Modus

Parameter:

106 Mrd. total (12 Mrd. aktiv), Basis GLM-4.5-Air

Architektur:

ViT-Encoder + MLP-Projektor + GLM-4.5-Air-Decoder, RL-verstärkt

Kontextlänge:

bis 64.000 Token

Spezialitäten von GLM-4.5V

title

State-of-the-Art über 40+ öffentliche Multimodal-Benchmarks zum Release.

GUI-Verständnis

Screen-Reading, Icon-Erkennung und Ansätze zur Desktop-Automation.

Thinking-Modus

Umschaltbar für tiefere visuelle Analyse.

Charts & Dokumente

Diagramm-Extraktion und Zusammenfassung langer Dokumente.
Individuelle KI-Beratung

Ist GLM-4.5V das passende Modell für Sie?

Für Dokumenten-, Chart- und GUI-Aufgaben ist GLM-4.5V stark. Wir planen mit Ihnen die Vision-Pipeline.

Die Post-Training Pipeline für GLM-4.5V

Trainingsdaten & Trainingsprozess

GLM-4.5V setzt einen ViT-Encoder und einen MLP-Projektor vor den GLM-4.5-Air-Decoder und wurde per skalierbarem Reinforcement Learning verstärkt – für robustes visuelles Reasoning.

Der umschaltbare Thinking-Modus erlaubt tiefere Analyse dort, wo einfache Wahrnehmung nicht ausreicht.

Hardware & Deployment

  • vLLM, SGLang, Transformers
  • VRAM-Profil ähnlich GLM-4.5-Air (1–2 High-End-GPUs)
  • Zusätzlicher Overhead durch Bild-/Video-Tokens
Anwendungsfälle

Empfohlene Anwendungsfälle für GLM-4.5V

Für bild-, dokumenten- und GUI-zentrierte Anwendungen.

Dokumenten- und Chart-Analyse
Video-Verständnis
STEM-Q&A mit visuellen Inhalten
GUI-Agenten und Automatisierung
Bild-Reasoning
Z.AI
GLM-4.5V

Stärken & Schwächen von GLM-4.5V

Mit dem richtigen Modell Ergebnisse maximieren

Visuelle KI, DSGVO-konform betrieben

Wir setzen GLM-4.5V für Ihre Dokumenten- und GUI-Workflows auf – sicher aus Deutschland.