GLM-4.6V

Multimodales MoE mit nativem Tool-Calling für Bilder und Videos

GLM-4.6-Generation (Vision)

Das GLM-4.6V Modell im Überblick

GLM-4.6V ist Z.AIs Vision-Modell mit einem Unterscheidungsmerkmal: nativem Tool-Calling für Bilder und Videos. Bilder lassen sich direkt an Tools übergeben, und visuelle Rückgaben fließen ohne Text-Umweg zurück ins Reasoning. Das macht GLM-4.6V besonders stark bei Frontend-Automation, Video-Reasoning und Dokumentenanalyse. Eine schlanke Flash-Variante mit 9 Milliarden Parametern ermöglicht zudem ressourcenschonende Deployments.

Name:

GLM-4.6V (+ Flash-Variante 9B)

Entwickler:

Z.AI (Zhipu AI)

Veröffentlichung:

Dezember 2025

Lizenz:

MIT

Modelltyp:

Multimodal (VLM), MoE, natives Tool-Calling

Parameter:

106 Mrd. (Hauptmodell) / 9 Mrd. (Flash)

Architektur:

ViT-Encoder (AIMv2-Huge) + MLP-Projektor + LLM-Decoder

Kontextlänge:

128.000 Token

Spezialitäten von GLM-4.6V

Visuelles Tool-Calling

Bilder direkt an Tools übergeben, visuelle Rückgaben verarbeiten – ohne Text-Umweg.

Frontend & Video

Stark bei Frontend-Automation, Video-Reasoning und Dokumentenanalyse.

Strukturiertes Reasoning

Multimodales Reasoning für Agenten-Workflows.

Flash-Variante

9B-Version für schlanke, kostengünstige Deployments.
Individuelle KI-Beratung

Ist GLM-4.6V das passende Modell für Sie?

Natives visuelles Tool-Calling eröffnet neue Agenten-Workflows. Wir bewerten mit Ihnen den Nutzen für Ihren Anwendungsfall.

Die Post-Training Pipeline für GLM-4.6V

Trainingsdaten & Trainingsprozess

GLM-4.6V nutzt einen von AIMv2-Huge abgeleiteten ViT-Encoder mit MLP-Projektor vor dem LLM-Decoder. Das native Tool-Calling für Bilder/Videos ist das zentrale Unterscheidungsmerkmal.

Bei Long-Context-Dokumenten übertrifft GLM-4.6V teils deutlich größere Modelle – ein Vorteil für dokumentenlastige Agenten.

Hardware & Deployment

  • vLLM, SGLang, Transformers
  • Flash-Variante (9B) für schlanke Deployments
  • Hauptmodell ähnlich GLM-4.5V-Profil
Anwendungsfälle

Empfohlene Anwendungsfälle für GLM-4.6V

Für multimodale Agenten mit Werkzeugnutzung.

GUI- und Browser-Agenten
Video-Analyse
Multimodale RAG
Dokumenten-Verarbeitung
Frontend-Automatisierung
Z.AI
GLM-4.6V

Stärken & Schwächen von GLM-4.6V

Mit dem richtigen Modell Ergebnisse maximieren

Visuelle Agenten mit Tool-Use

Wir setzen GLM-4.6V für Ihre multimodalen Agenten auf und betreiben es DSGVO-konform aus Deutschland.