GLM-4.5-Air

Die effiziente, self-host-freundliche Variante der GLM-4.5-Familie

GLM-4.5-Generation

Das GLM-4.5-Air Modell im Überblick

GLM-4.5-Air ist die schlanke Schwester von GLM-4.5: Dieselben Thinking- und Non-Thinking-Modi, dieselbe Agenten-Ausrichtung, aber mit nur 106 Milliarden Parametern total und 12 Milliarden aktiv deutlich effizienter. Mit FP8- oder Int4-Quantisierung läuft Air auf ein bis zwei High-End-GPUs – der ideale Einstieg für kostenbewusstes Self-Hosting von Agenten-Workloads.

Name:

GLM-4.5-Air

Entwickler:

Z.AI (Zhipu AI)

Veröffentlichung:

Juli 2025

Lizenz:

MIT (Open Source, kommerziell nutzbar)

Modelltyp:

MoE, Hybrid-Reasoning (Thinking / Non-Thinking)

Parameter:

106 Mrd. total (12 Mrd. aktiv)

Architektur:

Hybrid-Reasoning wie GLM-4.5, deutlich schlanker; BF16/FP8

Kontextlänge:

128.000 Token

Spezialitäten von GLM-4.5-Air

Gleiche Modi

Thinking und Non-Thinking wie GLM-4.5 – nur effizienter.

Self-Host-freundlich

Deutlich niedrigerer VRAM-Bedarf, lauffähig auf 1–2 High-End-GPUs.

Basis für Vision

Grundlage des multimodalen GLM-4.5V.

Gutes Preis-Leistungs-Verhältnis

Attraktives Verhältnis für Agenten-Workloads.
Individuelle KI-Beratung

Ist GLM-4.5-Air das passende Modell für Sie?

Air ist oft der beste Einstieg in agentisches Self-Hosting. Wir finden mit Ihnen die richtige Quantisierung und Hardware.

Die Post-Training Pipeline für GLM-4.5-Air

Trainingsdaten & Trainingsprozess

GLM-4.5-Air teilt die Hybrid-Reasoning-Architektur von GLM-4.5, ist aber deutlich schlanker dimensioniert. Der umschaltbare Thinking-Modus bleibt erhalten.

Durch die niedrige Aktivierung (12 von 106 Milliarden Parametern) und FP8/Int4-Quantisierung wird das Modell auf überschaubarer Hardware betreibbar.

Hardware & Deployment

  • vLLM, SGLang, Transformers
  • Mit FP8/Int4 auf 1–2 High-End-GPUs (z. B. 1–2× H100 80 GB)
  • Deutlich zugänglicher als das große GLM-4.5
Anwendungsfälle

Empfohlene Anwendungsfälle für GLM-4.5-Air

Für kosteneffiziente Agenten und Assistenten.

Kosteneffiziente Agenten
Chatbots mit moderater Hardware
Tool-gestützte Automatisierung
Self-hosted Coding-Assistent
Fine-Tuning-Basis
Z.AI
GLM-4.5-Air

Stärken & Schwächen von GLM-4.5-Air

Mit dem richtigen Modell Ergebnisse maximieren

Agentisches Self-Hosting, kosteneffizient

Wir richten GLM-4.5-Air auf passender Hardware ein und betreiben es DSGVO-konform aus dem deutschen Rechenzentrum.