GLM-4.5-Air ist die schlanke Schwester von GLM-4.5: Dieselben Thinking- und Non-Thinking-Modi, dieselbe Agenten-Ausrichtung, aber mit nur 106 Milliarden Parametern total und 12 Milliarden aktiv deutlich effizienter. Mit FP8- oder Int4-Quantisierung läuft Air auf ein bis zwei High-End-GPUs – der ideale Einstieg für kostenbewusstes Self-Hosting von Agenten-Workloads.
GLM-4.5-Air
Z.AI (Zhipu AI)
Juli 2025
MIT (Open Source, kommerziell nutzbar)
MoE, Hybrid-Reasoning (Thinking / Non-Thinking)
106 Mrd. total (12 Mrd. aktiv)
Hybrid-Reasoning wie GLM-4.5, deutlich schlanker; BF16/FP8
128.000 Token
Offizielle Einordnung von Z.AI:
| Metrik | GLM-4.5-Air | Bezug |
|---|---|---|
| Aggregat-Score (12 Benchmarks) | ≈ 59,8 | nahe GLM-4.5 bei besserer Effizienz |
Quelle: Z.AI. Aggregatwert über 12 Industrie-Benchmarks.
Air ist oft der beste Einstieg in agentisches Self-Hosting. Wir finden mit Ihnen die richtige Quantisierung und Hardware.
GLM-4.5-Air teilt die Hybrid-Reasoning-Architektur von GLM-4.5, ist aber deutlich schlanker dimensioniert. Der umschaltbare Thinking-Modus bleibt erhalten.
Durch die niedrige Aktivierung (12 von 106 Milliarden Parametern) und FP8/Int4-Quantisierung wird das Modell auf überschaubarer Hardware betreibbar.
Für kosteneffiziente Agenten und Assistenten.
Sehr gutes Effizienz-/Qualitätsverhältnis
Gut self-hostbar (1–2 GPUs)
Thinking- und Non-Thinking-Modus
Offen unter MIT-Lizenz
Schwächer als das große GLM-4.5 bei sehr komplexen Aufgaben
Rein textbasiert (kein Vision)
128K-Kontext
Wir richten GLM-4.5-Air auf passender Hardware ein und betreiben es DSGVO-konform aus dem deutschen Rechenzentrum.