Qwen3-30B-A3B-2507 ist der Effizienz-Liebling der Qwen3-Reihe: ein MoE mit 30,5 Milliarden Parametern total, aber nur 3,3 Milliarden aktiven pro Token. Dadurch läuft das Modell quantisiert auf einer einzelnen High-End-GPU oder starkem Consumer-Setup. Das 2507-Update bringt große Qualitätssprünge gegenüber der April-Version – und wie beim Flaggschiff gibt es getrennte Instruct- und Thinking-Modelle.
Qwen3-30B-A3B-Instruct-2507 & -Thinking-2507
Alibaba (Qwen-Team)
Juli 2025
Apache 2.0
MoE, Instruct bzw. Reasoning (getrennt)
30,5 Mrd. total (3,3 Mrd. aktiv)
48 Layer, 128 Experten (8 aktiv), GQA (32/4)
262.144 nativ, bis ≈ 1 Mio. mit Sonderkonfiguration
Offizielle Angaben (Instruct-Variante, Auswahl):
| Benchmark | Qwen3-30B-Instruct-2507 | Kategorie |
|---|---|---|
| MMLU-Pro | 78,4 | Wissen |
| ZebraLogic | 90,0 | Logik |
| Arena-Hard v2 | 69,0 | Allgemein |
| MultiPL-E | 83,8 | Coding |
| Creative Writing v3 | 86,0 | Schreiben |
Quelle: offizielle Qwen Hugging-Face-Model-Card.
Dieses Modell ist oft der beste Startpunkt für kostenbewusstes Self-Hosting. Wir finden mit Ihnen die richtige Größe und Quantisierung.
Die niedrige Aktivierungsrate (8 von 128 Experten, 3,3 Mrd. Parameter) macht das Modell außergewöhnlich effizient – bei einer Qualität, die für viele Aufgaben an deutlich größere Modelle heranreicht.
Dual-Chunk-Attention und MInference ermöglichen sehr lange Kontexte. Zu beachten: Die 30,5 Mrd. Gesamtgewichte müssen im Speicher liegen, auch wenn nur 3,3 Mrd. aktiv sind.
Der ideale Einstieg ins Self-Hosting mit begrenztem Budget.
Exzellentes Effizienz-/Qualitätsverhältnis
Lokal betreibbar
Instruct- und Thinking-Variante
Offen unter Apache 2.0
Schwächer als 235B bei sehr harten Aufgaben
MoE-Gesamtgewichte erhöhen RAM-Bedarf
1M-Kontext nur mit Zusatzaufwand
Wir richten Qwen3-30B-A3B auf passender Hardware ein und betreiben es DSGVO-konform aus unserem Rechenzentrum.