Qwen3-235B-A22B-Instruct-2507 ist die im Juli 2025 überarbeitete Flaggschiff-Version des Qwen3-MoE. Alibaba trennt hier bewusst Instruct- und Thinking-Modell, statt beide Modi in einem Netz zu vereinen. Das Ergebnis ist ein reines Instruct-Modell mit deutlich besserer Instruktionsbefolgung, stärkerem Reasoning, Coding und Tool-Use – bei 235 Milliarden Parametern total und 22 Milliarden aktiv pro Token.
Qwen3-235B-A22B-Instruct-2507
Alibaba (Qwen-Team)
Juli 2025
Apache 2.0 (kommerziell nutzbar)
Mixture-of-Experts, Instruct (Non-Thinking)
235 Mrd. total (22 Mrd. aktiv)
94 Layer, 128 Experten (8 aktiv), GQA (64/4)
262.144 nativ, erweiterbar bis ≈ 1.010.000
Offizielle Angaben aus der Qwen-Model-Card (Auswahl):
| Benchmark | Qwen3-235B-Instruct-2507 | Kategorie |
|---|---|---|
| AIME25 | 70,3 | Mathematik |
| HMMT25 | 55,4 | Mathematik |
| Arena-Hard v2 | 79,2 | Allgemein |
| SimpleQA | 54,3 | Faktenwissen |
Quelle: offizielle Qwen Hugging-Face-Model-Card.
Instruct oder Thinking, FP8 oder BF16 – wir helfen Ihnen, die Flaggschiff-Variante passend zu Ihrer Hardware zu wählen.
Das 2507-Update ist ein Refresh der April-Version mit merklich besserer Instruktionsbefolgung und Reasoning. Die MoE-Architektur aktiviert pro Token nur 8 von 128 Experten.
Nativ verarbeitet das Modell 262.144 Token. Über Dual-Chunk-Attention und MInference lässt sich der Kontext auf rund eine Million Token erweitern.
Für anspruchsvolle Assistenten und Wissensarbeit auf Flaggschiff-Niveau.
Flaggschiff-Qualität nahe Closed-Source
Sehr langer Kontext
Offen unter Apache 2.0
FP8-Variante für effizientes Hosting
Sehr hoher VRAM-Bedarf
Kein Reasoning-Modus (dafür Thinking-Variante)
Nur mit Server-GPUs sinnvoll betreibbar
Wir hosten und betreiben Qwen3-235B für Sie – DSGVO-konform, skalierbar und mit passender Quantisierung.