Qwen3-235B-A22B-Thinking-2507 ist das Reasoning-Gegenstück zur Instruct-Variante: Das Chat-Template fügt automatisch einen sichtbaren Denk-Block ein, in dem das Modell komplexe Aufgaben Schritt für Schritt durcharbeitet. In Mathe-, Logik- und Coding-Wettbewerben erreicht es Spitzenwerte – ideal für Aufgaben, bei denen Nachvollziehbarkeit und Tiefe zählen.
Qwen3-235B-A22B-Thinking-2507
Alibaba (Qwen-Team)
Juli 2025
Apache 2.0
MoE, Reasoning (nur Thinking-Modus)
235 Mrd. total (22 Mrd. aktiv)
94 Layer, 128 Experten (8 aktiv), auto. -Block
262.144 nativ, bis ≈ 1 Mio. erweiterbar
Offizielle Angaben aus der Qwen-Model-Card (Auswahl):
| Benchmark | Qwen3-235B-Thinking-2507 | Kategorie |
|---|---|---|
| AIME25 | 92,3 | Mathematik |
| HMMT25 | 83,9 | Mathematik |
| LiveCodeBench v6 | 74,1 | Coding |
| GPQA | 81,1 | Wissen/Reasoning |
| WritingBench | 88,3 | Schreiben |
Quelle: offizielle Qwen Hugging-Face-Model-Card.
Reasoning bringt Tiefe, aber auch Latenz und Token-Verbrauch. Wir bewerten mit Ihnen, wo sich der Thinking-Modus lohnt.
Die Thinking-Variante ist auf ausführliches Chain-of-Thought-Reasoning ausgelegt. Das Chat-Template öffnet den Denk-Block automatisch, sodass das Modell komplexe Aufgaben strukturiert löst.
Wie die Instruct-Variante verarbeitet das Modell nativ 262.144 Token und lässt sich auf rund eine Million erweitern – der Reasoning-Overhead erhöht allerdings den KV-Cache-Bedarf.
Für Aufgaben, bei denen Tiefe und Nachvollziehbarkeit entscheidend sind.
Herausragende Reasoning-Benchmarks
Nachvollziehbarer Lösungsweg
Offen unter Apache 2.0
Sehr langer Kontext
Höherer VRAM- und Latenzbedarf
Reasoning-Overhead bei einfachen Aufgaben
Server-GPUs erforderlich
Wir betreiben das Qwen3-Reasoning-Flaggschiff für Ihre anspruchsvollsten Aufgaben – auf Wunsch komplett aus Deutschland.