Qwen3-Next-80B-A3B ist Alibabas Ausblick auf die nächste Modellgeneration. Eine neue Hybrid-Architektur kombiniert lineare Attention (Gated DeltaNet) mit klassischer Gated Attention und einem extrem dünn besetzten MoE (512 Experten, davon 10 aktiv plus ein geteilter). Bei 80 Milliarden Parametern total sind nur rund 3 Milliarden aktiv – das ergibt eine bemerkenswerte Effizienz, besonders bei langen Kontexten.
Qwen3-Next-80B-A3B (Instruct & Thinking)
Alibaba (Qwen-Team)
September 2025
Apache 2.0
Hybrid-MoE (neue Architektur)
80 Mrd. total (≈ 3 Mrd. aktiv)
Gated DeltaNet + Gated Attention, 512 Experten (10+1), MTP
262.144 nativ, bis ≈ 1.010.000 via YaRN
Offizielle Angaben (Instruct-Variante, Auswahl):
| Benchmark | Qwen3-Next-80B-Instruct | Kategorie |
|---|---|---|
| MMLU-Pro | 80,6 | Wissen |
| AIME25 | 69,5 | Mathematik |
| LiveCodeBench | 56,6 | Coding |
| Arena-Hard v2 | 82,7 | Allgemein |
Quelle: offizielle Qwen Hugging-Face-Model-Card.
Die neue Architektur braucht aktuelle Inferenz-Engines. Wir prüfen mit Ihnen Reifegrad und Nutzen für Ihre Long-Context-Workloads.
Qwen3-Next verbindet lineare und klassische Attention und setzt auf ein extrem dünn besetztes MoE. Das senkt Trainings- und Inferenzkosten erheblich und verbessert die Effizienz bei langen Kontexten.
Weil nur ein Bruchteil der Parameter aktiv ist, bleibt die Rechenlast gering – die 80 Mrd. Gesamtgewichte müssen jedoch im Speicher gehalten werden.
Für effiziente Long-Context-Anwendungen und kostenoptimierte Inferenz.
Herausragende Effizienz
Sehr langer Kontext
Starke Benchmarks für die Größe
Offen unter Apache 2.0
Neue Architektur braucht aktuelles Tooling
80 Mrd. Weights → nennenswerter Speicherbedarf
Anfangs unreifes Ökosystem
Wir evaluieren und betreiben Qwen3-Next für Ihre Long-Context-Anwendungen – auf aktueller Infrastruktur aus Deutschland.