Qwen3-Next-80B-A3B

Vorschau auf Qwens nächste Generation: Hybrid-Attention & Ultra-Sparsity

Neue Architektur-Generation, Instruct & Thinking

Das Qwen3-Next-80B-A3B Modell im Überblick

Qwen3-Next-80B-A3B ist Alibabas Ausblick auf die nächste Modellgeneration. Eine neue Hybrid-Architektur kombiniert lineare Attention (Gated DeltaNet) mit klassischer Gated Attention und einem extrem dünn besetzten MoE (512 Experten, davon 10 aktiv plus ein geteilter). Bei 80 Milliarden Parametern total sind nur rund 3 Milliarden aktiv – das ergibt eine bemerkenswerte Effizienz, besonders bei langen Kontexten.

Name:

Qwen3-Next-80B-A3B (Instruct & Thinking)

Entwickler:

Alibaba (Qwen-Team)

Veröffentlichung:

September 2025

Lizenz:

Apache 2.0

Modelltyp:

Hybrid-MoE (neue Architektur)

Parameter:

80 Mrd. total (≈ 3 Mrd. aktiv)

Architektur:

Gated DeltaNet + Gated Attention, 512 Experten (10+1), MTP

Kontextlänge:

262.144 nativ, bis ≈ 1.010.000 via YaRN

Spezialitäten von Qwen3-Next-80B-A3B

Hybrid-Attention

Linearer Attention-Anteil (Gated DeltaNet) macht lange Kontexte deutlich günstiger.

Ultra-Sparsity

Nur ≈ 3 Mrd. aktive Parameter → sehr niedrige Trainings- und Inferenzkosten.

Multi-Token-Prediction

MTP beschleunigt die Inferenz spürbar.

FP8 verfügbar

Offizielle FP8-Versionen (später nachgereicht) für effizientes Hosting.
Individuelle KI-Beratung

Ist Qwen3-Next das passende Modell für Sie?

Die neue Architektur braucht aktuelle Inferenz-Engines. Wir prüfen mit Ihnen Reifegrad und Nutzen für Ihre Long-Context-Workloads.

Die Post-Training Pipeline für Qwen3-Next-80B-A3B

Trainingsdaten & Trainingsprozess

Qwen3-Next verbindet lineare und klassische Attention und setzt auf ein extrem dünn besetztes MoE. Das senkt Trainings- und Inferenzkosten erheblich und verbessert die Effizienz bei langen Kontexten.

Weil nur ein Bruchteil der Parameter aktiv ist, bleibt die Rechenlast gering – die 80 Mrd. Gesamtgewichte müssen jedoch im Speicher gehalten werden.

Hardware & Deployment

  • vLLM, SGLang (Hybrid-Attention-Support nötig), Transformers
  • FP8 ≈ 82 GB, BF16 ≈ 163 GB
  • Effizient in der Rechenlast, aber speicherintensiv (80 Mrd. Weights)
Anwendungsfälle

Empfohlene Anwendungsfälle

Für effiziente Long-Context-Anwendungen und kostenoptimierte Inferenz.

Long-Context-RAG
Agenten mit langen Verläufen
Forschung zu MoE und linearer Attention
Effiziente Assistenten
Kostenoptimierte Inferenz
Qwen
Qwen3-Next-80B-A3B

Stärken & Schwächen von Qwen3-Next-80B-A3B

Mit dem richtigen Modell Ergebnisse maximieren

Nächste-Generation-Effizienz nutzen

Wir evaluieren und betreiben Qwen3-Next für Ihre Long-Context-Anwendungen – auf aktueller Infrastruktur aus Deutschland.