Qwen3-235B-A22B-Instruct-2507

Das aktualisierte 235B-Flaggschiff im reinen Instruct-Modus

2507-Refresh der Qwen3-Flaggschiff-Reihe

Das Qwen3-235B-A22B-Instruct-2507 Modell im Überblick

Qwen3-235B-A22B-Instruct-2507 ist die im Juli 2025 überarbeitete Flaggschiff-Version des Qwen3-MoE. Alibaba trennt hier bewusst Instruct- und Thinking-Modell, statt beide Modi in einem Netz zu vereinen. Das Ergebnis ist ein reines Instruct-Modell mit deutlich besserer Instruktionsbefolgung, stärkerem Reasoning, Coding und Tool-Use – bei 235 Milliarden Parametern total und 22 Milliarden aktiv pro Token.

Name:

Qwen3-235B-A22B-Instruct-2507

Entwickler:

Alibaba (Qwen-Team)

Veröffentlichung:

Juli 2025

Lizenz:

Apache 2.0 (kommerziell nutzbar)

Modelltyp:

Mixture-of-Experts, Instruct (Non-Thinking)

Parameter:

235 Mrd. total (22 Mrd. aktiv)

Architektur:

94 Layer, 128 Experten (8 aktiv), GQA (64/4)

Kontextlänge:

262.144 nativ, erweiterbar bis ≈ 1.010.000

Spezialitäten von Qwen3-235B-A22B-Instruct-2507

Getrennte Modi

Reines Instruct-Modell – die passende Thinking-Variante gibt es separat, ohne Kompromisse im Verhalten.

Starke Zugewinne

Deutliche Verbesserungen bei Mathe, Wissen, mehrsprachigem Long-Tail-Wissen und Instruktionsbefolgung.

Agentic & Tools

Tool-Calling über Qwen-Agent für strukturierte Automatisierung.

FP8 verfügbar

Offizielle FP8-Variante senkt den VRAM-Bedarf spürbar.
Individuelle KI-Beratung

Ist Qwen3-235B-Instruct-2507 das passende Modell für Sie?

Instruct oder Thinking, FP8 oder BF16 – wir helfen Ihnen, die Flaggschiff-Variante passend zu Ihrer Hardware zu wählen.

Die Post-Training Pipeline für Qwen3-235B-A22B-Instruct-2507

Trainingsdaten & Trainingsprozess

Das 2507-Update ist ein Refresh der April-Version mit merklich besserer Instruktionsbefolgung und Reasoning. Die MoE-Architektur aktiviert pro Token nur 8 von 128 Experten.

Nativ verarbeitet das Modell 262.144 Token. Über Dual-Chunk-Attention und MInference lässt sich der Kontext auf rund eine Million Token erweitern.

Hardware & Deployment

  • vLLM, SGLang, Transformers
  • Realistisch 4–8× H100/H200; FP8 senkt VRAM deutlich
  • GGUF-Quants für gemischtes CPU/GPU-Offloading
Anwendungsfälle

Empfohlene Anwendungsfälle

Für anspruchsvolle Assistenten und Wissensarbeit auf Flaggschiff-Niveau.

Anspruchsvolle Chat- und Wissensassistenten
Coding-Unterstützung
Agenten-Workflows mit Tool-Use
Wissensextraktion aus großen Beständen
Mehrsprachige Anwendungen
Qwen
Qwen3-235B-A22B-Instruct-2507

Stärken & Schwächen von Qwen3-235B-A22B-Instruct-2507

Mit dem richtigen Modell Ergebnisse maximieren

Flaggschiff-KI aus dem deutschen Rechenzentrum

Wir hosten und betreiben Qwen3-235B für Sie – DSGVO-konform, skalierbar und mit passender Quantisierung.