Qwen3.6 ist Alibabas kompakte, multimodale Serie auf Basis der effizienten Hybrid-Architektur (Gated DeltaNet + Gated Attention) aus der Qwen3-Next-Linie. Sie umfasst zwei self-host-freundliche Größen: das MoE-Modell Qwen3.6-35B-A3B (35 Mrd. total, nur 3 Mrd. aktiv, 256 Experten) und das dichte Qwen3.6-27B. Beide verarbeiten Text, Bild und Video, unterstützen bis zu 1 Million Token Kontext und sind gezielt auf agentisches Coding und „Thinking Preservation“ über mehrere Runden ausgelegt.
Qwen3.6-35B-A3B (MoE) & Qwen3.6-27B (dense), je + FP8
Alibaba (Qwen-Team)
April 2026
Apache 2.0
Multimodal (Text/Bild/Video); MoE bzw. dense
35B-A3B: 35 Mrd. total (3 Mrd. aktiv, 256 Experten), 27B: 27 Mrd. dense
Hybrid: Gated DeltaNet (lineare Attention) + Gated Attention, MTP
262.144 nativ, bis 1.010.000 via YaRN
Offizielle Angaben aus den Qwen3.6 Model-Cards (Auswahl):
| Benchmark | Qwen3.6-27B (dense) | Qwen3.6-35B-A3B (MoE) |
|---|---|---|
| SWE-bench Verified | 77,2 | — |
| SWE-bench Pro | 53,5 | 49,5 |
| MMLU-Pro | 86,2 | 85,2 |
| GPQA-Diamond | 87,8 | 86,0 |
| AIME 2026 | 94,1 | — |
| MMBench EN v1.1 (multimodal) | — | 92,8 |
Quelle: offizielle Qwen3.6 HF-Model-Cards. „—“ = für diese Variante nicht separat ausgewiesen.
Qwen3.6 ist einer der attraktivsten aktuellen Kandidaten fürs multimodale Self-Hosting. Wir finden mit Ihnen die richtige Variante und Hardware.
Qwen3.6 nutzt die effiziente Hybrid-Architektur der Qwen3-Next-Linie: Lineare Attention (Gated DeltaNet) im Wechsel mit klassischer Gated Attention, kombiniert mit MoE-Routing (beim 35B-A3B) bzw. dichten FFN-Schichten (beim 27B) und Multi-Token-Prediction für schnellere Inferenz.
Beide Modelle verarbeiten nativ 262.144 Token und lassen sich per YaRN auf rund eine Million erweitern – bei voller Multimodalität für Text, Bild und Video.
Für kostenbewusstes, multimodales Self-Hosting mit Coding-Fokus.
Kompakt und gut self-hostbar
Nativ multimodal (Text/Bild/Video)
Starke Coding- und Reasoning-Benchmarks für die Größe
Offen unter Apache 2.0
Kleiner als die großen Flaggschiffe (Qwen3.5)
MoE-Gesamtgewichte erhöhen den RAM-Bedarf
Multimodales Deployment aufwändiger als Text-only
Wir richten die passende Qwen3.6-Variante auf Ihrer Hardware ein und betreiben sie DSGVO-konform aus dem deutschen Rechenzentrum.