Qwen3.6

Kompakte, multimodale Hybrid-Modelle für agentisches Coding – 35B-A3B & 27B

Qwen3.6-Generation (2026)

Die Qwen3.6 Serie im Überblick

Qwen3.6 ist Alibabas kompakte, multimodale Serie auf Basis der effizienten Hybrid-Architektur (Gated DeltaNet + Gated Attention) aus der Qwen3-Next-Linie. Sie umfasst zwei self-host-freundliche Größen: das MoE-Modell Qwen3.6-35B-A3B (35 Mrd. total, nur 3 Mrd. aktiv, 256 Experten) und das dichte Qwen3.6-27B. Beide verarbeiten Text, Bild und Video, unterstützen bis zu 1 Million Token Kontext und sind gezielt auf agentisches Coding und „Thinking Preservation“ über mehrere Runden ausgelegt.

Name:

Qwen3.6-35B-A3B (MoE) & Qwen3.6-27B (dense), je + FP8

Entwickler:

Alibaba (Qwen-Team)

Veröffentlichung:

April 2026

Lizenz:

Apache 2.0

Modelltyp:

Multimodal (Text/Bild/Video); MoE bzw. dense

Parameter:

35B-A3B: 35 Mrd. total (3 Mrd. aktiv, 256 Experten), 27B: 27 Mrd. dense

Architektur:

Hybrid: Gated DeltaNet (lineare Attention) + Gated Attention, MTP

Kontextlänge:

262.144 nativ, bis 1.010.000 via YaRN

Spezialitäten von Qwen3.6

Self-host-freundlich

Zwei kompakte Größen (27B dense, 35B-A3B MoE mit nur 3 Mrd. aktiv) – gut auf einzelner High-End-GPU betreibbar.

Nativ multimodal

Verarbeitet Text, Bild und Video mit integriertem Vision-Encoder.

Agentic Coding

Gezielt auf agentische Coding-Workflows und Frontend-Generierung optimiert.

Thinking Preservation

Erhält Reasoning-Kontext über mehrere Gesprächsrunden hinweg.
Individuelle KI-Beratung

Ist Qwen3.6 das passende Modell für Sie?

Qwen3.6 ist einer der attraktivsten aktuellen Kandidaten fürs multimodale Self-Hosting. Wir finden mit Ihnen die richtige Variante und Hardware.

Die Post-Training Pipeline für Qwen3.6

Trainingsdaten & Trainingsprozess

Qwen3.6 nutzt die effiziente Hybrid-Architektur der Qwen3-Next-Linie: Lineare Attention (Gated DeltaNet) im Wechsel mit klassischer Gated Attention, kombiniert mit MoE-Routing (beim 35B-A3B) bzw. dichten FFN-Schichten (beim 27B) und Multi-Token-Prediction für schnellere Inferenz.

Beide Modelle verarbeiten nativ 262.144 Token und lassen sich per YaRN auf rund eine Million erweitern – bei voller Multimodalität für Text, Bild und Video.

Hardware & Deployment

  • vLLM, SGLang, Transformers; offizielle FP8-Varianten verfügbar
  • 27B (dense) auf einer 48-GB-GPU; 35B-A3B dank 3 Mrd. aktiver Parameter sehr effizient
  • Auch quantisiert (GGUF) auf leistungsfähiger Consumer-Hardware nutzbar
Anwendungsfälle

Empfohlene Anwendungsfälle für Qwen3.6

Für kostenbewusstes, multimodales Self-Hosting mit Coding-Fokus.

Agentische Coding-Assistenten (Frontend & Full-Stack)
Lokale Assistenten mit moderater Hardware
Mehrsprachige Apps
Multimodale Anwendungen (Dokumente, Bilder, Video)
Long-Context-RAG
Qwen
Qwen3.6

Stärken & Schwächen von Qwen3.6

Mit dem richtigen Modell Ergebnisse maximieren

Multimodales Self-Hosting, effizient umgesetzt

Wir richten die passende Qwen3.6-Variante auf Ihrer Hardware ein und betreiben sie DSGVO-konform aus dem deutschen Rechenzentrum.