Qwen3-VL ist Alibabas multimodale Vision-Language-Familie – von kompakten 2B-Modellen fürs Edge-Deployment bis zum 235B-MoE für den Server. Die Serie glänzt bei Video-Verständnis, Dokumenten- und OCR-Aufgaben (32 Sprachen), visuellen GUI-Agenten und 3D-Grounding. Je Größe gibt es Instruct- und Thinking-Varianten, sodass sich für nahezu jedes Budget und jede Aufgabe eine passende Konfiguration findet.
Qwen3-VL (Serie: 2B / 4B / 8B / 32B / 30B-A3B / 235B-A22B)
Alibaba (Qwen-Team)
September–Oktober 2025
Apache 2.0
Multimodal (VLM), dense & MoE; je Instruct + Thinking
2 Mrd. (dense) bis 235 Mrd. total / 22 Mrd. aktiv (MoE)
Interleaved-MRoPE, DeepStack, Text-Timestamp-Alignment
256K nativ, bis ≈ 1 Mio. via YaRN
Offizielle Positionierung von Qwen:
| Aspekt | Qwen3-VL | Vergleich |
|---|---|---|
| Visual Perception | erreicht/übertrifft Gemini 2.5 Pro | Instruct |
| Multimodales Reasoning | SOTA auf vielen Benchmarks | Thinking |
Quelle: Qwen (Tech-Report). Einzelzahlen je Größe im Report. Hier nicht je Variante beziffert.
Ob kompaktes Edge-VLM oder großes Server-Modell – wir finden die richtige Qwen3-VL-Größe für Ihren Anwendungsfall.
Interleaved-MRoPE kodiert Video-Positionen, DeepStack fusioniert mehrstufige ViT-Features und Text-Timestamp-Alignment verbindet Sprache mit Videozeit – zusammen ergibt das ein starkes Video- und Dokumentenverständnis.
Die breite Größenpalette erlaubt es, vom 2B-Modell auf Consumer-Hardware bis zum 235B-MoE auf dem Server exakt die passende Leistungsklasse zu wählen.
Für dokumenten-, bild- und videozentrierte Anwendungen.
Komplette Größenpalette
Starke Multimodalität, OCR und Video
Instruct- und Thinking-Varianten
Offen unter Apache 2.0
Große Modelle sehr ressourcenintensiv
Multimodales Deployment komplexer als Text-only
Benchmarkzahlen je Variante uneinheitlich dokumentiert
Wir wählen und betreiben die passende Qwen3-VL-Größe für Ihre Dokumenten- und Video-Workflows – DSGVO-konform aus Deutschland.