Qwen3-Omni-30B-A3B ist ein natives, end-to-end multimodales Modell: Es verarbeitet Text, Bild, Audio und Video und gibt sowohl Text als auch natürliche Sprache aus. Das MoE-basierte Thinker-Talker-Design ermöglicht Echtzeit-Streaming mit natürlichem Turn-Taking. Mit 119 Text-, 19 Sprach-Eingabe- und 10 Sprach-Ausgabesprachen sowie drei Stimmen eignet es sich hervorragend für multimodale Agenten und Sprachassistenten.
Qwen3-Omni-30B-A3B (Instruct / Thinking / Captioner)
Alibaba (Qwen-Team)
September 2025
Apache 2.0
MoE, nativ multimodal (Any-to-Any)
≈ 30 Mrd. total (≈ 3 Mrd. aktiv)
Thinker-Talker-Design, AuT-Pretraining, Multi-Codebook
nicht klar spezifiziert
Offizielle Angaben von Qwen:
| Benchmark | Qwen3-Omni | Vergleich |
|---|---|---|
| Audio/Video-Benchmarks | Open-Source-SOTA auf 32 von 36 | — |
| ASR (Spracherkennung) | vergleichbar Gemini 2.5 Pro | — |
Quelle: Qwen (GitHub/Model-Card). Einzelzahlen je nach Benchmark.
Multimodale Deployments sind anspruchsvoller. Wir planen mit Ihnen Audio-Pipeline, Streaming und Betrieb.
Das Thinker-Talker-Design trennt Verstehen und Sprachausgabe; AuT-Pretraining und ein Multi-Codebook-Ansatz ermöglichen natürliche, streamende Sprachantworten.
Als MoE mit rund 3 Milliarden aktiven Parametern bleibt das Modell trotz Multimodalität vergleichsweise effizient.
Für sprach- und medienzentrierte Anwendungen.
Echtes Omni-Modell inkl. Sprachausgabe
Sehr mehrsprachig
Effiziente MoE-Größe
Offen unter Apache 2.0
Komplexes Deployment (Audio-Pipeline)
Kontextlänge wenig dokumentiert
Talker-/Streaming-Setup anspruchsvoll
Wir setzen Qwen3-Omni für Sprach- und Medienanwendungen auf – inklusive Streaming-Infrastruktur aus Deutschland.