Llama 4 Scout ist Metas kompaktes, nativ multimodales MoE der Llama-4-Generation: 109 Milliarden Parameter total, davon 17 Milliarden aktiv, verteilt auf 16 Experten. Das herausragende Merkmal ist das Kontextfenster von bis zu 10 Millionen Token – ein Spitzenwert unter offenen Modellen. Dank Int4-Quantisierung passt Scout auf eine einzelne H100-GPU – ein starkes Angebot für sehr lange Dokumente und Multi-Dokument-RAG.
Llama 4 Scout (17B-16E) – Base & Instruct
Meta AI
April 2025
Llama 4 Community License
MoE, nativ multimodal (Text + Bild)
109 Mrd. total (17 Mrd. aktiv), 16 Experten
Auto-regressives MoE, early-fusion, iRoPE
bis 10.000.000 Token
Offizielle Angaben (pretrained, Auswahl):
| Benchmark | Llama 4 Scout | Kategorie |
|---|---|---|
| MMLU | 79,6 | Wissen |
| MATH (em@1) | 50,3 | Mathematik |
| DocVQA (ANLS) | 94,4 | Dokumente |
| MMMU | 69,4 | Multimodal |
Quelle: Meta / Hugging-Face-Model-Card.
Der 10M-Kontext ist außergewöhnlich groß – in der Praxis aber VRAM-intensiv. Wir prüfen mit Ihnen, was realistisch und sinnvoll ist.
Scout ist Metas erstes natives MoE der Llama-Reihe mit early-fusion-Multimodalität. Der iRoPE-Ansatz ermöglicht die extrem langen Kontexte; trainiert wurde auf rund 40 Billionen Tokens.
Zu beachten: Sehr lange Kontexte erhöhen den KV-Cache-Bedarf deutlich – das nominelle 10M-Fenster ist ein Spitzenwert, kein Alltagsprofil.
Für alles, wo sehr lange Kontexte und Multimodalität zusammenkommen.
Außergewöhnlich großes Kontextfenster (10M)
Single-GPU-tauglich (quantisiert)
Nativ multimodal
Gutes Preis-Leistungs-Verhältnis
Reale Qualität bei extrem langem Kontext schwankt
Gemischte Community-Reaktion zur Alltagsqualität
Community-Lizenz mit Auflagen (nicht Apache/MIT)
Wir richten Llama 4 Scout auf passender Hardware ein und betreiben es DSGVO-konform aus unserem deutschen Rechenzentrum.