Llama 4 Scout

Natives MoE mit 10-Millionen-Token-Kontext

Llama-4-Generation von Meta

Das Llama 4 Scout Modell im Überblick

Llama 4 Scout ist Metas kompaktes, nativ multimodales MoE der Llama-4-Generation: 109 Milliarden Parameter total, davon 17 Milliarden aktiv, verteilt auf 16 Experten. Das herausragende Merkmal ist das Kontextfenster von bis zu 10 Millionen Token – ein Spitzenwert unter offenen Modellen. Dank Int4-Quantisierung passt Scout auf eine einzelne H100-GPU – ein starkes Angebot für sehr lange Dokumente und Multi-Dokument-RAG.

Name:

Llama 4 Scout (17B-16E) – Base & Instruct

Entwickler:

Meta AI

Veröffentlichung:

April 2025

Lizenz:

Llama 4 Community License

Modelltyp:

MoE, nativ multimodal (Text + Bild)

Parameter:

109 Mrd. total (17 Mrd. aktiv), 16 Experten

Architektur:

Auto-regressives MoE, early-fusion, iRoPE

Kontextlänge:

bis 10.000.000 Token

Spezialitäten von Llama 4 Scout

10M-Token-Kontext

10 Millionen Token Kontext – für sehr lange Dokumente und Codebasen.

Single-GPU-tauglich

Int4-quantisiert läuft Scout auf einer einzelnen H100 (80 GB).

Nativ multimodal

Verarbeitet Text und Bilder in einer early-fusion-Architektur.

Gutes Preis-Leistung

Sehr attraktives Verhältnis aus Leistung und Betriebskosten.
Individuelle KI-Beratung

Ist Llama 4 Scout das passende Modell für Sie?

Der 10M-Kontext ist außergewöhnlich groß – in der Praxis aber VRAM-intensiv. Wir prüfen mit Ihnen, was realistisch und sinnvoll ist.

Die Post-Training Pipeline für Llama 4 Scout

Trainingsdaten & Trainingsprozess

Scout ist Metas erstes natives MoE der Llama-Reihe mit early-fusion-Multimodalität. Der iRoPE-Ansatz ermöglicht die extrem langen Kontexte; trainiert wurde auf rund 40 Billionen Tokens.

Zu beachten: Sehr lange Kontexte erhöhen den KV-Cache-Bedarf deutlich – das nominelle 10M-Fenster ist ein Spitzenwert, kein Alltagsprofil.

Hardware & Deployment

  • vLLM, TGI, Transformers, Ollama
  • Int4 auf 1× H100 (80 GB); BF16 auf mehreren GPUs
  • Sehr lange Kontexte brauchen deutlich mehr VRAM (KV-Cache)
Anwendungsfälle

Empfohlene Anwendungsfälle für Llama 4 Scout

Für alles, wo sehr lange Kontexte und Multimodalität zusammenkommen.

Verarbeitung sehr langer Dokumente und Codebasen
Bild-und-Text-Analyse
Mehrsprachige Assistenten
Multi-Dokument-RAG
Zusammenfassung großer Korpora
Meta
Llama 4 Scout

Stärken & Schwächen von Llama 4 Scout

Mit dem richtigen Modell Ergebnisse maximieren

Sehr lange Kontexte, sicher gehostet

Wir richten Llama 4 Scout auf passender Hardware ein und betreiben es DSGVO-konform aus unserem deutschen Rechenzentrum.