DeepSeek-V3.2-Exp

Erste DeepSeek Sparse Attention (DSA) für effizienten Long-Context

Experimentelle Effizienz-Architektur

Das DeepSeek-V3.2-Exp Modell im Überblick

DeepSeek-V3.2-Exp ist ein experimenteller Zwischenschritt, der DeepSeek Sparse Attention (DSA) einführt – eine feingranulare Sparse-Attention, die Long-Context-Inferenz drastisch günstiger macht, ohne die Qualität spürbar zu senken. Zum Release halbierte DeepSeek die API-Preise. Die Leistung bleibt auf dem Niveau von V3.1-Terminus, bei deutlich reduzierten Rechenkosten.

Name:

DeepSeek-V3.2-Exp

Entwickler:

DeepSeek AI

Veröffentlichung:

September 2025

Lizenz:

MIT (Open Source)

Modelltyp:

MoE, experimentelle Effizienz-Architektur

Parameter:

671 Mrd. total (37 Mrd. aktiv)

Architektur:

DeepSeek Sparse Attention (DSA), Kernels in TileLang & CUDA

Kontextlänge:

128.000 Token

Spezialitäten von DeepSeek-V3.2-Exp

DeepSeek Sparse Attention

Erstes DeepSeek-Modell mit DSA – feingranulare Sparse-Attention für günstigen Long-Context.

Über 50% günstiger

Die Effizienzgewinne wurden direkt an die API-Preise weitergegeben – attraktiv für hohe Volumen.

Qualität gehalten

Leistung auf dem Niveau von V3.1-Terminus trotz grundlegendem Architektur-Umbau.

Offene Kernels

GPU-Kernels in TileLang und CUDA sowie ein Technical Report sind öffentlich verfügbar.
Individuelle KI-Beratung

Ist DeepSeek-V3.2-Exp das passende Modell für Sie?

Gerade bei kostensensitiven Long-Context-Workloads lohnt sich ein Blick auf DSA. Wir bewerten mit Ihnen Nutzen und Reifegrad im Erstgespräch.

Die Post-Training Pipeline für DeepSeek-V3.2-Exp

Trainingsdaten & Trainingsprozess

Der Kern von V3.2-Exp ist DeepSeek Sparse Attention (DSA): Statt jede Position mit jeder zu vergleichen, konzentriert sich die Attention gezielt auf relevante Tokens. Das senkt die Rechenkosten bei langen Kontexten erheblich.

Als „Exp“-Release ist das Modell bewusst experimentell und wurde später durch das finale DeepSeek-V3.2 abgelöst – bleibt aber als offener, effizienter Meilenstein interessant.

Hardware & Deployment

  • Inferenz via vLLM, SGLang, Transformers
  • DSA-Kernels (TileLang/CUDA) reduzieren Long-Context-Kosten
  • ≈ 8× H200/H100-Klasse für volle Gewichte
Anwendungsfälle

Empfohlene Anwendungsfälle für DeepSeek-V3.2-Exp

Überall dort sinnvoll, wo lange Kontexte kostengünstig verarbeitet werden müssen.

Kostensensitive Long-Context-Inferenz
RAG über große Dokumentbestände
Agenten mit langen Verläufen
Allgemeine Chat- und Coding-Aufgaben
Effizienz-Benchmarking neuer Attention-Verfahren
DeepSeek-V3.2-Exp

Stärken & Schwächen von DeepSeek-V3.2-Exp

Mit dem richtigen Modell Ergebnisse maximieren

Long-Context günstiger betreiben

Wir prüfen mit Ihnen, ob DeepSeek Sparse Attention Ihre Inferenzkosten senkt, und übernehmen Deployment und Betrieb im deutschen Rechenzentrum.