DeepSeek V4 ist offiziell GA geworden und führt eine 1,6 Billionen Parameter Mixture-of-Experts (MoE)-Architektur ein, die hybride Aufmerksamkeitsmechanismen mit Unterstützung für bis zu einer Million Token Kontext kombiniert. Diese Veröffentlichung positioniert DeepSeek als wichtigen Akteur im Bereich großer Sprachmodelle, insbesondere für Anwendungen, die umfangreiche Kontextfenster erfordern, wie juristische Dokumentenanalyse, Codebasis-Verständnis und wissenschaftliche Forschung. Das MoE-Design ermöglicht effizientes Skalieren, indem nur eine Teilmenge der Parameter pro Token aktiviert wird, was die Rechenkosten reduziert und gleichzeitig hohe Leistung beibehält. Der hybride Aufmerksamkeitsmechanismus kombiniert dichte und sparse Aufmerksamkeitsmuster, um lange Sequenzen effektiv zu verarbeiten. Für Entwickler und Unternehmen bedeutet dies Zugang zu einem leistungsstarken Modell, das ganze Bücher oder große Code-Repositories in einem einzigen Durchlauf verarbeiten kann. Der GA-Status deutet auf Produktionsreife hin, obwohl praktische Überlegungen zu Speicher und Latenz bestehen bleiben. Dieses Signal ist besonders relevant für Teams, die Alternativen zu westlichen Modellen aus Kosten- oder Datensouveränitätsgründen evaluieren.
DeepSeek V4 ist allgemein verfügbar mit einer 1,6 Billionen Parameter Mixture-of-Experts-Architektur, hybriden Aufmerksamkeitsmechanismen und Unterstützung für bis zu einer Million Token Kontext. Dies markiert einen bedeutenden Schritt in der chinesischen KI-Modellentwicklung.