Mit DeepSeek V4.1 Flash hat das chinesische KI-Labor am 10. September 2026 das erste Modell einer neuen Architekturfamilie veröffentlicht. Die Ansage ist ungewöhnlich: Das „kleine” Flash-Modell soll das eigene Flaggschiff V4 Pro in Leistung, Kosten und Geschwindigkeit schlagen – und deshalb wird V4 Pro ab dem 14. September schlicht auf das neue Modell umgeleitet. Ein Blick auf das, was DeepSeek da gebaut hat, und was es für den praktischen Einsatz bedeutet.
Was DeepSeek V4.1 Flash technisch anders macht
V4.1 Flash ist ein Mixture-of-Experts-Modell mit 552 Milliarden Parametern. Interessant ist die neue, von DeepSeek als „Causal Encoder–Decoder” bezeichnete Architektur: Für die Verarbeitung der Eingabe sind nur 8 Milliarden Parameter aktiv, für die Ausgabe 16 Milliarden. Diese Asymmetrie ist der Kern der Effizienz – Eingaben (also lange Kontexte, Dokumente, Codebasen) werden mit weniger Rechenaufwand gelesen als Antworten geschrieben.
Klartext ins Postfach
KI, Security & Crypto – die wichtigsten Analysen, kein Spam. Jederzeit abbestellbar.
Das Modell versteht laut DeepSeek nativ Bilder („native visual understanding”), ohne separates Vision-Modul. Die Vorgänger V4 Flash und das experimentelle V4-Flash-Vision-Exp vom 21. August werden damit eingestellt; die alten Modellnamen deepseek-v4-flash und deepseek-v4-flash-vision-exp leiten übergangsweise auf V4.1 Flash um.
Der zweite Hebel ist der KV-Cache – der Zwischenspeicher, in dem ein Sprachmodell den bisherigen Gesprächsverlauf hält. DeepSeek gibt an, dass V4.1 Flash dafür nur ein Viertel des HBM-Speichers und ein Achtel des SSD-Speichers der Vorgängergeneration braucht. Bei Agenten-Workloads, die immer wieder denselben langen Kontext mitschleppen, machen Cache-Treffer einen Großteil der Kosten aus. Genau dort setzt die Ersparnis an.
V4 Pro wird abgeschaltet – und auf Flash umgeleitet
Die eigentliche Nachricht steckt in der Produktpolitik. DeepSeek schreibt, dass Tests „mehrerer Parteien” V4.1 Flash vor V4 Pro sehen – bei Leistung, Kosten, Geschwindigkeit und Gesamtlaufzeit. Deshalb wird V4 Pro auslaufen: Ab dem 14. September 2026, 04:00 UTC, werden alle API-Anfragen an deepseek-v4-pro automatisch an V4.1 Flash weitergereicht und zu Flash-Preisen abgerechnet – bis ein V4.1 Pro erscheint.
Die neuen Preise gelten seit dem 10. September. TechNode berichtet unter Berufung auf die API-Benachrichtigung von Nebenzeit-Tarifen von 0,02 Yuan pro Million Tokens bei Cache-Treffern, 1 Yuan bei Cache-Fehlschlägen und 4 Yuan pro Million Ausgabe-Tokens; zu Spitzenzeiten das Doppelte. DeepSeeks englische Preisseite nennt 0,003 / 0,15 / 0,60 US-Dollar pro Million Tokens in der Nebenzeit; als Spitzenzeit gelten Montag bis Freitag 01:00–04:00 und 06:00–10:00 UTC. DeepSeek behält das Peak/Off-Peak-Modell also bei, das mit V4 Pro im August eingeführt wurde.
Zur Offenheit: Wie schon beim V4 Flash vom Juli sind die Gewichte offen. Das Hugging-Face-Repository ist vollständig: 48 Safetensors-Dateien in FP8 unter MIT-Lizenz, dazu der technische Bericht und Referenzcode für Prompt-Encoding und Inferenz. Ein Jinja-Chat-Template fehlt allerdings – wer lokal betreiben will, braucht DeepSeeks Encoding-Referenz oder das Toolkit deepseek-recipe.
Was das für dich bedeutet – Einordnung aus der Praxis
Zwei Dinge fallen mir auf. Erstens: Die Aussage „unser kleinstes Modell schlägt unser größtes” ist ein Hersteller-Benchmark. Sie kann stimmen – asymmetrische Architekturen und besseres Post-Training können einen 8B/16B-aktiven Pfad tatsächlich vor ein älteres, dichteres Modell bringen. Aber wer V4 Pro produktiv einsetzt, sollte das nicht glauben, sondern messen. Die Zwangsumleitung am 14. September ist dafür ein hartes Datum: Danach bekommt man auf denselben API-Aufruf ein anderes Modell mit anderem Verhalten.
Zweitens, und das ist der CISO-Blick: DeepSeek ist ein chinesischer Anbieter, dessen API-Server in China stehen. Für Firmendaten, Kundendaten oder Code mit Geschäftsgeheimnissen ist die Cloud-API in den meisten europäischen Unternehmen keine Option – unabhängig davon, wie gut oder günstig das Modell ist. Der spannende Teil an DeepSeek war immer die Möglichkeit, offene Gewichte selbst zu hosten. Der um den Faktor vier bis acht geschrumpfte KV-Cache ist dafür eine gute Nachricht: Er senkt genau den Speicherbedarf, der beim Selbsthosting langer Kontexte am meisten kostet. Was das für die Hardware für lokale KI-Modelle bedeutet, hängt am Ende vom Quantisierungsgrad ab – 552B Parameter bleiben 552B Parameter, auch wenn nur wenige davon aktiv sind.
Konkreter Praxis-Tipp
- Bis zum 14. September prüfen, ob du
deepseek-v4-proirgendwo im Code hast. Wenn ja: die Modell-ID bewusst aufdeepseek-flashsetzen und deine eigenen Testfälle dagegen laufen lassen, statt die stille Umleitung abzuwarten. - Regressionstests aufsetzen: 20–50 repräsentative Prompts mit erwarteten Ergebnissen. Bei jedem Modellwechsel automatisiert vergleichen – das gilt für jeden Anbieter, nicht nur DeepSeek.
- Datenklassifizierung vor Modellwahl: Alles, was intern oder vertraulich ist, gehört nicht in eine Cloud-API außerhalb der EU. Für solche Daten ist Selbsthosting der einzige Weg, offene Modelle zu nutzen.
- Off-Peak nutzen: Wer unkritische Batch-Jobs (Klassifizierung, Zusammenfassungen öffentlicher Texte) fährt, halbiert die Kosten, wenn er sie in die Nebenzeiten legt.
Quellen
- DeepSeek – Introducing DeepSeek-V4.1-Flash (10. September 2026)
- Hugging Face – deepseek-ai/DeepSeek-V4.1-Flash
- DeepSeek API Docs – Change Log · Models & Pricing
- TechNode – DeepSeek formally launches V4.1 Flash, routes V4 Pro requests to Flash
Diese Analysen als Newsletter
Ein Mal pro Woche Klartext zu KI, Security & Crypto – direkt in dein Postfach.
Jetzt anmelden