DeepSeek V4 Flash ist jetzt auf Felo — 7 Tage kostenlos für Pro-Abonnenten
DeepSeek V4 Flash ist jetzt auf Felo verfügbar. Bestehende Felo Pro-Abonnenten erhalten ab dem 6. August 7 Tage kostenlosen Zugang — inklusive Suche, Codex/CC und Deep Research.

DeepSeek V4 Flash hat sein Produktions-Release am 31. Juli veröffentlicht, und die Zahlen haben viele überrascht. Die Vorschau im April war solide. Diese Version ist anders. Die Agenten-Benchmarks sind sprunghaft angestiegen. DSpark spekulatives Decoding bringt den Durchsatz auf über 60 Token pro Sekunde. Und ab heute, dem 6. August, erhalten bestehende Felo Pro-Abonnenten 7 Tage kostenlosen Zugang zu V4 Flash — inklusive Suche, Codex und dem kompletten Premium-Toolkit. Kein Upgrade, keine zusätzliche Zahlung, keine Kreditkarte.
V4 Flash war bereits das Modell mit dem besten Preis-Leistungs-Verhältnis auf dem Markt. Jetzt konkurriert es mit Flaggschiff-Systemen bei den Engineering-Aufgaben, die im Alltag wirklich zählen. Hier erfährst du, was sich geändert hat, warum das wichtig ist und was das 7-Tage-Fenster tatsächlich beinhaltet.
Was sich zwischen April und jetzt geändert hat
V4 Flash ist kein abgespecktes V4 Pro. Es wurde für andere Ziele entwickelt: rohe Geschwindigkeit, niedriger Ressourcenverbrauch und Nutzbarkeit in echten Pipelines statt auf Benchmark-Tabellen.
Die Architektur: 284 Milliarden Gesamtparameter in einer Mixture-of-Experts-Struktur, wobei pro Token nur 13 Milliarden aktiv sind. Das ist weniger als ein Drittel der aktiven Parameter von DeepSeek V3. Trotzdem schlägt es V3 in fast jedem praxisrelevanten Benchmark. Der Unterschied liegt im hybriden Attention-Design — Compressed Sparse Attention (CSA) kombiniert mit Heavily Compressed Attention (HCA) — das die Inferenz-FLOPs auf 10 % dessen reduziert, was V3 für denselben Million-Token-Kontext benötigte.
Was das in der Praxis bedeutet: Ein vollständiges 1M-Token-Kontextfenster läuft auf einer einzigen 128GB-Maschine. Das sind 750.000 Wörter. Ein kompletter Codebase. Eine 300-seitige Klageschrift. Drei Romane hintereinander. Kein Chunking, keine Sliding Windows, keine Tricks.
Bei 1M Kontext nutzt V4 Flash etwa 7 % des KV-Cache-Speichers, den V3.2 benötigte. Kein inkrementeller Fortschritt. Eine andere Kategorie.
DSpark ist das andere Puzzlestück. Es handelt sich um ein spekulatives Decoding-Modul, das Kandidaten-Tokens parallel generiert und validiert und so den Durchsatz effektiv verdoppelt. Das Ergebnis: Über 60 Token pro Sekunde auf Standard-Hardware. Lange Agenten-Sitzungen fühlen sich reaktionsschnell an, statt wie das Warten auf einen Build.
Das Modell bietet drei Reasoning-Modi, die du pro Anfrage umschalten kannst:
| Modus | Verhalten | Wann verwenden |
|---|---|---|
| Non-Think | Schnell, kein Chain-of-Thought-Overhead | Schnelle Nachschlagen, Übersetzungen, Entwürfe |
| Think High | Explizites Schritt-für-Schritt-Denken | Debugging, Mathematik, strukturierte Analysen |
| Think Max | Volle Reasoning-Tiefe | Schwierige Beweise, mehrstufige Agenten-Workflows |
Das ist nicht nur Kosmetik. Nutze Non-Think für 90 % deiner Prompts und schalte nur auf Think Max, wenn es wirklich nötig ist. So sparst du Zeit und Tokens, ohne deine Möglichkeiten zu begrenzen.

Die Benchmarks, die wirklich zählen
Die Vorschau im April lieferte solide Zahlen. Das 0731-Produktionsrelease basiert auf einem Post-Training-Lauf, der fast ausschließlich auf agentische Fähigkeiten abzielte. Der Sprung ist deutlich:
| Benchmark | Vorschau (April) | Produktion (0731) | V4 Pro (zum Vergleich) |
|---|---|---|---|
| SWE-bench Verified | — | 79,0 % | 80,6 % |
| Terminal Bench 2.1 | 61,8 | 82,7 | — |
| Cybergym | — | 76,7 | — |
| DeepSWE | 7,3 | 54,4 | — |
| GPQA Diamond | — | 71,2 % | — |
| LiveCodeBench | — | 55,2 % | 91,6 % |
SWE-bench ist der Benchmark, den alle zitieren, und diesmal ist die Fixierung gerechtfertigt. 79,0 % bringt V4 Flash auf 1,6 Punkte an V4 Pro heran, ein Modell mit über 5x so vielen aktiven Parametern. Es spielt in derselben Liga wie Systeme, die 10 bis 50 Mal mehr pro Anfrage kosten.
Das 284B-Parameter-Flash schlägt die April-Vorschau des 1,6T-Parameter-Pro bei agentischem Coding. Das Post-Training macht hier den Großteil der Arbeit, nicht die Modellgröße.
Der ehrliche Kompromiss: V4 Flash liegt bei reiner Wissensabfrage und Wettbewerbs-Coding-Problemen noch hinter Pro. Aber das sind nicht die Aufgaben, mit denen sich die meisten Entwickler täglich beschäftigen. PRs lesen, Debugging über mehrere Dateien, Refactoring, Tests schreiben — bei echter Engineering-Arbeit ist der Unterschied kaum sichtbar.
Was das 7-Tage-Fenster tatsächlich freischaltet
In den nächsten 7 Tagen ist V4 Flash für Felo Pro-Abonnenten kostenlos. Und Pro auf Felo ist mehr als nur ein Modell-Auswähler.
Pro Search mit V4 Flash im Hintergrund
Felo Search kombiniert das Reasoning von V4 Flash mit Live-Websuche. Stelle eine Frage in natürlicher Sprache. Felo zieht Quellen aus verschiedenen Sprachen heran, fasst die Ergebnisse zusammen und liefert eine direkte Antwort mit Inline-Zitaten. Keine Linkliste. Kein SEO-Müll. Nur die Antwort, verankert an Quellen, die du direkt überprüfen kannst.
Pro Search geht noch weiter. Mehr Quellen pro Anfrage. Längere Kontexte werden verarbeitet. Antworten, die auch Randfälle abdecken, statt beim Offensichtlichen zu stoppen. Im Deep Research-Modus wird aus einer einzigen Frage ein strukturierter, mehrseitiger Bericht mit Abschnittsüberschriften und Quellenangaben. Genau das, wofür man sonst einen Nachmittag recherchieren würde.
Codex- und CC-Integration
Das ist der Teil, der Entwickler interessiert. V4 Flash unterstützt nativ die Responses API von OpenAI, was bedeutet, dass es sich ohne Übersetzungsschichten oder Kompatibilitätsprobleme in Codex CLI, ChatGPT Desktop und die VS Code Codex-Erweiterung einfügt. Setze deepseek-v4-flash in deiner Konfiguration und du nutzt einen Coding-Agenten der Spitzenklasse.
Während des 7-Tage-Fensters erhalten Pro-Abonnenten das volle Setup: agentisches Coding mit V4 Flash als Motor, Tool-Orchestrierung, Multi-File-Edits und ein 1M-Token-Kontextfenster, das dein gesamtes Repo ohne Chunking aufnehmen kann.

Der Rest des Pro-Toolkits
- 15.000 Credits zu Beginn, plus 200 tägliche Credits
- Unbegrenzte Pro-Suchen. Auch wenn die Credits aufgebraucht sind, erhältst du weiterhin 300 Pro-Suchen pro Tag
- Dateianalyse: Lade PDFs, CSVs, Code-Dateien hoch und lasse V4 Flash sie analysieren
- Foliensatz-Generierung: Verwandle Suchergebnisse in Präsentationsfolien
- Mindmaps: Visualisiere, wie Quellen und Konzepte zusammenhängen
- Sprachübergreifende Aggregation: Felo liest englische, chinesische, japanische und koreanische Quellen und fasst sie in deiner Sprache zusammen
Kein automatisches Verlängern. Das kostenlose Fenster endet nach 7 Tagen, danach gilt für V4 Flash wieder der reguläre Pro-Preis.
So sicherst du dir das kostenlose Fenster
Drei Schritte, weniger als zwei Minuten:
Schritt 1: Melde dich bei deinem Felo Pro-Konto auf felo.ai an. Dieses Angebot gilt für bestehende Pro-Abonnenten.
Schritt 2: Ab heute, dem 6. August, ist DeepSeek V4 Flash für 7 Tage kostenlos. Das Angebot ist direkt in deinem Dashboard verfügbar — kein Code nötig.
Schritt 3: Öffne Felo Search, wähle DeepSeek V4 Flash im Modell-Dropdown aus und starte eine Pro-Suche. Oder gehe direkt zu playground.felo.ai für den Chat, oder stelle deine Codex-Konfiguration auf deepseek-v4-flash.
Das 7-Tage-Fenster beginnt heute, am 6. August. Keine Warteschlange, keine Zahlungsschranke, keine hinterlegte Karte.

Warum V4 Flash über Felo statt direkt über die API nutzen?
Du kannst V4 Flash direkt über die DeepSeek-API ansprechen. Es ist günstig. $0,14 pro Million Input-Tokens, $0,28 pro Million Output. Aber reiner API-Zugriff lässt vieles ungenutzt.
Echtzeit-Verankerung. V4 Flash ist textbasiert. Es durchsucht nicht das Web und hat einen Trainings-Cutoff. Felo legt Live-Suche darüber, sodass du fortschrittliches Reasoning bekommst, das auf aktuellen Informationen basiert, nicht auf veralteten Gewichten.
Modellvergleich Seite an Seite. Der Modellselektor von Felo umfasst GPT-5.5, Claude Opus 5, Gemini 3.6 Flash und beide V4-Varianten. Wechsle das Modell mitten im Gespräch. Starte einen Thread mit V4 Flash für Geschwindigkeit, schalte zu Opus für eine Zweitmeinung bei kniffliger Logik. Gleicher Kontext, gleiche Quellen.
Suchergebnisse sind keine Sackgassen. Exportiere Ergebnisse in ein LiveDoc. Erstelle Folien aus den wichtigsten Erkenntnissen. Baue eine Mindmap, um die Zusammenhänge der Quellen zu sehen. Das kostenlose Fenster bietet dir die komplette Pipeline.
Begrenzt, nicht dauerhaft. Dies ist ein 7-tägiges kostenloses Fenster für Felo Pro-Abonnenten. Danach gilt wieder der reguläre Pro-Preis für V4 Flash. Nutze die Woche, um zu entscheiden, ob es dauerhaft in deinen Workflow passt.
Wie V4 Flash im Vergleich zu anderen Modellen auf Felo abschneidet
Felo bietet dir Zugriff auf eine Auswahl von Spitzenmodellen, nicht nur DeepSeek. Hier siehst du, wo V4 Flash im Vergleich steht und wann du vielleicht zu einem anderen Modell greifen solltest.
V4 Flash vs GPT-5.5. GPT-5.5 ist stärker bei nuancierten Schreibaufgaben, kreativer Arbeit und dem Umgang mit mehrdeutigen Anweisungen. Aber es kostet auf API-Ebene deutlich mehr pro Anfrage. Auf Felo sind beide verfügbar. Wenn du Code debuggen oder schnelle Suchen durchführen willst, ist V4 Flash oft schneller fertig. Wenn du Wert auf einen bestimmten Ton oder sehr spezifisches Format legst, ist GPT-5.5 die sicherere Wahl.
V4 Flash vs Claude Opus 5. Opus ist führend bei langen Texten, sorgfältigem Reasoning über buchlange Dokumente und beim Befolgen detaillierter Formatierungsanweisungen. V4 Flash ist schneller, günstiger und inzwischen beim Coding so nah dran, dass viele Entwickler es für den Alltag bevorzugen. Sieh Opus als Präzisionswerkzeug, wenn das Ergebnis wirklich überzeugen muss.
V4 Flash vs V4 Pro. Pro ist besser bei wissensintensiven Aufgaben, Wettbewerbs-Mathematik und den schwierigsten Coding-Herausforderungen. Flash ist bei allem anderen besser — und so schnell, dass du vergisst, dass du auf ein Modell wartest. Das kostenlose Fenster umfasst beide. Probiere Pro für die härtesten Probleme und Flash für alles andere.
V4 Flash vs Gemini 3.6 Flash. Beide sind schnelle Modelle mit großem Kontextfenster. Gemini unterstützt multimodale Eingaben (Bilder, Video). V4 Flash ist textbasiert, hat aber stärkere agentische Coding-Benchmarks und den Vorteil der MIT-Lizenz. Wenn du Vision brauchst, nimm Gemini. Wenn du einen Agenten willst, der Code schreibt und bearbeitet, hat V4 Flash die Nase vorn.
FAQ
Ist das 7-tägige kostenlose Fenster wirklich kostenlos?
Ja — für bestehende Felo Pro-Abonnenten. Keine Kreditkarte, kein automatisches Verlängern. Das Fenster startet heute, am 6. August, und läuft 7 Tage.
Was passiert nach den 7 Tagen?
V4 Flash kehrt zum regulären Pro-Preis zurück. Deine anderen Pro-Funktionen bleiben unverändert. Nichts wird gelöscht — dein Gesprächsverlauf, LiveDocs und gespeicherte Suchen bleiben erhalten.
Muss ich für die Codex-Integration etwas installieren?
Nein. V4 Flash unterstützt die Responses API nativ. Setze deepseek-v4-flash als Modell in der Codex-Konfiguration und es funktioniert in Codex CLI, ChatGPT Desktop und der VS Code-Erweiterung. Eine Änderung in der Konfiguration, überall wirksam.
Wie unterscheidet sich das von der direkten Nutzung der DeepSeek-API?
Die DeepSeek-API ist günstig und schnell. Felo bietet zusätzlich Echtzeit-Websuche, eine Multi-Modell-Vergleichsoberfläche und den Export mit einem Klick in Dokumente, Folien und Mindmaps. Wenn du nur reine Inferenz brauchst, nutze die API. Wenn du suchgestützte Antworten und einen Workspace rund ums Modell willst, ist Felo die bessere Wahl.
Kann ich V4 Flash auf dem Handy nutzen?
Ja. Felo Search funktioniert in jedem mobilen Browser unter felo.ai. Der LLM Playground unter playground.felo.ai ist ebenfalls mobil nutzbar.
Das erste Open-Weight-Modell, das Teams wirklich einsetzen
Das unterscheidet V4 Flash von anderen Open-Weight-Releases: Engineering-Teams setzen es produktiv als echten Ersatz für Closed-Source-Alternativen ein. Nicht als Experiment. Nicht als Notlösung. Als Hauptmodell.
MIT-lizenziert. Volle Gewichte auf Hugging Face. Kommerzielle Feinabstimmung erlaubt. Und mit dem 0731-Release haben die agentischen Fähigkeiten die Schwelle von „gut genug für den Preis“ zu „einfach gut genug“ überschritten. Das 7-tägige kostenlose Fenster auf Felo ist der einfachste Weg für Pro-Abonnenten, herauszufinden, ob es für den eigenen Workflow taugt.
Melde dich bei Felo Pro an und nutze DeepSeek V4 Flash ab heute kostenlos — das 7-Tage-Fenster endet am 12. August.
DeepSeek V4 Flash kostenlos nutzen →
Dieser Beitrag ist auch in folgenden Sprachen verfügbar: English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Tiếng Việt, Türkçe, Italiano, ไทย, Español, বাংলা and Português.