DeepSeek V4 Flash è ora su Felo — Gratis per gli abbonati Pro per 7 giorni
DeepSeek V4 Flash è ora su Felo. Gli abbonati Felo Pro esistenti avranno 7 giorni di accesso gratuito a partire dal 6 agosto — con Search, Codex/CC e Deep Research inclusi.

DeepSeek V4 Flash ha lanciato la sua versione di produzione il 31 luglio, e i numeri hanno sorpreso tutti. L’anteprima di aprile era buona. Questa versione è diversa. I benchmark degli agenti sono saliti. DSpark speculative decoding porta la velocità oltre i 60 token al secondo. E da oggi, 6 agosto, gli abbonati Felo Pro esistenti avranno 7 giorni di accesso gratuito a V4 Flash — con Search, Codex e tutto il toolkit premium incluso. Nessun upgrade, nessun pagamento extra, nessuna carta di credito.
V4 Flash era già il modello con il miglior rapporto qualità-prezzo sul mercato. Ora compete con i sistemi di punta sulle attività di ingegneria che le persone svolgono ogni giorno. Ecco cosa è cambiato, perché è importante e cosa include davvero questa finestra di 7 giorni.
Cosa è cambiato tra aprile e oggi
V4 Flash non è una versione ridotta di V4 Pro. È stato costruito per obiettivi diversi: velocità pura, basso consumo di risorse e usabilità nelle pipeline reali, non solo nei benchmark.
L’architettura: 284 miliardi di parametri totali in un layout Mixture of Experts, con solo 13 miliardi attivi per token. Meno di un terzo del conteggio attivo di DeepSeek V3. Eppure supera V3 in quasi tutti i benchmark pratici. La differenza sta in un design di attenzione ibrido — Compressed Sparse Attention (CSA) abbinato a Heavily Compressed Attention (HCA) — che riduce i FLOPs di inferenza al 10% di quelli consumati da V3 per lo stesso contesto da un milione di token.
Cosa significa in pratica: una finestra di contesto completa da 1M token gira su una singola macchina da 128GB. Sono 750.000 parole. Un intero codebase. Un fascicolo legale di 300 pagine. Tre romanzi uno dopo l’altro. Nessun chunking, nessuna finestra scorrevole, nessun trucco.
Con 1M di contesto, V4 Flash usa circa il 7% della memoria KV cache che serviva a V3.2. Non un piccolo miglioramento. Un’altra categoria.
DSpark è l’altro elemento. È un modulo di speculative decoding che genera e valida token candidati in parallelo, raddoppiando di fatto la velocità. Il risultato: oltre 60 token al secondo su hardware comune. Le sessioni lunghe con agenti sono reattive, non sembrano più attese interminabili.
Il modello ha tre modalità di ragionamento che puoi selezionare per richiesta:
| Modalità | Comportamento | Quando usarla |
|---|---|---|
| Non-Think | Veloce, senza overhead chain-of-thought | Ricerche rapide, traduzioni, bozze |
| Think High | Ragionamento esplicito passo-passo | Debug, matematica, analisi strutturata |
| Think Max | Massima profondità di ragionamento | Prove complesse, workflow agent multi-step |
Non è solo una questione estetica. Usa Non-Think per il 90% dei tuoi prompt e passa a Think Max solo quando serve davvero. Risparmi tempo e token senza limitare le tue possibilità.

I benchmark che contano davvero
L’anteprima di aprile aveva numeri solidi. Il rilascio di produzione 0731 è stato costruito attorno a una fase di post-training focalizzata quasi esclusivamente sulle capacità agentiche. Il salto non è sottile:
| Benchmark | Anteprima (Aprile) | Produzione (0731) | V4 Pro (riferimento) |
|---|---|---|---|
| SWE-bench Verified | — | 79.0% | 80.6% |
| Terminal Bench 2.1 | 61.8 | 82.7 | — |
| Cybergym | — | 76.7 | — |
| DeepSWE | 7.3 | 54.4 | — |
| GPQA Diamond | — | 71.2% | — |
| LiveCodeBench | — | 55.2% | 91.6% |
SWE-bench è quello che tutti citano, e stavolta la fissazione è giustificata. 79.0% porta V4 Flash a soli 1.6 punti da V4 Pro, un modello con oltre 5 volte i parametri attivi. Si trova nella stessa conversazione di sistemi che costano da 10 a 50 volte di più per query.
Il Flash da 284B parametri supera l’anteprima di aprile del Pro da 1.6T parametri sul coding agentico. Il post-training fa la maggior parte del lavoro, non la scala del modello.
Il compromesso onesto: V4 Flash è ancora dietro a Pro sul richiamo di conoscenze pure e sui problemi di coding da competizione. Ma queste non sono le attività su cui la maggior parte degli ingegneri lavora ogni giorno. Lettura di PR, debug tra file, refactoring, scrittura di test — sul lavoro ingegneristico reale, il divario è quasi invisibile.
Cosa sblocca davvero la finestra gratuita di 7 giorni
Per i prossimi 7 giorni, V4 Flash è gratis per gli abbonati Felo Pro. E Pro su Felo è molto più di un semplice selettore di modelli.
Pro Search con V4 Flash sotto il cofano
Felo Search abbina il ragionamento di V4 Flash alla ricerca web live. Fai una domanda in linguaggio naturale. Felo raccoglie fonti in varie lingue, sintetizza ciò che trova e ti dà una risposta diretta con citazioni inline. Niente lista di link. Niente spazzatura SEO. Solo la risposta, ancorata a fonti verificabili.
Pro Search va più a fondo. Più fonti per query. Contesti più lunghi elaborati. Risposte che coprono i casi limite invece di fermarsi all’ovvio. La modalità Deep Research trasforma una singola domanda in un report strutturato multi-pagina con intestazioni e fonti citate. Il tipo di lavoro che normalmente richiederebbe un pomeriggio.
Integrazione Codex e CC
Questa è la parte che interessa agli sviluppatori. V4 Flash supporta nativamente l’API Responses di OpenAI, il che significa che si integra con Codex CLI, ChatGPT Desktop e l’estensione Codex per VS Code senza layer di traduzione o shim di compatibilità. Imposta deepseek-v4-flash nel tuo config e stai usando un agente di coding di livello frontier.
Durante la finestra di 7 giorni, gli abbonati Pro hanno tutto: coding agentico con V4 Flash che guida il loop, orchestrazione degli strumenti, modifiche multi-file e una finestra di contesto da 1M token che contiene l’intero repository senza chunking.

Il resto del toolkit Pro
- 15.000 crediti caricati subito, più 200 crediti giornalieri
- Ricerche Pro illimitate. Anche dopo aver esaurito i crediti, hai comunque 300 ricerche Pro al giorno
- Analisi file: carica PDF, CSV, file di codice e lascia che V4 Flash li elabori
- Generazione slide: trasforma i risultati di ricerca in presentazioni
- Mind map: visualizza come fonti e concetti si collegano
- Aggregazione cross-lingua: Felo legge fonti in inglese, cinese, giapponese, coreano e sintetizza nella tua lingua
Nessun rinnovo automatico. La finestra gratuita termina dopo 7 giorni, e V4 Flash torna al prezzo standard Pro.
Come richiedere la finestra gratuita
Tre passaggi, meno di due minuti:
Passo 1: Accedi al tuo account Felo Pro su felo.ai. L’offerta è per gli abbonati Pro esistenti.
Passo 2: Da oggi, 6 agosto, DeepSeek V4 Flash è gratis per 7 giorni. L’offerta è attiva nella tua dashboard — nessun codice necessario.
Passo 3: Apri Felo Search, seleziona DeepSeek V4 Flash dal menu dei modelli e avvia una ricerca Pro. Oppure vai su playground.felo.ai per chat diretta, o punta il tuo config Codex su deepseek-v4-flash.
La finestra di 7 giorni parte oggi, 6 agosto. Nessuna coda di approvazione, nessun pagamento, nessuna carta registrata.

Perché usare V4 Flash su Felo invece che tramite API
Puoi chiamare V4 Flash direttamente tramite l’API di DeepSeek. È economico. $0.14 per un milione di token input, $0.28 per un milione di token output. Ma l’accesso API puro lascia molto sul tavolo.
Grounding in tempo reale. V4 Flash è solo testo. Non cerca sul web e ha un cutoff di training. Felo aggiunge la ricerca live, così hai ragionamento frontier ancorato a informazioni attuali, non pesi obsoleti.
Confronto modelli side-by-side. Il selettore modelli di Felo include GPT-5.5, Claude Opus 5, Gemini 3.6 Flash e entrambe le varianti V4. Cambia modello a metà conversazione. Inizia un thread con V4 Flash per velocità, passa a Opus per un secondo parere su logica complessa. Stesso contesto, stesse fonti.
I risultati di ricerca non sono vicoli ciechi. Esporta i risultati in un LiveDoc. Genera slide dai punti chiave. Crea una mind map per vedere come le fonti si collegano. La finestra gratuita ti dà l’intera pipeline.
Temporaneo, non permanente. È una finestra gratuita di 7 giorni per gli abbonati Felo Pro. Alla fine, V4 Flash torna al prezzo standard Pro. Usa la settimana per decidere se merita un posto fisso nel tuo workflow.
Come si posiziona V4 Flash rispetto agli altri modelli su Felo
Felo ti dà accesso a una serie di modelli frontier, non solo DeepSeek. Ecco dove si inserisce V4 Flash e quando potresti preferire altro.
V4 Flash vs GPT-5.5. GPT-5.5 è più forte su scrittura sfumata, lavori creativi e gestione di istruzioni ambigue. Ma costa molto di più per query via API. Su Felo, entrambi sono disponibili. Se stai facendo debug o ricerche rapide, V4 Flash spesso finisce prima. Se ti serve prosa con tono particolare o formattazione specifica, GPT-5.5 resta la scelta più sicura.
V4 Flash vs Claude Opus 5. Opus domina su scrittura long-form, ragionamento attento su documenti lunghi e rispetto di istruzioni di formattazione dettagliate. V4 Flash è più veloce, economico e ormai abbastanza vicino sul codice che molti sviluppatori lo scelgono di default. Pensa a Opus come lo strumento di precisione quando il risultato deve davvero brillare.
V4 Flash vs V4 Pro. Pro è migliore su compiti intensivi di conoscenza, matematica da competizione e le sfide di coding più difficili. Flash è migliore su tutto il resto, ed è così veloce che ti dimentichi di aspettare il modello. La finestra gratuita copre entrambi. Prova Pro per il problema più difficile e Flash per tutto il resto.
V4 Flash vs Gemini 3.6 Flash. Entrambi sono modelli veloci con grandi finestre di contesto. Gemini ha input multimodale (immagini, video). V4 Flash è solo testo ma ha benchmark agentici di coding più forti e il vantaggio della licenza MIT. Se ti serve visione, scegli Gemini. Se ti serve un agente che scrive e modifica codice, V4 Flash ha il vantaggio.
FAQ
La finestra gratuita di 7 giorni è davvero gratis?
Sì — per gli abbonati Felo Pro esistenti. Nessuna carta di credito, nessun rinnovo automatico. La finestra parte oggi, 6 agosto, e dura 7 giorni.
Cosa succede dopo i 7 giorni?
V4 Flash torna al prezzo standard Pro. Le altre funzionalità Pro restano invariate. Nulla viene cancellato — la cronologia delle conversazioni, i LiveDoc e le ricerche salvate rimangono.
Serve installare qualcosa per l’integrazione Codex?
No. V4 Flash supporta nativamente l’API Responses. Imposta deepseek-v4-flash come modello nel config Codex e funziona su Codex CLI, ChatGPT Desktop e l’estensione VS Code. Una modifica al config, vale ovunque.
Come si confronta con l’uso diretto dell’API DeepSeek?
L’API DeepSeek è economica e veloce. Felo aggiunge grounding web in tempo reale, confronto multi-modello e esportazione one-click in documenti, slide e mind map. Se ti serve solo inferenza pura, usa l’API. Se vuoi risposte arricchite dalla ricerca e un workspace attorno al modello, Felo è la scelta migliore.
Posso usare V4 Flash su mobile?
Sì. Felo Search funziona su qualsiasi browser mobile su felo.ai. Il LLM Playground su playground.felo.ai è anche mobile-ready.
Il primo modello open-weight che i team usano davvero in produzione
Ecco cosa rende V4 Flash diverso dagli altri modelli open-weight: i team di ingegneria lo stanno inserendo nelle pipeline di produzione come vero sostituto delle alternative closed-source. Non come esperimento. Non come fallback. Come modello principale.
Licenza MIT. Pesi completi su Hugging Face. Fine-tuning commerciale consentito. E con il rilascio 0731, le capacità agentiche hanno superato la soglia dove “abbastanza buono per il prezzo” è diventato “abbastanza buono”. La finestra gratuita di 7 giorni su Felo è il modo più semplice per gli abbonati Pro di vedere se regge nel tuo workflow.
Accedi a Felo Pro e inizia a usare DeepSeek V4 Flash gratis oggi — la finestra di 7 giorni si chiude il 12 agosto.
Usa DeepSeek V4 Flash Gratis →
Questo articolo è disponibile anche in English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Tiếng Việt, Türkçe, ไทย, Español, বাংলা and Português.