DeepSeek V4 Flash Agora no Felo — Grátis para Assinantes Pro por 7 Dias
DeepSeek V4 Flash agora está disponível no Felo. Assinantes Pro existentes do Felo ganham 7 dias de acesso gratuito a partir de 6 de agosto — com Search, Codex/CC e Deep Research inclusos.

O DeepSeek V4 Flash lançou sua versão de produção em 31 de julho, e os números surpreenderam muita gente. O preview de abril já era bom. Esta versão é diferente. Os benchmarks de agentes dispararam. O DSpark, com decodificação especulativa, ultrapassa 60 tokens por segundo. E a partir de hoje, 6 de agosto, assinantes Pro do Felo ganham 7 dias de acesso gratuito ao V4 Flash — com Search, Codex e todo o kit premium incluso. Sem upgrade, sem pagamento extra, sem cartão de crédito.
O V4 Flash já era o melhor modelo em custo-benefício do mercado. Agora, compete de igual para igual com sistemas topo de linha nas tarefas de engenharia que as pessoas realmente fazem no dia a dia. Veja o que mudou, por que isso importa e o que está incluso nesta janela de 7 dias.
O que mudou de abril para cá
O V4 Flash não é uma versão simplificada do V4 Pro. Ele foi criado com outros objetivos: velocidade bruta, baixo consumo de recursos e usabilidade em pipelines reais, não apenas em rankings de benchmark.
A arquitetura: 284 bilhões de parâmetros totais em um layout Mixture of Experts, com apenas 13 bilhões ativos por token. Isso é menos de um terço do número ativo do DeepSeek V3. Ainda assim, supera o V3 em quase todos os benchmarks práticos. A diferença vem de um design híbrido de atenção — Compressed Sparse Attention (CSA) combinado com Heavily Compressed Attention (HCA) — que reduz os FLOPs de inferência para 10% do que o V3 consumia para o mesmo contexto de um milhão de tokens.
Na prática: uma janela de contexto completa de 1M de tokens roda em uma única máquina de 128GB. São 750.000 palavras. Um código inteiro. Um processo jurídico de 300 páginas. Três romances enfileirados. Sem chunking, sem janelas deslizantes, sem truques.
Com 1M de contexto, o V4 Flash usa cerca de 7% da memória de cache KV que o V3.2 precisava. Não é um avanço incremental. É outra categoria.
O DSpark é o outro diferencial. É um módulo de decodificação especulativa que gera e valida tokens candidatos em paralelo, dobrando o throughput. Resultado: mais de 60 tokens por segundo em hardware comum. Sessões longas de agentes ficam responsivas, sem aquela sensação de esperar uma compilação terminar.
O modelo tem três modos de raciocínio que você alterna por requisição:
| Modo | Comportamento | Quando usar |
|---|---|---|
| Non-Think | Rápido, sem overhead de chain-of-thought | Consultas rápidas, traduções, rascunhos |
| Think High | Raciocínio passo a passo explícito | Debug, matemática, análise estruturada |
| Think Max | Profundidade máxima de raciocínio | Provas difíceis, fluxos de agentes multi-etapas |
Isso não é cosmético. Use Non-Think para 90% dos seus prompts e só troque para Think Max quando realmente precisar. Você economiza tempo e tokens sem limitar o potencial.

Os benchmarks que realmente importam
O preview de abril já trouxe números sólidos. O lançamento de produção 0731 foi construído em cima de um pós-treinamento focado quase exclusivamente em capacidades agenticas. O salto não é sutil:
| Benchmark | Preview (abril) | Produção (0731) | V4 Pro (referência) |
|---|---|---|---|
| SWE-bench Verified | — | 79,0% | 80,6% |
| Terminal Bench 2.1 | 61,8 | 82,7 | — |
| Cybergym | — | 76,7 | — |
| DeepSWE | 7,3 | 54,4 | — |
| GPQA Diamond | — | 71,2% | — |
| LiveCodeBench | — | 55,2% | 91,6% |
O SWE-bench é o benchmark que todo mundo cita, e desta vez faz sentido. 79,0% coloca o V4 Flash a apenas 1,6 pontos do V4 Pro, um modelo com mais de 5x os parâmetros ativos. Ele entra na mesma conversa que sistemas que custam de 10 a 50 vezes mais por consulta.
O Flash de 284B parâmetros supera o preview de abril do Pro de 1,6T parâmetros em codificação agentica. O pós-treinamento faz quase todo o trabalho aqui, não a escala do modelo.
O trade-off honesto: o V4 Flash ainda fica atrás do Pro em recall bruto de conhecimento e problemas de código de competição. Mas essas não são as tarefas que a maioria dos engenheiros faz no dia a dia. Ler PRs, debugar entre arquivos, refatorar, escrever testes — no trabalho real de engenharia, a diferença é quase imperceptível.
O que a janela gratuita de 7 dias realmente libera
Nos próximos 7 dias, o V4 Flash está grátis para assinantes Pro do Felo. E o Pro no Felo é mais do que um seletor de modelos.
Pro Search com V4 Flash por trás
O Felo Search combina o raciocínio do V4 Flash com busca web ao vivo. Faça uma pergunta em linguagem natural. O Felo busca fontes em vários idiomas, sintetiza o que encontra e te dá uma resposta direta com citações embutidas. Sem lista de links. Sem lixo de SEO. Só a resposta, ancorada em fontes que você pode clicar e conferir.
O Pro Search vai além. Mais fontes por consulta. Contextos mais longos processados. Respostas que cobrem casos de borda, não só o óbvio. O modo Deep Research transforma uma pergunta em um relatório estruturado de várias páginas, com seções e fontes citadas. Daqueles que você gastaria uma tarde compilando manualmente.
Integração com Codex e CC
Aqui é onde os desenvolvedores vão se interessar. O V4 Flash suporta nativamente a API de Responses da OpenAI, o que significa integração direta com Codex CLI, ChatGPT Desktop e a extensão Codex para VS Code, sem camadas de tradução ou gambiarras de compatibilidade. Basta definir deepseek-v4-flash no seu config e você já está rodando um agente de código de ponta.
Durante a janela de 7 dias, assinantes Pro têm acesso total: codificação agentica com o V4 Flash no loop, orquestração de ferramentas, edição multi-arquivo e uma janela de contexto de 1M de tokens que comporta todo o seu repositório sem chunking.

O restante do kit Pro
- 15.000 créditos carregados de início, mais 200 créditos diários
- Buscas Pro ilimitadas. Mesmo após acabar os créditos, você ainda tem 300 buscas Pro por dia
- Análise de arquivos: envie PDFs, CSVs, arquivos de código e deixe o V4 Flash trabalhar neles
- Geração de slides: transforme resultados de busca em apresentações
- Mapas mentais: visualize como fontes e conceitos se conectam
- Agregação multilíngue: o Felo lê fontes em inglês, chinês, japonês, coreano e sintetiza na sua língua
Sem renovação automática. A janela gratuita termina após 7 dias, e o V4 Flash volta ao preço padrão Pro.
Como ativar a janela gratuita
Três passos, menos de dois minutos:
Passo 1: Faça login na sua conta Felo Pro em felo.ai. Esta oferta é para assinantes Pro existentes.
Passo 2: A partir de hoje, 6 de agosto, o DeepSeek V4 Flash está grátis por 7 dias. A oferta já está ativa no seu painel — não precisa de código.
Passo 3: Abra o Felo Search, escolha DeepSeek V4 Flash no menu de modelos e faça uma busca Pro. Ou acesse playground.felo.ai para chat direto, ou aponte seu config do Codex para deepseek-v4-flash.
A janela de 7 dias começa hoje, 6 de agosto. Sem fila de aprovação, sem pagamento, sem cartão cadastrado.

Por que usar o V4 Flash pelo Felo e não direto pela API
Você pode chamar o V4 Flash diretamente pela API do DeepSeek. É barato. $0,14 por milhão de tokens de entrada, $0,28 por milhão de saída. Mas o acesso cru à API deixa muita coisa de fora.
Grounding em tempo real. O V4 Flash é só texto. Não busca na web e tem um cutoff de treinamento. O Felo adiciona busca ao vivo, então você tem raciocínio de ponta ancorado em informações atuais, não em pesos desatualizados.
Comparação lado a lado de modelos. O seletor do Felo inclui GPT-5.5, Claude Opus 5, Gemini 3.6 Flash e as duas variantes do V4. Troque de modelo no meio da conversa. Comece um tópico com o V4 Flash pela velocidade, mude para o Opus para uma segunda opinião em lógica difícil. Mesmo contexto, mesmas fontes.
Resultados de busca não são becos sem saída. Exporte descobertas para um LiveDoc. Gere slides dos principais insights. Crie um mapa mental para ver como as fontes se conectam. A janela gratuita te dá o pipeline completo.
Temporário, não permanente. Esta é uma janela gratuita de 7 dias para assinantes Pro do Felo. Quando acabar, o V4 Flash volta ao preço padrão Pro. Use a semana para decidir se ele merece um lugar fixo no seu fluxo de trabalho.
Como o V4 Flash se compara aos outros modelos do Felo
O Felo te dá acesso a uma pilha de modelos de ponta, não só ao DeepSeek. Veja onde o V4 Flash se encaixa e quando escolher outro.
V4 Flash vs GPT-5.5. O GPT-5.5 é melhor em tarefas de escrita refinada, trabalhos criativos e instruções ambíguas. Mas custa bem mais por consulta na API. No Felo, ambos estão disponíveis. Se você está debugando código ou fazendo buscas rápidas, o V4 Flash geralmente termina antes. Se precisa de texto com tom específico ou formatação detalhada, o GPT-5.5 ainda é a escolha mais segura.
V4 Flash vs Claude Opus 5. O Opus domina em textos longos, raciocínio cuidadoso sobre documentos extensos e seguir instruções detalhadas de formatação. O V4 Flash é mais rápido, barato e agora tão bom em código que muitos desenvolvedores já o usam por padrão. Pense no Opus como a ferramenta de precisão para quando o resultado precisa ser impecável.
V4 Flash vs V4 Pro. O Pro é melhor em tarefas que exigem muito conhecimento, matemática de competição e desafios de código extremos. O Flash é melhor em todo o resto, e tão rápido que você esquece que está esperando um modelo. A janela gratuita cobre ambos. Use o Pro para o problema mais difícil e o Flash para o resto.
V4 Flash vs Gemini 3.6 Flash. Ambos são modelos rápidos com janelas de contexto grandes. O Gemini aceita entrada multimodal (imagens, vídeo). O V4 Flash é só texto, mas tem benchmarks de código agentico mais fortes e a vantagem da licença MIT. Se precisa de visão, vá de Gemini. Se precisa de um agente que escreve e edita código, o V4 Flash leva vantagem.
FAQ
A janela gratuita de 7 dias é realmente gratuita?
Sim — para assinantes Pro existentes do Felo. Sem cartão de crédito, sem renovação automática. A janela começa hoje, 6 de agosto, e dura 7 dias.
O que acontece após os 7 dias?
O V4 Flash volta ao preço padrão Pro. Os outros recursos Pro permanecem. Nada é apagado — seu histórico de conversas, LiveDocs e buscas salvas continuam lá.
Preciso instalar algo para usar a integração com Codex?
Não. O V4 Flash suporta a Responses API nativamente. Basta definir deepseek-v4-flash como modelo no config do Codex, e funciona no Codex CLI, ChatGPT Desktop e na extensão do VS Code. Uma alteração de config, vale para tudo.
Como isso se compara ao uso direto da API do DeepSeek?
A API do DeepSeek é barata e rápida. O que o Felo adiciona é busca web em tempo real, comparação entre modelos e exportação com um clique para documentos, slides e mapas mentais. Se só precisa de inferência bruta, use a API. Se quer respostas com busca e um workspace em volta do modelo, o Felo é melhor.
Posso usar o V4 Flash no celular?
Sim. O Felo Search funciona em qualquer navegador móvel em felo.ai. O LLM Playground em playground.felo.ai também é otimizado para mobile.
O primeiro modelo open-weight que times realmente usam em produção
O que diferencia o V4 Flash de outros lançamentos open-weight: times de engenharia estão colocando ele em pipelines de produção como substituto real de alternativas closed-source. Não como experimento. Não como plano B. Como modelo principal.
Licença MIT. Pesos completos no Hugging Face. Fine-tuning comercial permitido. E com o lançamento 0731, as capacidades agenticas cruzaram a linha do "bom pelo preço" para o "bom o suficiente". A janela gratuita de 7 dias no Felo é a forma mais simples para assinantes Pro testarem se ele aguenta o seu fluxo de trabalho.
Faça login no Felo Pro e comece a usar o DeepSeek V4 Flash grátis hoje — a janela de 7 dias fecha em 12 de agosto.
Use DeepSeek V4 Flash Grátis →
Este post também está disponível em English, 简体中文, 日本語, 한국어, 繁體中文, हिन्दी, Français, العربية, Русский, اردو, Bahasa Indonesia, Deutsch, Tiếng Việt, Türkçe, Italiano, ไทย, Español and বাংলা.