O DeepSeek V4.1-Flash chegou em 10 de setembro de 2026 com um cache de contexto que ocupa um quarto da memória HBM da geração anterior, e isso barateia de forma direta o custo de rodar agentes de IA. Além disso, a DeepSeek mudou de ideia sobre o plano anunciado no lançamento. Em vez de redirecionar o antigo V4-Pro para o modelo novo em 14 de setembro, a empresa decidiu manter o V4-Pro no ar, com a mesma cobrança.
Por isso, quem usa a API tem hoje duas opções reais, e não uma troca automática. Veja a seguir o que muda na arquitetura, quanto custa cada modelo e o que conferir antes de migrar um agente que já roda em produção.
O que muda no DeepSeek V4.1-Flash?
Em primeiro lugar, a grande virada é de arquitetura. O DeepSeek V4.1-Flash é um modelo MoE (Mixture-of-Experts) de 552 bilhões de parâmetros, mas com um desenho novo que a DeepSeek chama de Causal Encoder-Decoder. Na prática, só 8 bilhões de parâmetros ficam ativos para ler a entrada e 16 bilhões para gerar a resposta.
Em outras palavras, pense numa empresa com 552 especialistas contratados. Para cada pedido, só uma equipe pequena trabalha, e o resto fica parado sem custo. Dessa forma, o gasto de computação por requisição cai muito em comparação com acionar o modelo inteiro a cada palavra.
Por sua vez, o efeito mais importante aparece na memória. Segundo a DeepSeek, o KV cache do novo modelo exige 1/4 da memória HBM e 1/8 do armazenamento em SSD da geração anterior. Além disso, o modelo passou a ter compreensão visual nativa, ou seja, interpreta imagens junto com texto sem depender de uma versão separada.
Números do DeepSeek V4.1-Flash (segundo a DeepSeek):
- 552 bilhões de parâmetros no total, com 8B ativos na entrada e 16B na saída
- KV cache com 1/4 da memória HBM e 1/8 do SSD da geração anterior
- Janela de contexto de 1 milhão de tokens e saída máxima de 384 mil tokens
- Compreensão visual nativa, no nome de API
deepseek-flash
Por que a economia de memória barateia agentes de IA?
Um agente de IA é um sistema que executa várias etapas sozinho. Primeiro, ele lê documentos, analisa código, chama ferramentas e só então entrega uma resposta. No entanto, cada etapa acumula contexto, e esse contexto precisa ficar guardado na memória cara da GPU durante toda a tarefa.
É justamente aí que o DeepSeek V4.1-Flash ataca o problema. Afinal, menos memória por token significa mais sessões simultâneas no mesmo servidor, em vez de exigir mais GPUs para a mesma carga. Por exemplo, um agente que revisa um repositório inteiro mantém centenas de milhares de tokens abertos por minutos. Com isso, um cache quatro vezes menor faz o mesmo hardware atender muito mais agentes ao mesmo tempo.
Além disso, a DeepSeek afirma no comunicado de lançamento que “testes de várias partes colocaram o V4.1-Flash à frente do V4-Pro em desempenho, custo, velocidade e tempo total de execução”. Da mesma forma, a corrida por eficiência aparece no Qwen 3.8 Flash Next da Alibaba, outro modelo chinês recente focado em velocidade.
Dito isso, “à frente” não quer dizer “melhor em tudo”. Num levantamento publicado pelo DataStudios, o V4.1-Flash marcou 30,0 no Terminal-Bench 3.0 contra 11,8 do V4-Pro, e 74,2 no DeepSWE v1.1 contra 62,7. Por outro lado, no GPQA Diamond, teste de raciocínio científico, o V4-Pro segue na frente, com 92,4 contra 90,9. Portanto, o modelo novo brilha em código e agentes, mas perde por pouco em raciocínio puro.
Publicidade
A DeepSeek desistiu de desligar o V4-Pro?
Sim. No anúncio de 10 de setembro, a DeepSeek informou que, a partir das 4h UTC de 14 de setembro, todas as chamadas ao deepseek-v4-pro seriam atendidas pelo V4.1-Flash, com preço de Flash, até o lançamento de um futuro V4.1-Pro. De fato, esse era o ponto mais polêmico do lançamento, porque trocava o modelo de quem já tinha agente em produção sem pedir licença.
Contudo, dias depois, a empresa recuou. Na documentação oficial da API, a DeepSeek escreveu que, “em resposta à demanda dos usuários”, decidiu continuar oferecendo o V4-Pro depois de 14 de setembro de 2026, com a cobrança inalterada. Consideramos a mudança acertada, porque troca silenciosa de modelo quebra fluxos que dependem de um comportamento previsível.
No entanto, a geração Flash anterior foi mesmo aposentada. Os modelos V4 Flash e V4 Flash Vision Exp saíram do ar, e os nomes deepseek-v4-flash e deepseek-v4-flash-vision-exp apontam temporariamente para o V4.1-Flash. Ou seja, quem usava o Flash antigo já foi migrado, enquanto quem usa o V4-Pro continua onde estava.
Quanto custa a API do DeepSeek V4.1-Flash?
Abaixo, a tabela oficial da DeepSeek, por milhão de tokens, deixa a diferença clara. Mais especificamente, o V4.1-Flash custa cerca de quatro vezes menos na entrada e três vezes menos na saída que o V4-Pro.
| Preço por 1M de tokens | V4.1-Flash (fora do pico) | V4.1-Flash (pico) | V4-Pro (fora do pico) | V4-Pro (pico) |
|---|---|---|---|---|
| Entrada com cache | US$ 0,003 | US$ 0,006 | US$ 0,022 | US$ 0,044 |
| Entrada sem cache | US$ 0,15 | US$ 0,30 | US$ 0,66 | US$ 1,32 |
| Saída | US$ 0,60 | US$ 1,20 | US$ 1,98 | US$ 3,96 |
Segundo a DeepSeek, o horário de pico vai das 01h às 04h e das 06h às 10h UTC, de segunda a sexta. Em Brasília, isso equivale a 22h à 1h e 3h às 7h. Portanto, o horário comercial brasileiro cai inteiro na tarifa fora do pico, que custa metade do preço. Sobretudo para quem roda agentes no Brasil, é uma vantagem rara.
Por exemplo, imagine uma tarefa de agente que consome 2 milhões de tokens de entrada sem cache e gera 200 mil de saída, fora do pico. Assim, no V4.1-Flash, a conta fica em cerca de US$ 0,42. Da mesma forma, no V4-Pro a mesma tarefa sai por volta de US$ 1,72. Ainda assim, lembre que um modelo pode gastar mais tokens para chegar ao mesmo resultado.
O que fazer se você usa a API da DeepSeek
Em primeiro lugar, confira qual nome de modelo o seu código chama. Se for deepseek-v4-flash, você já está no V4.1-Flash, só que por um apelido temporário. Por isso, vale trocar para deepseek-flash, o nome oficial novo, antes que o alias deixe de existir.
Em seguida, se você usa o V4-Pro, nada muda por enquanto. Dessa forma, dá para testar o V4.1-Flash com calma, em paralelo, antes de decidir. Por isso, recomendamos comparar os dois na sua própria carga, e não só nos benchmarks públicos.
Por fim, meça o que realmente pesa na conta. O próprio DataStudios alerta que preço menor por token não garante custo menor por tarefa. Portanto, observe o tamanho das respostas, a latência, a confiabilidade das chamadas de ferramenta e a taxa de tarefas concluídas pelo agente.
Para quem só acompanha o assunto, o recado é mais amplo. Além disso, modelos que fazem mais com menos memória tendem a espalhar agentes de IA para além das big techs. Se você ainda está entendendo o ecossistema, vale ler o nosso guia sobre o que é o ChatGPT e como usar de graça e comparar com o que a Anthropic mudou no Claude Fable 5.1.
O DeepSeek V4.1-Flash vale a atenção?
Sim, e não apenas por ser barato. De fato, a redução real de memória muda a economia dos agentes de IA, e a tabela de preços confirma essa aposta. Enquanto parte da concorrência corre atrás de modelos maiores, a DeepSeek escolheu fazer mais com menos hardware.
No entanto, o recuo sobre o V4-Pro mostra que nem a própria empresa quis forçar a troca. Em conclusão, o DeepSeek V4.1-Flash é a escolha óbvia para agentes de código com orçamento apertado. Por outro lado, para raciocínio pesado, o V4-Pro continua disponível, e vale acompanhar os benchmarks independentes das próximas semanas.
Publicidade


























