A chinesa DeepSeek apresentou o V4.1-Flash, novo modelo de IA que promete rivalizar com sistemas de topo de linha como o GPT-5.6 Sol e o Claude Opus 5 — só que cobrando bem menos por isso.
Menor, mas nem por isso mais fraco
O V4.1-Flash é apresentado pela empresa como o menor integrante de uma nova família de arquitetura, pensada desde o início para ser barata de rodar e servir de base para modelos maiores no futuro. A engenharia por trás disso é uma arquitetura híbrida do tipo "encoder-decoder assimétrico": o modelo tem 552 bilhões de parâmetros no total, mas ativa só 8 bilhões para processar a entrada e 16 bilhões para gerar a resposta — o que reduz bastante o custo computacional de cada consulta.
Segundo testes internos e externos citados pela empresa, o modelo superou o antecessor V4-Pro em desempenho, custo, velocidade e tempo total de resposta, além de aparecer à frente de concorrentes como o Kimi K3 em benchmarks de tarefas reais.
O que muda na prática
- Usa um quarto da memória HBM exigida pela geração anterior;
- Ganhou compreensão visual nativa, ou seja, também interpreta imagens;
- Suporta contexto de até 1 milhão de tokens;
- Custa US$ 0,003 por milhão de tokens de entrada, com desconto adicional para chamadas que usam cache.
Fim de linha para o V4-Pro
A partir de 14 de setembro, qualquer requisição enviada ao endpoint do V4-Pro passa a ser automaticamente redirecionada para o V4.1-Flash — só que cobrada pela tarifa mais baixa da linha Flash. Ou seja: quem já usa a API não precisa mudar nada, mas paga menos pelo mesmo (ou melhor) serviço.
Contexto: IPO à vista
O lançamento acontece justamente no momento em que a DeepSeek se prepara para uma oferta pública inicial de ações no mercado STAR, em Xangai, segundo a Reuters — o que reforça o timing estratégico da novidade.