DeepSeek lança nova IA mais rápida e com custo reduzido
4 minutos de leitura

Inscreva-se em nossa Newsletter
Fique por dentro de conteúdos, insights e oportunidades do universo tech. Receba novidades e lançamentos direto no seu e-mail.
4 minutos de leitura

Fique por dentro de conteúdos, insights e oportunidades do universo tech. Receba novidades e lançamentos direto no seu e-mail.
A empresa chinesa de inteligência artificial DeepSeek lançou, em 10 de setembro de 2026, o modelo V4.1-Flash. Segundo a Reuters, a empresa descreveu o lançamento como o menor modelo de sua nova família de arquitetura V4.1.
De acordo com a DeepSeek, o modelo foi projetado para oferecer maior capacidade e inferência mais rápida. Também promete throughput mais alto, ou seja, processamento de mais requisições ao mesmo tempo, além de servir de base para modelos ainda maiores no futuro.
O V4.1-Flash é apresentado pela empresa como o menor integrante da nova família de modelos da DeepSeek, mas isso não significa um modelo simplificado. Ele tem 552 bilhões de parâmetros no total, dos quais apenas 8 bilhões são ativados para processar a entrada e 16 bilhões para gerar a resposta.
Essa arquitetura aciona só uma fração dos parâmetros em cada tarefa, o que reduz o volume de cálculo necessário para gerar cada resposta. Na prática, isso aumenta o throughput: a quantidade de solicitações que o sistema consegue atender no mesmo intervalo de tempo.
O modelo também tem compreensão visual nativa, ou seja, interpreta imagens sem depender de módulos externos.
Na comparação com a geração anterior, a DeepSeek afirma que o V4.1-Flash usa um quarto da memória HBM e um oitavo do espaço de armazenamento SSD. Os novos preços da API entraram em vigor no mesmo dia do lançamento, com tarifas diferentes para horários de pico e fora de pico.
Fora do pico, o valor equivale à metade da tarifa cobrada em horário de maior demanda.
Esse número, porém, se refere ao preço por uso da API, não a uma medida direta de custo total por tarefa. Na prática, o custo final também depende do volume de tokens processados em cada caso.
O modelo já substitui versões anteriores: o V4-Flash e o V4-Flash-Vision-Exp foram retirados, com solicitações redirecionadas para o novo sistema. A partir de 14 de setembro de 2026, o V4-Pro também começa a ser substituído gradualmente, até o lançamento futuro do V4.1-Pro.
Modelos que exigem menos recursos computacionais por tarefa custam menos para operar em escala, tanto para quem oferece o serviço quanto para quem consome via API.
A DeepSeek afirma que a redução de recursos pode diminuir os custos, com destaque para agentes de inteligência artificial. Esses sistemas executam tarefas com menor intervenção humana e tendem a gerar volumes altos de chamadas ao modelo.
A empresa posiciona o V4.1-Flash para cenários que dependem de respostas rápidas e alto volume de processamento, incluindo aplicações via API e fluxos automatizados. A capacidade de interpretar imagens nativamente também abre espaço para tarefas que combinam texto e conteúdo visual no mesmo fluxo.
Ao lançar primeiro o menor modelo da família V4.1, a DeepSeek sinaliza uma estratégia de atender perfis de uso diferentes. Aplicações que priorizam velocidade e custo baixo ficam com o Flash, enquanto cargas de trabalho mais complexas devem ficar a cargo de modelos maiores, como o anunciado V4.1-Pro.
Para quem usa modelos de linguagem via API ou incorpora IA em produtos, três fatores mudam na prática. São eles a velocidade de resposta, o volume de requisições suportadas e o custo operacional.
Segundo testes divulgados pela própria DeepSeek, sem detalhamento metodológico público, o V4.1-Flash ficou à frente do V4-Pro em desempenho, custo e velocidade. O anúncio não traz benchmarks comparando o modelo a concorrentes fora da própria empresa.
Se você trabalha com desenvolvimento de aplicações que integram inteligência artificial, entender como modelos como o V4.1-Flash equilibram custo, velocidade e capacidade é essencial. Esse conhecimento ajuda a escolher a ferramenta certa em cada projeto.
A Alura tem trilhas de IA aplicada que cobrem desde o consumo de modelos via API até a construção de agentes e produtos com LLMs.
Avalie essa notícia