Google lança Gemini 3.5 Flash com foco em agentes de IA
4 minutos de leitura

Inscreva-se em nossa Newsletter
Fique por dentro de conteúdos, insights e oportunidades do universo tech. Receba novidades e lançamentos direto no seu e-mail.
4 minutos de leitura

Fique por dentro de conteúdos, insights e oportunidades do universo tech. Receba novidades e lançamentos direto no seu e-mail.
O lançamento inverte uma lógica estabelecida no mercado: o 3.5 Flash supera o Gemini 3.1 Pro em benchmarks de coding e tarefas agênticas.
Na prática, o modelo roda cerca de quatro vezes mais rápido que modelos comparáveis. Isso inverte a hierarquia histórica entre os tiers Pro e Flash nas áreas que mais importam para quem desenvolve.
Segundo o post oficial do Google DeepMind, o Gemini 3.5 Flash foi projetado para executar fluxos de trabalho agênticos de longa duração (long-horizon agentic tasks). Na prática, o modelo consegue planejar, construir e iterar sobre problemas em paralelo, e os resultados nos principais benchmarks, segundo o Google, são:
O Google não destacou uma regressão relevante: no benchmark MRCR v2 com janela de 128 mil tokens, o 3.5 Flash caiu 7,6 pontos percentuais em relação ao Gemini 3.1 Pro.
Na prática, o índice recuou de 84,9% para 77,3%. Para quem constrói sistemas de RAG (recuperação aumentada por geração) sobre documentos extensos, esse número importa.
Do lado da infraestrutura, o modelo chega integrado ao Google Antigravity, plataforma de desenvolvimento agêntico do Google. O ambiente combina cache, orquestração paralela e roteamento de prompts. Isso faz o 3.5 Flash rodar até 12 vezes mais rápido do que via loop de API genérico.
A versão Gemini 3.5 Pro, com foco em raciocínio profundo, está confirmada para junho de 2026.
Para devs que já têm pipelines com modelos de linguagem, a chegada do 3.5 Flash coloca uma decisão concreta na mesa. A recomendação de quem acompanhou o lançamento de perto é atualizar o roteamento de produção para o gemini-3.5-flash em tarefas de coding e agentes.
Mas a migração para o Gemini 3.5 Pro, voltado a raciocínio mais profundo, vale segurar até o lançamento previsto para o mês que vem.
O modelo também muda a matemática de custo para quem opera em escala. A versão com raciocínio estendido custa US$ 0,50 por milhão de tokens de entrada e US$ 3,00 por milhão de tokens de saída. Isso significa menos da metade do custo de modelos frontier comparáveis, segundo o Google.
Dois pontos práticos para quem avalia adoção:
Se você não quer ficar para trás nesse cenário de constante mudanças e atualizações, além de construir pipelines com modelos como o Gemini 3.5 Flash, orquestrar subagentes e tomar decisões de arquitetura com LLMs, a Alura tem trilhas de IA aplicada para isso.
Elas cobrem do uso básico de APIs até engenharia de agentes autônomos em produção.
Avalie essa notícia