O Google Gemini 2.5 Flash reduz os custos de tokens de agentes de IA corporativos.

O Google lançou Gemini 3.6 Flash e Gemini 3.5 Flash-Lite como ferramentas de última geração projetadas para reduzir drasticamente a latência e os custos de tokens para agentes de IA empresariais que operam em grande escala.
A viabilidade econômica da execução de agentes de software autônomos em um ambiente de produção se resume a uma equação fixa que poucos fornecedores divulgam diretamente. Um modelo precisa raciocinar com competência em tarefas de múltiplas etapas — mas cada token extra gerado aumenta o custo e o atraso dos fluxos de trabalho que podem ser executados. milhares de vezes por hora.
As equipes que criam agentes em segundo plano em vez de interfaces de bate-papo precisam de primeiro a produtividade e a contagem de parâmetros em segundo lugar. A resposta do Google, anunciada esta semana, divide essa relação de compromisso em três modelos distintos:
- 🔵 Gemini 3.6 Flash — otimizado para codificação e raciocínio multimodal
- ⚡ Gemini 3.5 Flash-Lite — Projetado para cargas de trabalho de alto volume e baixa latência
- 🔒 Gemini 3.5 Flash Cyber — uma variante restrita criada especificamente para a correção de vulnerabilidades
📊 A matemática por trás do Gemini 3.6 Flash
A documentação para desenvolvedores do Google para o Flash 3.6 se concentra em um dado principal: 17% menos fichas de saída do que a versão anterior 3.5 Flash, com base em medições do Índice de Análise Artificial.
Em testes sintéticos específicos — incluindo o Benchmark DeepSWE da Datacurve — O Google relata quedas no uso de tokens de até 65%, com preços definidos em US$ 1,50 / 1 milhão de tokens de entrada e US$ 7,50 / 1 milhão de tokens de saída.
Principais resultados de referência para Gemini 3.6 Flash em comparação com seu antecessor:
| Referência | 3.5 Flash (Anterior) | 3.6 Flash (Novo) |
|---|---|---|
| Taxa de sucesso do DeepSWE | 37% | 49% |
| Pontuação de teste MLE | 49,7% | 63,9% |
| Pontuação GDPval-AA v2 | 1349 | 1421 |
🏢 Figma, Hebbia e Harvey colocam o modelo para trabalhar
Figma integrou o Gemini 3.6 Flash em sua infraestrutura de prototipagem. De acordo com Matt Colyer, Diretor de Engenharia de Produto na FigmaO modelo oferece aos desenvolvedores um caminho mais rápido pelas iterações de design sem qualquer queda na qualidade do resultado.
Plataforma de tecnologia jurídica Harvey e ferramenta de pesquisa Hebbia Encaminhar dados através do modelo para trabalho com documentos multimodais — ingerindo arquivos financeiros brutos, analisando a estrutura do documento, lendo gráficos incorporados e produzindo rascunhos de relatórios prontos para revisão humana.
O Google também encerrou uma ferramenta de uso de computador do lado do cliente diretamente nas plataformas Gemini API e Gemini Enterprise — eliminando o software intermediário personalizado que os engenheiros de software precisavam criar anteriormente para permitir que os modelos operassem sobre um sistema operacional.
A empresa relata um Pontuação verificada pela OSWorld de 83,0%., um aumento em relação aos 78,4% anteriores, e afirma que as salvaguardas atualizadas contra o uso indevido de agentes químicos, biológicos, radiológicos e nucleares melhoram a resistência à quebra de senhas — sem aumentar as taxas de recusa de solicitações legítimas.
⚡ Um plano mais econômico para agentes de fundo de alto volume
Gemini 3.5 Flash-Lite visa uma tarefa diferente: processamento de documentos e busca automatizada em grande volume, em vez de raciocínio aprofundado. O Índice de Análise Artificial avaliou o modelo em 350 tokens de saída por segundo — o mais rápido da série 3.5, segundo o Google.
Os preços são apenas US$ 0,30 / 1 milhão de tokens de entrada e US$ 2,50 / 1 milhão de tokens de saída — suficientemente barato para que as equipes de engenharia possam encaminhar solicitações simples e de alto volume de subagentes para um nível de processamento mínimo e reservar níveis de processamento mais elevados para trabalhos complexos com várias etapas.
No Google Teste de contexto longo GDM-MRCR v2O flash Gemini 3.5 Flash-Lite gravou um Taxa de sucesso de 72,2% contra 60,1% de seu antecessor. Sua pontuação GDPval-AA v2 quase dobrou — saltando de 642 para 1140O modelo possui a mesma ferramenta nativa de uso em computador que o Flash 3.6.
Em outra ocasião, o Google confirmou que Gemini 3.5 Pro permanece em fase de testes com parceiros antes do lançamento público completo e em pré-treinamento para a próxima versão. Arquitetura Gemini 4 já está em andamento.
🔒 Gemini 3.5 Flash Cyber: Um modelo restrito para aplicação de patches em código
Os scanners automatizados de vulnerabilidades agora revelam falhas mais rapidamente do que a maioria das equipes de segurança consegue corrigi-las — e é exatamente nessa lacuna crescente que o Google se posiciona. Gemini 3.5 Flash Cyber.
O modelo foi construído para Validar e corrigir vulnerabilidades de código, com o Google relatando o desempenho no Referência CyberGym competitivo com modelos de ponta — embora os números detalhados não tenham sido divulgados da mesma forma que os comunicados ao consumidor.
⚠️ A distribuição permanece restrita. para governos e parceiros verificados por meio de um programa piloto — uma limitação que o Google apresenta como uma salvaguarda contra o modelo que gera código de exploração para uso ofensivo.
Dentro do Google Agente de segurança CodeMender, várias instâncias do Flash Cyber 3.5 são executadas em paralelo, verificando as conclusões umas das outras antes de produzir um único relatório de remediação que é aprovado por um revisor humano.
🚀 Como acessar esses novos modelos
As equipes de engenharia que desejam integrar esses novos modelos podem acessá-los pelos seguintes canais:
- 🔗 API Gemini por meio do Google AI Studio
- 📱 Android Studio
- 🏢 Plataforma de Agentes Empresariais Gemini
Os consumidores também podem acessar os novos modelos diretamente no Aplicativo Gemini, e Gemini 3.5 Flash-Lite também está sendo implementado dentro de Pesquisa do Google — sinalizando que essa camada focada em eficiência está destinada a se tornar um elemento fundamental em todo o ecossistema de produtos do Google.












