Google Gemini 2.5 Flash réduit les coûts des jetons d'agents d'IA d'entreprise

Google a publié Gemini 3.6 Flash et Gemini 3.5 Flash-Lite comme des bêtes de somme de nouvelle génération conçues pour réduire considérablement la latence et les coûts des jetons pour les agents d'IA d'entreprise fonctionnant à grande échelle.
L'aspect économique de l'exécution d'agents logiciels autonomes en environnement de production se résume à une équation fixe que peu de fournisseurs mettent en avant. Un modèle doit être capable de résoudre des tâches complexes avec compétence, mais chaque jeton supplémentaire généré engendre des coûts et des délais supplémentaires pour les flux de travail. des milliers de fois par heure.
Les équipes qui développent des agents en arrière-plan plutôt que des interfaces de chat ont besoin de priorité au débit et le nombre de paramètres en second lieu. La réponse de Google, annoncée cette semaine, répartit ce compromis entre trois modèles distincts :
- 🔵 Gemini 3.6 Flash — optimisé pour le codage et le raisonnement multimodal
- ⚡ Gemini 3.5 Flash-Lite — conçu pour les charges de travail à volume élevé et à faible latence
- 🔒 Gemini 3.5 Flash Cyber — une variante restreinte conçue spécifiquement pour la correction des vulnérabilités
📊 Les mathématiques derrière Gemini 3.6 Flash
La documentation de Google pour les développeurs concernant Flash 3.6 s'articule autour d'un chiffre clé : 17 % de jetons de production en moins que la version précédente 3.5 Flash, d'après les mesures de l'indice d'analyse artificielle.
Dans des tests synthétiques spécifiques — y compris les Benchmark Datacurve DeepSWE — Google signale des baisses de l'utilisation des jetons pouvant atteindre 65%, avec des prix fixés à 1,50 $ / 1 million de jetons d'entrée et 7,50 $ / 1 million de jetons de sortie.
Principaux résultats de référence pour Gemini 3.6 Flash par rapport à son prédécesseur :
| Référence | 3.5 Flash (Précédent) | 3.6 Flash (Nouveau) |
|---|---|---|
| Taux de réussite de DeepSWE | 37% | 49% |
| Score de banc MLE | 49,7% | 63,9% |
| Score GDPval-AA v2 | 1349 | 1421 |
🏢 Figma, Hebbia et Harvey mettent le modèle au travail
Figma a intégré Gemini 3.6 Flash à son infrastructure de prototypage. Selon Matt Colyer, directeur de l'ingénierie produit chez FigmaCe modèle offre aux développeurs un chemin plus rapide à travers les itérations de conception sans aucune baisse de la qualité du résultat.
plateforme technologique juridique Harvey et outil de recherche Hebbie acheminer les données à travers le modèle pour le travail documentaire multimodal — en ingérant les données financières brutes, en analysant la structure des documents, en lisant les graphiques intégrés et en produisant des rapports préliminaires prêts pour la relecture humaine.
Google a également fermé une outil d'utilisation informatique côté client directement dans les plateformes Gemini API et Gemini Enterprise, supprimant ainsi le logiciel intermédiaire personnalisé que les ingénieurs devaient auparavant créer pour permettre aux modèles de fonctionner sur un système d'exploitation.
L'entreprise signale un Score vérifié par OSWorld de 83,0 %, contre 78,4 % auparavant, et affirme que les mesures de sécurité mises à jour contre l'utilisation abusive d'agents chimiques, biologiques, radiologiques et nucléaires améliorent la résistance au débridage, sans pour autant augmenter les taux de refus des demandes légitimes.
⚡ Un forfait plus économique pour les agents de vérification des antécédents à volume élevé
Gemini 3.5 Flash-Lite Le modèle vise une tâche différente : le traitement de documents et la recherche automatisée, axés sur le volume plutôt que sur la profondeur du raisonnement. L’indice d’analyse artificielle a mesuré ce modèle à 350 jetons de sortie par seconde — le plus rapide de la série 3.5 selon Google.
Les prix commencent à seulement 0,30 $ / 1 million de jetons d'entrée et 2,50 $ / 1 million de jetons de sortie — suffisamment bon marché pour que les équipes d'ingénierie puissent acheminer les requêtes simples et volumineuses des sous-agents vers un niveau de réflexion minimal et réserver les niveaux de réflexion supérieurs aux tâches complexes en plusieurs étapes.
Sur Google Test GDM-MRCR v2 à contexte long, Gemini 3.5 Flash-Lite a enregistré un taux de réussite de 72,2 % contre 60,1 % pour son prédécesseur. Son score GDPval-AA v2 a presque doublé, passant de 642 à 1140. Ce modèle intègre le même outil d'utilisation informatique natif que Flash 3.6.
Par ailleurs, Google a confirmé que Gemini 3.5 Pro Le développement se poursuit en phase de test chez nos partenaires avant sa sortie publique, et en phase de pré-entraînement pour la prochaine étape. Architecture Gemini 4 est déjà en cours.
🔒 Gemini 3.5 Flash Cyber : un modèle restreint pour le patch de code
Les outils automatisés d'analyse des vulnérabilités détectent désormais les failles plus rapidement que la plupart des équipes de sécurité ne peuvent les corriger ; c'est précisément dans cet écart croissant que Google se positionne. Gemini 3.5 Flash Cyber.
Le modèle est construit pour valider et corriger les vulnérabilités du code, avec Google qui rend compte des performances sur le Référence CyberGym compétitif par rapport aux modèles de pointe — bien que les chiffres détaillés n'aient pas été rendus publics de la même manière que les communiqués destinés aux consommateurs.
⚠️ La distribution reste restreinte aux gouvernements et à des partenaires agréés par le biais d'un programme pilote — une limitation que Google présente comme une protection contre la génération de code d'exploitation à des fins offensives par le modèle.
À l'intérieur de Google Agent de sécurité CodeMender, plusieurs instances de 3.5 Flash Cyber s'exécutent en parallèle, vérifiant mutuellement leurs conclusions avant de produire un seul rapport de remédiation qu'un examinateur humain approuve.
🚀 Comment accéder à ces nouveaux modèles
Les équipes d'ingénierie souhaitant intégrer ces nouveaux modèles peuvent y accéder par les canaux suivants :
Les consommateurs peuvent également accéder directement aux nouveaux modèles dans le Application Gemini, et Gemini 3.5 Flash-Lite se déploie également au sein de Recherche Google — ce qui indique que ce niveau axé sur l'efficacité est destiné à devenir une couche fondamentale de l'ensemble de l'écosystème de produits Google.












