Google Gemini 2.5 Flash reduce los costos de los tokens de los agentes de IA empresariales.

Google ha publicado Géminis 3.6 Flash y Gemini 3.5 Flash-Lite como herramientas de última generación diseñadas para reducir drásticamente la latencia y los costos de los tokens para los agentes de IA empresariales que operan a gran escala.
La economía de ejecutar agentes de software autónomos dentro de un entorno de producción se reduce a una ecuación fija que pocos proveedores publicitan directamente. Un modelo necesita razonar a través de tareas de varios pasos de manera competente, pero cada token adicional que genera agrega costo y retraso a los flujos de trabajo que pueden ejecutarse miles de veces por hora.
Los equipos que desarrollan agentes en segundo plano en lugar de interfaces de chat necesitan primero el rendimiento y el recuento de parámetros en segundo lugar. La respuesta de Google, anunciada esta semana, divide esa compensación entre tres modelos distintos:
- 🔵 Géminis 3.6 Flash — optimizado para la codificación y el razonamiento multimodal
- ⚡ Gemini 3.5 Flash-Lite — Diseñado para cargas de trabajo de alto volumen y baja latencia.
- 🔒 Gemini 3.5 Flash Cyber — una variante restringida diseñada específicamente para la corrección de vulnerabilidades
📊 Las matemáticas detrás de Gemini 3.6 Flash
La documentación para desarrolladores de Google sobre Flash 3.6 se centra en una cifra clave: 17% menos tokens de salida que la versión Flash 3.5 anterior, según mediciones del Índice de Análisis Artificial.
En pruebas sintéticas específicas, incluidas las Prueba comparativa Datacurve DeepSWE — Google informa de caídas en el uso de tokens de hasta 65%, con precios fijados en $1.50 / 1M tokens de entrada y $7.50 / 1M tokens de salida.
Resultados de referencia clave para Géminis 3.6 Flash frente a su predecesor:
| Punto de referencia | 3.5 Flash (Anterior) | 3.6 Flash (Nuevo) |
|---|---|---|
| Tasa de éxito de DeepSWE | 37% | 49% |
| Puntuación de referencia MLE | 49,7% | 63,9% |
| Puntuación GDPval-AA v2 | 1349 | 1421 |
🏢 Figma, Hebbia y Harvey ponen a trabajar al modelo.
Figma ha integrado Gemini 3.6 Flash en su infraestructura de creación de prototipos. Según Matt Colyer, Director de Ingeniería de Producto en FigmaEste modelo ofrece a los desarrolladores una vía más rápida a través de las iteraciones de diseño sin que disminuya la calidad del resultado final.
Plataforma de tecnología jurídica Harvey y herramienta de investigación Hebbia Enrutar los datos a través del modelo para el procesamiento de documentos multimodales: ingerir informes financieros sin procesar, analizar la estructura del documento, leer gráficos incrustados y generar borradores de informes listos para la revisión humana.
Google también cerró un herramienta de uso de computadora del lado del cliente directamente en las plataformas Gemini API y Gemini Enterprise, eliminando el software intermediario personalizado que los ingenieros tenían que crear anteriormente para que los modelos funcionaran sobre un sistema operativo.
La empresa informa de un Puntuación verificada por OSWorld de 83,0%, un aumento respecto al 78,4% anterior, y afirma que las medidas de seguridad actualizadas contra el uso indebido de armas químicas, biológicas, radiológicas y nucleares mejoran la resistencia al jailbreaking, sin aumentar las tasas de rechazo de las solicitudes legítimas.
⚡ Un nivel más económico para agentes en segundo plano de alto volumen
Gemini 3.5 Flash-Lite apunta a una tarea diferente: procesamiento de documentos y búsqueda agencial que se ejecuta a gran volumen en lugar de a gran profundidad de razonamiento. El Índice de Análisis Artificial midió el modelo en 350 tokens de salida por segundo — el más rápido de la serie 3.5 según Google.
El precio es de tan solo $0.30 / 1M tokens de entrada y $2.50 / 1M tokens de salida — lo suficientemente económico como para que los equipos de ingeniería puedan dirigir las solicitudes de subagentes simples y de gran volumen a un nivel de pensamiento mínimo y reservar niveles de pensamiento superiores para trabajos complejos de varios pasos.
En Google Prueba de contexto largo GDM-MRCR v2, Gemini 3.5 Flash-Lite registró un 72,2% de tasa de éxito frente al 60,1% de su predecesor. Su puntuación GDPval-AA v2 casi se duplicó, pasando de 642 a 1140El modelo incluye la misma herramienta nativa para el uso del ordenador que Flash 3.6.
Por otra parte, Google confirmó que Gemini 3.5 Pro permanece en fase de pruebas con socios antes de su lanzamiento público completo y de preentrenamiento para el próximo Arquitectura Géminis 4 Ya está en marcha.
🔒 Gemini 3.5 Flash Cyber: Un modelo restringido para parchear código
Los escáneres automatizados de vulnerabilidades ahora detectan fallos más rápido de lo que la mayoría de los equipos de seguridad pueden corregirlos, y esa brecha creciente es precisamente donde se posiciona Google. Gemini 3.5 Flash Cyber.
El modelo está construido para validar y corregir vulnerabilidades del código, con Google informando sobre el rendimiento en el Punto de referencia de CyberGym Competitivo con los modelos de vanguardia, aunque las cifras detalladas no se han hecho públicas de la misma manera que los comunicados dirigidos al consumidor.
⚠️ La distribución sigue restringida. a gobiernos y socios seleccionados mediante un programa piloto: una limitación que Google presenta como una medida de protección contra el modelo que genera código malicioso para usos ofensivos.
Dentro de Google Agente de seguridad de CodeMenderVarias instancias de Flash Cyber 3.5 se ejecutan en paralelo, contrastando los resultados de las demás antes de generar un único informe de remediación que un revisor humano aprueba.
🚀 Cómo acceder a estos nuevos modelos
Los equipos de ingeniería que deseen integrar estos nuevos modelos pueden acceder a ellos a través de los siguientes canales:
- 🔗 API de Géminis a través de Google AI Studio
- 📱 Android Studio
- 🏢 Plataforma de agente empresarial Gemini
Los consumidores también pueden acceder a los nuevos modelos directamente en el Aplicación Gemini, y Gemini 3.5 Flash-Lite Además, se está implementando dentro Búsqueda de Google — lo que indica que este nivel centrado en la eficiencia está destinado a convertirse en una capa fundamental en todo el ecosistema de productos de Google.












