Un agente no realiza una sola petición: lee, clasifica, decide, usa una herramienta y comprueba el resultado. Si cada uno de esos pasos espera a un modelo grande, unos pocos segundos se convierten en una experiencia lenta y cara. La nueva familia Flash de Google apunta precisamente a ese problema.
Qué presentó Google
Google anunció Gemini 3.6 Flash como modelo general para cargas de trabajo rápidas y Gemini 3.5 Flash-Lite para tareas de gran volumen y baja latencia. También adelantó 3.5 Flash Cyber, un futuro piloto para gobiernos y socios de confianza orientado a seguridad. Son propuestas distintas y no conviene intercambiar sus cifras.
- 3.6 Flash se presenta como el modelo de uso general de la familia rápida.
- 3.5 Flash-Lite prioriza volumen, velocidad y coste.
- 3.5 Flash Cyber se anunció como piloto futuro y de acceso restringido.
Por qué unos segundos importan tanto
En un chat, una pequeña espera puede ser tolerable. En un agente, la latencia se multiplica por el número de decisiones y llamadas a herramientas. Una tarea de diez pasos con dos segundos extra por paso añade veinte segundos antes de contar la red o la aplicación externa.
Clasificar soporte sin frenar la cola
Un modelo ligero detecta idioma, tema y urgencia. Solo deriva al modelo avanzado las solicitudes ambiguas o delicadas. El equipo mide aciertos, coste por caso y escalados humanos, no únicamente el tiempo de la primera respuesta.
Leer facturas y revisar anomalías
Flash-Lite puede extraer proveedor, fecha e importe en lotes grandes. Si encuentra una cantidad incoherente o faltan campos, un modelo más capaz razona sobre la excepción y una persona aprueba el pago.
La arquitectura de dos velocidades
Una implementación práctica puede separar el trabajo en cuatro capas:
- Una regla sencilla descarta lo que no necesita IA.
- Un modelo rápido clasifica, extrae y resume.
- Un modelo avanzado planifica o resuelve la excepción.
- Una persona confirma cualquier acción con impacto real.
Esta combinación suele llamarse enrutamiento de modelos. No depende de una marca concreta: lo importante es definir cuándo subir de nivel, qué información conserva cada paso y qué ocurre cuando una herramienta falla.
Cómo leer las cifras del lanzamiento
Google afirma que Gemini 3.6 Flash necesita menos pasos de razonamiento y llamadas a herramientas. En el mismo anuncio cita mediciones de Artificial Analysis: un 17 % menos de tokens de salida frente a 3.5 Flash y hasta 350 tokens por segundo para Flash-Lite en determinadas condiciones. Son referencias de un tercero recogidas por Google, no una garantía para cualquier aplicación.
El resultado real cambia con la longitud del contexto, la región, la carga, las herramientas y la forma del prompt. Una prueba honesta debe usar tus propios casos y medir el flujo completo desde que el usuario pulsa hasta que recibe un resultado útil.
Qué medir antes de elegir
- Precisión por tipo de tarea, no un promedio que esconda fallos.
- Latencia mediana y percentil 95, donde aparecen las esperas largas.
- Coste total, incluidas repeticiones y llamadas a herramientas.
- Porcentaje de casos escalados a otro modelo o a una persona.
- Errores silenciosos: respuestas plausibles que nadie detecta a tiempo.
Prueba mínima reproducible
Reúne cien casos reales ya resueltos. Ejecuta la misma prueba con dos configuraciones, oculta al revisor qué modelo produjo cada salida y registra calidad, tiempo y coste. Repite la evaluación cuando cambie el prompt o el proveedor.
Más velocidad no significa más permiso
Google también relaciona estos modelos con uso del ordenador. Esa capacidad puede hacer clic, escribir o navegar, pero no debe recibir libertad ilimitada. Un agente rápido puede cometer el mismo error más veces en menos tiempo.
- Usa una cuenta y un entorno de prueba con permisos mínimos.
- Exige confirmación antes de comprar, borrar, enviar o publicar.
- Limita dominios, importes, acciones y número de intentos.
- Conserva un registro de cada decisión y permite detener el proceso.
¿Flash-Lite es siempre mejor por ser más rápido?
No. Está optimizado para volumen y latencia; las tareas ambiguas o de razonamiento profundo pueden necesitar otro modelo.
¿El 17 % menos de tokens reduce mi coste exactamente un 17 %?
No necesariamente. Es una medición de Artificial Analysis citada por Google; tu coste depende de precios, entrada, salida, herramientas y repeticiones.
¿Puedo dejar que el agente use el ordenador sin supervisión?
No en acciones sensibles. Aísla el entorno, limita permisos y pide confirmación humana antes de cualquier efecto difícil de revertir.
Fuente primaria y redacción propia.
Nexus AI ha redactado y contextualizado este artículo a partir de Google · Gemini 3.6 Flash y 3.5 Flash-Lite (21 jul 2026). La noticia completa está en esta página; la referencia se ofrece para que puedas verificar el anuncio original.
Consultar la fuente oficial ↗


