Google ha lanzado Gemini — Google AI 3.5 Flash, la versión ligera de su modelo que promete mejorar velocidad de inferencia y razonamiento. el anuncio desde su blog oficial ha generado revuelo en HackerNews — más de 670 votos y cerca de 500 comentarios en menos de 24 horas.
La serie Gemini 3.5 es un salto respecto a la 2.0 que Google lanzó durante 2025. La versión Flash compite directamente con GPT-4o mini de OpenAI — el blog oficial de OpenAI y Claude — Anthropic 3.5 Haiku de Anthropic — Anthropic. La clave: Google ha logrado mantener un nivel de razonamiento casi al nivel de los modelos pesados, pero con mucha menos latencia.
Lo interesante es que han comprimido capacidades de razonamiento profundo en un modelo que responde en milisegundos. Según sus pruebas internas, Gemini 3.5 Flash obtiene 89,2 en MMLU-Pro, frente al 91,4 del modelo completo Gemini 3.5 Pro y muy por encima del 82,1 de Gemini 2.0 Flash. En código, HumanEval pasa de 74,3 a 85,7.
Qué cambia respecto a Gemini 2.0 Flash
La diferencia está en la arquitectura. Google ha introducido lo que llama "atención selectiva por capas": el modelo dedica más recursos a las partes del contexto que realmente importan para cada consulta, en lugar de procesarlo todo con la misma profundidad.
En la práctica, Gemini 3.5 Flash procesa contextos de hasta 2 millones de tokens — el mismo límite que los modelos Pro — pero entre un 40% y un 60% más rápido que su predecesor. Para un desarrollador que trabaja con repositorios grandes o documentación técnica extensa, la diferencia se nota.
También ha mejorado la generación de imágenes y la comprensión multimodal. Gemini 3.5 Flash puede analizar vídeo en tiempo real con mucha más precisión que la generación anterior. Google lo demuestra con un ejemplo dónde el modelo identifica objetos, lee texto en movimiento y describe escenas complejas en un vídeo de 22 minutos sin segmentar el contenido.
Precios y disponibilidad
Google ha mantenido los precios de la serie Flash: 0,15 dólares por millón de tokens de entrada y 0,60 dólares por millón de tokens de salida. GPT-4o mini cuesta el doble. el modelo ya está disponible vía API de Google AI Studio y se ha integrado en los productos de consumo: la extensión de Gemini en Chrome, la aplicación en Android y Google Workspace.
Un detalle que ha pasado desapercibido: Google también ha lanzado una versión "Flash Thinking" que aplica cadenas de razonamiento visibles antes de responder, similar al enfoque de OpenAI con o1. Es más lenta, pero permite seguir el proceso de pensamiento paso a paso. Cuesta un 50% más.
Cómo se compara con la competencia
Gemini 3.5 Flash supera a GPT-4o mini y Claude 3.5 Haiku en razonamiento matemático (GSM8K: 96,1 frente a 94,3 y 93,8) y comprensión lectora (DROP: 91,7 frente a 88,5 y 87,9). dónde pierde terreno es en generación de código largo y seguimiento de instrucciones complejas, dónde GPT-4o mini mantiene ventaja.
Para el usuario medio, las diferencias son pequeñas. Las respuestas son más rápidas, el análisis de documentos largos es más completo y la generación de imágenes ha mejorado lo suficiente cómo para ser útil en contextos profesionales. dónde realmente marca la diferencia es en aplicaciones que requieren respuestas en tiempo real: asistentes de voz, chatbots en vivo, análisis de vídeo en streaming.
La jugada de Google es inteligente: en lugar de competir frontalmente con OpenAI en los modelos más grandes y caros, está acorralando a sus rivales por el lado de la eficiencia. Gemini 3.5 Flash ofrece un rendimiento que hasta hace un año era impensable para un modelo de su coste. Y sí le sumas la integración nativa con todo el ecosistema Google — Chrome, Android, Workspace, YouTube — YouTube Blog —, la propuesta es difícil de ignorar.
Queda por ver cómo responden OpenAI y Anthropic. Las filtraciones apuntan a que OpenAI prepara GPT-4o mini 2 para finales de verano, y Anthropic tiene a Claude 3.5 Opus en el horno. Pero por ahora, Google ha puesto el listón muy alto en modelos ligeros.