
Google sacó dos modelos de una vez — y uno viene diseñado para cazar vulnerabilidades
Google no para. En seis semanas van tres releases de la lÃnea Flash, y hoy sacaron Gemini 3.8 Flash junto con una variante que me dejó mirando la pantalla un rato: Gemini 3.8 Flash Cyber, un modelo especÃficamente entrenado para ciberseguridad. No es un modelo generalista al que le pusieron un prompt de «eres un experto en security». Es un modelo distinto, entrenado desde la base con tareas de detección de vulnerabilidades y parcheo automático.
El Flash normal cuesta lo mismo que 3.7: $0.75 por millón de tokens de entrada y $3.75 por millón de salida. Eso es barato para lo que entrega. En benchmarks de ingenierÃa de software autónoma (DeepSWE v1.1) le gana a modelos frontier que cuestan varias veces más. En razonamiento multi-paso saca 54.9% en HLE-Verified. No es el modelo más inteligente del mundo, pero está cerquita, y cuesta una fracción.
La parte que me interesa: Flash Cyber
Acá es donde se pone bacán y a la vez un poco inquietante. Google entrenó este modelo especÃficamente para encontrar vulnerabilidades y parchearlas automáticamente. Lo probaron en CyberGym (el benchmark estándar de la industria para esto) y superó tanto a 3.5 Flash Cyber como a modelos frontier mucho más grandes. Pero lo impresionante es el benchmark interno: le pasaron codebases complejos en 20 lenguajes de programación y alcanzó más de 70% de éxito encontrando vulnerabilidades reales.
En parcheo automático (CWE-Bench de Collinear) sacó 47.2% de pass@1, casi igual que el modelo frontier lÃder (47.8%), pero a una fracción del costo. El modelo que parchea casi tan bien como el más caro, pero cuesta cinco veces menos. Eso cambia la economÃa de quién puede darse el lujo de automatizar su SOC.
Ya lo están usando en Google y los números son brutales
El equipo de Chrome Security reportó que Flash Cyber produce 2.6 veces más parches correctos que los mejores modelos comerciales, que además son más grandes. Wiz lo comparó en sus benchmarks internos de pentesting: 7.5% a 9.7% más recall que los frontier, a 2.3x-5.2x menor costo. Y el equipo de Cloud Vulnerability Research de Google encontró una vulnerabilidad foundational en menos de 2 horas con este modelo, algo que normalmente toma meses de investigación.
Si eres de los que trabaja en ciberseguridad, esto te deberÃa hacer pensar. No es reemplazo de tu SOC, pero es un multiplicador de fuerza brutal. Imagina tener un analista que no duerme, que lee 20 lenguajes, y que cuesta centavos por millón de tokens.
El programa Fairwind: no es para todos
Google no soltó este modelo al público general. Lo distribuye a través del Fairwind Program, que es acceso solo para «defensores de confianza». O sea, equipos de seguridad verificados. Esto tiene sentido — un modelo que encuentra vulnerabilidades autónomamente en 20 lenguajes no es algo que quieras en manos de cualquiera. Pero también me hace pensar: ¿quién decide quién es «defensor de confianza»? ¿Y qué pasa cuando alguien entrena un modelo similar y lo suelta sin esas restricciones?
Porque eso va a pasar. Ya vimos a OpenAI con Astra alcanzando el umbral crÃtico en ciberseguridad. Ahora Google saca un modelo especÃficamente diseñado para esto. La carrera está acelerando, y mientras los buenos lo tienen detrás de un programa de acceso controlado, los malos no van a pedir permiso.
Mi opinión
Me parece bien que Google haya priorizado las capacidades defensivas sobre las ofensivas. El modelo está diseñado para parchear antes que para explotar, y eso es la decisión correcta. En Komatsu he visto lo que cuesta encontrar y parchear vulnerabilidades en sistemas legacy — si un modelo como este te automatiza parte de ese ciclo, el ROI es inmediato.
Pero el elephant in the room es obvio: si Google entrenó a Flash Cyber para encontrar bugs en 20 lenguajes con 70% de éxito, alguien más lo va a replicar sin las restricciones del Fairwind Program. Y cuando eso pase, el dÃa cero se acorta para todos. La pregunta no es si va a pasar, es cuándo.
Por ahora, lo bueno: un modelo que cuesta centavos y parchea casi tan bien como uno que cuesta una fortuna. Lo malo: la barrera de entrada para hacer lo mismo sin controls — es solo cuestión de tiempo y compute.
Fuente de inspiración: Introducing Gemini 3.8 Flash and 3.8 Flash Cyber