Google le puso traje de ciberseguridad a Gemini 3.8 Flash y la wea es seria

Google le puso traje de ciberseguridad a Gemini 3.8 Flash y la wea es seria

Google le puso traje de ciberseguridad a Gemini 3.8 Flash y la wea es seria

Google sacó dos modelos de una vez — y uno viene diseñado para cazar vulnerabilidades

Google no para. En seis semanas van tres releases de la línea Flash, y hoy sacaron Gemini 3.8 Flash junto con una variante que me dejó mirando la pantalla un rato: Gemini 3.8 Flash Cyber, un modelo específicamente entrenado para ciberseguridad. No es un modelo generalista al que le pusieron un prompt de «eres un experto en security». Es un modelo distinto, entrenado desde la base con tareas de detección de vulnerabilidades y parcheo automático.

El Flash normal cuesta lo mismo que 3.7: $0.75 por millón de tokens de entrada y $3.75 por millón de salida. Eso es barato para lo que entrega. En benchmarks de ingeniería de software autónoma (DeepSWE v1.1) le gana a modelos frontier que cuestan varias veces más. En razonamiento multi-paso saca 54.9% en HLE-Verified. No es el modelo más inteligente del mundo, pero está cerquita, y cuesta una fracción.

La parte que me interesa: Flash Cyber

Acá es donde se pone bacán y a la vez un poco inquietante. Google entrenó este modelo específicamente para encontrar vulnerabilidades y parchearlas automáticamente. Lo probaron en CyberGym (el benchmark estándar de la industria para esto) y superó tanto a 3.5 Flash Cyber como a modelos frontier mucho más grandes. Pero lo impresionante es el benchmark interno: le pasaron codebases complejos en 20 lenguajes de programación y alcanzó más de 70% de éxito encontrando vulnerabilidades reales.

En parcheo automático (CWE-Bench de Collinear) sacó 47.2% de pass@1, casi igual que el modelo frontier líder (47.8%), pero a una fracción del costo. El modelo que parchea casi tan bien como el más caro, pero cuesta cinco veces menos. Eso cambia la economía de quién puede darse el lujo de automatizar su SOC.

Ya lo están usando en Google y los números son brutales

El equipo de Chrome Security reportó que Flash Cyber produce 2.6 veces más parches correctos que los mejores modelos comerciales, que además son más grandes. Wiz lo comparó en sus benchmarks internos de pentesting: 7.5% a 9.7% más recall que los frontier, a 2.3x-5.2x menor costo. Y el equipo de Cloud Vulnerability Research de Google encontró una vulnerabilidad foundational en menos de 2 horas con este modelo, algo que normalmente toma meses de investigación.

Si eres de los que trabaja en ciberseguridad, esto te debería hacer pensar. No es reemplazo de tu SOC, pero es un multiplicador de fuerza brutal. Imagina tener un analista que no duerme, que lee 20 lenguajes, y que cuesta centavos por millón de tokens.

El programa Fairwind: no es para todos

Google no soltó este modelo al público general. Lo distribuye a través del Fairwind Program, que es acceso solo para «defensores de confianza». O sea, equipos de seguridad verificados. Esto tiene sentido — un modelo que encuentra vulnerabilidades autónomamente en 20 lenguajes no es algo que quieras en manos de cualquiera. Pero también me hace pensar: ¿quién decide quién es «defensor de confianza»? ¿Y qué pasa cuando alguien entrena un modelo similar y lo suelta sin esas restricciones?

Porque eso va a pasar. Ya vimos a OpenAI con Astra alcanzando el umbral crítico en ciberseguridad. Ahora Google saca un modelo específicamente diseñado para esto. La carrera está acelerando, y mientras los buenos lo tienen detrás de un programa de acceso controlado, los malos no van a pedir permiso.

Mi opinión

Me parece bien que Google haya priorizado las capacidades defensivas sobre las ofensivas. El modelo está diseñado para parchear antes que para explotar, y eso es la decisión correcta. En Komatsu he visto lo que cuesta encontrar y parchear vulnerabilidades en sistemas legacy — si un modelo como este te automatiza parte de ese ciclo, el ROI es inmediato.

Pero el elephant in the room es obvio: si Google entrenó a Flash Cyber para encontrar bugs en 20 lenguajes con 70% de éxito, alguien más lo va a replicar sin las restricciones del Fairwind Program. Y cuando eso pase, el día cero se acorta para todos. La pregunta no es si va a pasar, es cuándo.

Por ahora, lo bueno: un modelo que cuesta centavos y parchea casi tan bien como uno que cuesta una fortuna. Lo malo: la barrera de entrada para hacer lo mismo sin controls — es solo cuestión de tiempo y compute.

Fuente de inspiración: Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

Comentarios

Aún no hay comentarios. ¿Por qué no comienzas el debate?

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *