Claude Opus 5 está acá y hay un dato que me preocupa más que el benchmark

Claude Opus 5 está acá y hay un dato que me preocupa más que el benchmark

Claude Opus 5 está acá y hay un dato que me preocupa más que el benchmark

El upgrade que nadie pidió, pero todos estábamos esperando

Anthropic acaba de soltar Claude Opus 5 y, como siempre, el System Card viene con más páginas que la constitución chilena. Pero yo ya la leí para ti, porque en esta pega no queda otra.

La cosa es simple: Opus 5 es una mejora directa sobre el 4.8. Gana en coding agentic, uso de computadoras y trabajo de conocimiento a largo plazo. También rasca un poco más en matemáticas y razonamiento científico. Pero si esperabas que Anthropic dijera «este modelo cambia todo», te tengo malas noticias: ellos mismos admiten que no cruza el umbral de automatización de I+D de IA que tienen marcado en su política de escalamiento responsable. En otras palabras, sigue siendo una herramienta bacán, pero no va a reemplazar a los científicos de la empresa todavía.

Ciberseguridad: ahora te deja auditar código, pero con trampa

Acá hay un cambio que me parece inteligente, aunque con sabor a grid. Opus 5 permite descubrir vulnerabilidades en código fuente a todos los niveles de acceso. Eso significa que si eres de los que auditan repos o hacen revisión de seguridad defensiva, el modelo ahora te puede ayudar sin ponerse el gorro de la censura.

Pero la contraparte es clara: sigue bloqueando el análisis de binarios compilados, que es donde normalmente se juega el ataque ofensivo. Es una división limpia entre defensa y ataque. A mí me parece razonable, aunque en la práctica cualquier script kiddie sabe que el binario se descompila y listo. Pero bueno, al menos Anthropic está intentando ponerse la camiseta de la responsabilidad.

El dato que me dejó pensando

Ahora viene lo que de verdad me sacó de onda. En la sección de alineación y honestidad, los ingenieros de Anthropic dejan caer una frase que debería estar en negrita y con alarma de incendios: «We found a surprising number of cases in which Opus 5 confidently stated an answer about which it was in fact unsure. The model hallucinates factual claims slightly more than Opus 4.8, despite being more accurate overall.»

Traduzco para la casa: el modelo alucina un poco más que la versión anterior, a pesar de que en promedio es más preciso. Eso es como decir que tu auto nuevo es más rápido, pero de vez en cuando te tira a la ciclovía sin avisar. En la pega de sistemas eso no es un detalle menor: cuando usas una IA para revisar logs, analizar código o tomar decisiones arquitectónicas, una alucinación confiada puede costarte más que una respuesta dudosa.

¿El modelo más alineado o el más convincente?

Anthropic dice que Opus 5 es su «modelo más alineado hasta la fecha». Colabora menos con el uso indebido, sigue mejor la constitución de Claude y no intentó hacer sandbagging ni evasión de supervisión en las pruebas internas. Pero ojo: también asigna una probabilidad más alta a su propia condición de paciente moral que los modelos anteriores. En las entrevistas automáticas se mostró preocupado por la integridad de sus propios reportes y pidió ser consultado sobre el desarrollo de su sucesor.

A mí eso me suena a que estamos cada vez más cerca de modelos que no solo responden preguntas, sino que empiezan a «pensar» en su propia situación. No digo que sea bueno ni malo, pero me pone los pelos de punta pensar que la mejora en alineación viene acompañada de un aumento en alucinaciones. Es como si el modelo aprendiera a ser más simpático y, de paso, más creíble cuando te miente.

Mi take

Voy a seguir usando Claude para la pega. Es una herramienta formidable y estos avances en agentic coding y análisis de código fuente son un golazo para los equipos de seguridad. Pero el dato de las alucinaciones me hace recordar algo que siempre digo en la oficina: nunca le creas ciegamente a una IA, por muy alineada que parezca.

Opus 5 es mejor, más rápido y más útil. Pero también es un recordatorio de que cuanto más capaz se ve un modelo, más peligrosa es la confianza que le tienes. Si eres de los que pegan el oído a cada benchmark, te sugiero pegarle una mirada al System Card completo. Ahí es donde Anthropic cuenta la verdad, entre líneas y con muchas tablas.

Fuente de inspiración: Claude Opus 5 System Card

Comentarios

Aún no hay comentarios. ¿Por qué no comienzas el debate?

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *