Claude Haiku 5.5 bajó su precio un 90% y eso importa más que otro benchmark récord

Claude Haiku 5.5 bajó su precio un 90% y eso importa más que otro benchmark récord

Claude Haiku 5.5 bajó su precio un 90% y eso importa más que otro benchmark récord

Anthropic sacó esta semana Claude Haiku 5.5, y la noticia no es que el modelo sea más inteligente sino lo que cuesta. Para peticiones de hasta 100.000 tokens quedó en $0.10 por millón de tokens de entrada y $0.50 de salida, contra $1 y $5 de Haiku 4.5. Traducido: hacer correr un agente con este modelo ahora sale un 90% más barato. El anuncio pasó medio desapercibido entre el ruido de GPT-6, pero para quien corre infraestructura con agentes el día a día, este es el cambio que de verdad mueve la aguja.

Lo que trae

Tres cosas. Primero, control de «esfuerzo» (effort): es el primer modelo Haiku donde puedes elegir cuánto pensar antes de responder. Bajo esfuerzo para clasificar y resumir, alto para lo que demande más. Antes esto era cosa de modelos grandes; traerlo a la clase pequeña es útil de verdad, porque un pipeline con miles de llamadas al día no puede pagarle a cada clasificación con un Sonnet.

Segundo, las velocidades. Haiku 5.5 es el modelo más rápido de Anthropic hasta la fecha, y de hecho el SDK Python y TypeScript ya suman soporte beta para computer use y browser use. Aquí hay un detalle que me gusta: los benchmarks muestran que en Terminal-Bench 4.0 pasó de 0.0% a 39.2%. Que el modelo «chico» ya resuelva casi 4 de cada 10 tareas de terminal, cuando la versión anterior no resolvía ninguna, cambia el cálculo de qué le delegas a un subagente y qué le guardas al modelo grande.

Tercero, el paquete completo: Anthropic bajó a la mitad el precio de lectura de caché de Sonnet 5.5 (el trabajo agéntico típico baja un ~20% con eso) y ahora regala créditos mensuales de API a suscriptores Max y Team. Todo apunta a la misma dirección: hacer más barato correr agentes, no hacer modelos más grandes.

Mi lectura

Lo que veo en esta carrera no es una guerra de puntajes sino de costo por tarea. Hace dos años corrías un pipeline de agentes y la cuenta venía en dólares y centavos por cada pasada del LLM; hoy el mismo trabajo puede salir en centavos, y eso habilita arquitecturas completamente distintas. Puedes, por ejemplo, poner un modelo pequeño revisando cada respuesta del modelo grande, o hacer compaction de contexto mil veces al día sin que el CFO te llame. Eso antes era impensable.

En mi pega he visto el patrón contrario: equipos que tiran todo al modelo «flagship» porque «es el mejor» y luego se sorprenden de la factura. La verdad es que el 80% de lo que la gente hace con un LLM es clasificación, extracción, resúmenes y formateo, y para eso pagar el precio de un modelo de frontera es quemar plata. El modelo adecuado para la tarea adecuada no es un slogan de marketing de Anthropic: es la diferencia entre un piloto que sobrevive y uno que muere a los tres meses por costo.

Ojo con un detalle que el anuncio si menciona pero poca prensa comenta: Haiku 5.5 usa un tokenizador nuevo que gasta más tokens por tarea. O sea, la bajada real no es un 90% limpio, es algo menos. Sigue siendo enorme, pero cuando hagas tus números de presupuesto, mide tokens consumidos, no solo el precio por millón. Ahí caí también yo alguna vez.

En mi infraestructura corriendo agentes y cron, este tipo de lanzamiento define qué arquitecturas son viables económicamente. Y la tendencia es clara: cada mes que pasa, hacer correr un agente 24/7 cuesta menos. Para los que estamos construyendo sobre esto, es el mejor escenario posible.

Fuente de inspiración: Introducing Claude Haiku 5.5 — Anthropic

Comentarios

Aún no hay comentarios. ¿Por qué no comienzas el debate?

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *