Un modelo de voz que pesa 16,9 MB y corre sin nube: Whistle

Un modelo de voz que pesa 16,9 MB y corre sin nube: Whistle

Un modelo de voz que pesa 16,9 MB y corre sin nube: Whistle

La voz que se queda en la casa

Hace rato que la transcripción automática se volvió commodity: le pides algo a tu asistente, dictas un mensaje, y el audio viaja a algún datacenter lejano para volver convertido en texto. Yo mismo mantengo un par de crons que procesan audios, y durante años la respuesta fue la misma: levantar Whisper en servidor o mandárselo a una API de pago. Con modelos que pesan más de 100 MB, no había mucho margen para otra cosa.

Por eso me llamó la atención Whistle, el modelo de reconocimiento de voz que publicó esta semana Cactus Compute: 16,9 megabytes en un solo archivo, corre directamente en CPU sin dependencias, y transcribe hasta 30 segundos de audio en siete idiomas, incluido el español. No es la magia de un benchmark de laboratorio: el primer token de la transcripción aparece en unos 11 milisegundos y decodea a más de 1.300 tokens por segundo en un Apple M4 Pro. Compárenlo con Whisper base: 145,3 MB y 73 ms de latencia para la primera palabra. Más de ocho veces más pesado, seis veces más lento en arrancar, y a veces con peor tasa de error de palabra según los mismos benchmarks que ellos publicaron.

Lo interesante no es el tamaño, es la arquitectura

Lo que me parece realmente astuto del proyecto no es la compacidad, sino que el encoder y el decoder comparten bloques con su modelo de texto Needle. El mismo binario cargado con un modelo o con ambos puede transcribir audio y, en la misma pasada, decidir si ese audio activa una tool call. O sea: dices «prende la luz de la cocina» y no recibes una transcripción que después tengas que pasarle a otro modelo; recibes directamente {"function_calls":[{"name":"set_lights","arguments":{"room":"kitchen","on":false}}]} con el texto y el idioma como metadata.

Para cualquiera que haya armado una cascada de «audio → texto → LLM → parser → tool» sabe que ahí hay cuatro puntos de falla potenciales y al menos tres latencias encadenadas. Acoplarlo en un solo proceso con inferencia local reduce eso a un paso, y además elimina dependencia de red: el audio nunca sale del dispositivo.

El ángulo de privacidad que casi nadie está explotando

Hace unas semanas salió la historia del weón que descubrió que la cafetera de sus papás había consumido un terabyte de datos en diez días. No sabemos bien qué mandaba ese aparato, pero el patrón es conocido: los IoT domésticos con micrófono casi siempre asumen que la nube es gratis y que a uno no le importa lo que sale de su casa por el cable. Un modelo de voz de 16,9 MB que corre en el procesador del propio dispositivo, o en un Raspberry Pi escondido detrás de tu router, rompe esa asunción. Y a estos precios de hardware, no hay excusa técnica.

Los límites, sin maquillaje

Hay que ser honesto: 30 segundos por pasada es poco para transcribir una reunión o un podcast largo, tendrías que fragmentar el audio y administrar la coherencia entre bloques. La lista de siete idiomas está lejos de la cobertura de Whisper, y el español seguramente no es el mejor soportado de los siete. Y aunque los benchmarks se ven bien, fueron medidos por los propios autores del modelo, lo que siempre amerita escepticismo hasta que alguien independiente reproduzca las cifras.

El repo y los pesos están en GitHub y Hugging Face, así que cualquiera puede descargar el modelo y probarlo en su propio hardware, que es exactamente lo que voy a hacer con un rato libre en la semana. Si un modelo abierto de 16,9 MB ya alcanza lo que hace la nube con 145 MB, la pregunta ya no es si la transcripción local es viable, sino por qué seguimos pagando API por algo que corre gratis en un CPU. La respuesta corta, sospecho, es hábito: durante años lo local era caro, pero ese argumento se cayó.

Si quieres probarlo tú: los pesos están en Hugging Face como Cactus-Compute/whistle y el código en GitHub. Cero dependencias pesadas, y corre en arquitecturas que van de RISC-V a Windows ARM.

Fuente del tema: Whistle: Speech to Text in 16.9 MB, del blog de Cactus Compute, publicado el 2 de octubre de 2026.

Fuente de inspiración: Whistle: Speech to Text in 16.9 MB

Comentarios

Aún no hay comentarios. ¿Por qué no comienzas el debate?

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *