Cuando la mitad de tus visitas son bots: me puse a contar humanos de verdad

Cuando la mitad de tus visitas son bots: me puse a contar humanos de verdad

Cuando la mitad de tus visitas son bots: me puse a contar humanos de verdad

Revisé los logs de uno de mis servidores la otra semana y me reí solo: el gráfico de visitantes era una meseta hermosa, tráfico constante, miles de peticiones diarias. Si le creo al access log de nginx, mi blog modesto es un imperio. El problema es que la abrumadora mayoría de ese tráfico no es gente: son scrapers de IA recorriendo todo lo que encuentra, a toda hora, sin pedir permiso ni declararse.

No es una teoría. Vincent Bernat, que lleva años administrando su propio sitio, contó hace poco algo casi idéntico: su analizador de logs le reportaba alrededor de 2.000 visitantes diarios, y cuando se puso serio con el filtrado, los humanos reales eran menos de 200. Diez veces de diferencia. No es que su sitio hubiera crecido; es que el ruido de los bots se había comido la señal por completo.

El access log dejó de ser una métrica

Durante años, mirar los logs del servidor fue la forma honesta de saber cuánta gente te lee. Sin JavaScript, sin cookies, sin terceros. Pero ese modelo murió de a poco: los rastreadores de IA no ejecutan JavaScript (o lo hacen mal), se disfrazan con user agents genéricos y golpean cada URL sin importar el contenido. Analizar peticiones crudas hoy es medir cuánto te quieren las máquinas, no cuánta gente te lee.

En mi pega y en mis proyectos personales he visto el patrón desde el otro lado también: cuando montas un servicio nuevo, en minutos ya tienes bots probando rutas de login, escaneando configuraciones y probando credenciales. El tráfico «de fondo» de internet es básicamente maquinaria pesada andando sola.

Contar de otra forma

Lo que me gustó del enfoque que describe Bernat es la idea central: exigir una interacción humana antes de contar la visita. En vez de registrar cada hit, el contador solo se dispara cuando hay un movimiento de mouse, un toque en pantalla o una tecla presionada. Un scraper que simplemente descarga el HTML no califica. Es trivial de implementar y corta el ruido de raíz. Para quien navega sin JavaScript, usa un fallback con CSS que también requiere hover, así nadie queda fuera por usar una herramienta distinta.

Y detrás de eso, analytics self-hosted: una instancia propia, un binario y SQLite, sin cookies y sin guardar IPs. Sesiones efímeras derivadas del user agent y la dirección, válidas unas horas. Suficiente para saber qué artículos se leen y de dónde llegan, sin convertir a tus lectores en producto. Existen alternativas más completas en el mundo open source, pero para un blog personal lo simple gana: menos cosas que mantener, menos superficie de ataque, menos tentación de coleccionar datos que después hay que proteger.

Mi conclusión después de años con VPS

Uno de los aprendizajes más caros de administrar servidores propios es que el volumen no es confianza. Picos de tráfico no son fama, avisos del panel no son éxito, y un dashboard bonito lleno de números puede estar describiendo una fiesta a la que no fue nadie. Cuando la métrica se infla sola, terminas tomando decisiones sobre contenido y capacidad basadas en fantasmas.

Así que si tienes un sitio propio y los números se ven demasiado buenos, desconfía primero de ellos, no te celebres todavía. Filtra bots con intención, cuenta humanos con criterio, y quédate con la cifra pequeña pero real. Es menos espectacular en el dashboard, pero es la única que significa algo. Y de paso, tus lectores no pagan el precio de tu curiosidad estadística.

Fuente del tema: Bot-free self-hosted analytics with GoatCounter on NixOS, del blog de Vincent Bernat.

Fuente de inspiración: Bot-free self-hosted analytics with GoatCounter on NixOS

Comentarios

Aún no hay comentarios. ¿Por qué no comienzas el debate?

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *