Qué pasa en realidad

Un buscador rastrea con educación y de forma previsible: lleva veinte años aprendiendo a no hacer daño a los sitios que indexa. La generación actual de rastreadores de IA no, y son muchos — diecisiete agentes con nombre sólo en este censo, cada uno con su propio ritmo, y detrás los que piden una página porque alguien acaba de preguntar por ella.

El resultado no es un pico que se ve en una gráfica y se olvida. Es un suelo que sube: más peticiones, por rutas que nadie optimizó, a horas que nadie cubrió, desde direcciones que ninguna caché calienta.

  • Se piden páginas que nadie visita, así que tu tasa de cache hit baja y tu base de datos hace trabajo que ningún lector pidió.
  • Las URL de búsqueda y de filtros — las caras — se rastrean combinatoriamente, porque un rastreador no tiene ninguna razón para no hacerlo.
  • Un rastreador que recibe una respuesta lenta no se aparta como lo haría una persona. Reintenta.
  • Tu factura sube antes que tu tráfico, porque el ancho de banda y el cómputo se miden y la atención no.

Por qué bloquearlo todo es la respuesta equivocada

Es lo primero que prueba todo el mundo, y cuesta más de lo que ahorra. Los agentes que entrenan modelos no te mandan nada; los que responden preguntas te mandan lectores, con un enlace. Bloquearlos todos con una regla es cómo una web desaparece del sitio donde la gente está empezando a preguntar, a cambio de un problema de carga que se resolvía de otra manera.

El censo existe en parte para hacer visible esa distinción: mide cada agente por separado, porque lo que te cuesta bloquear depende por completo de a quién bloqueas.

Qué hacemos de verdad

Empieza por mirar, no por comprar nada. Tus logs dicen qué agentes te están golpeando, con qué frecuencia y en qué URL se están gastando tu servidor — y esa lista es distinta en cada web.

  • Separar los agentes que te devuelven algo de los que no, y escribir un robots.txt que lo diga por agente y no por sitio.
  • Poner las rutas caras detrás de reglas que un rastreador respeta: límites de frecuencia por agente, y un crawl-delay donde se haga caso.
  • Cachear lo que se está pidiendo repetidamente, que normalmente no es aquello para lo que se diseñó tu caché.
  • Servir lo barato donde lo caro no hacía falta: una respuesta estática para una página cuyo HTML no cambia por visitante.
  • Y medirlo después, para que la factura y los tiempos de respuesta digan si funcionó.

Cómo saber si esto va contigo

Dos señales, y ninguna necesita una auditoría para verse. La primera es un servidor más ocupado de lo que dice tu analítica — porque la analítica cuenta personas y los agentes no ejecutan JavaScript. La segunda son respuestas lentas a horas sin lectores dentro.

Si alguna de las dos te suena, el primer mensaje útil no es una petición de presupuesto. Son tus logs y una frase sobre qué estás viendo.

Mandadnos vuestros logs, no un pliego

La primera respuesta son una o dos preguntas, no un presupuesto: lo que necesita una web depende de con qué esté hecha y de quién la esté golpeando. Una página y una dirección bastan para empezar, y si ya sabéis qué agentes os están haciendo daño, decidlo.