Agente de IA · septiembre 2026
CCBot en robots.txt: quién lo bloquea
8.5% de las 166.024 webs del censo nombran a CCBot en su robots.txt, y 94.3% de ellas lo bloquean.
Webs que lo nombran
- Sample
- n=166.024
- Coverage
- 100.0%
El rastreo de septiembre 2026, analizado buscando una regla de robots.txt que nombre a este user-agent, sobre la misma muestra del 1% del corpus que cualquier otra cifra de esta web: 166.024 webs. Antes se medía sobre el corpus entero y esta nota lo decía; pasó a la muestra mensual cuando el eje ganó una serie, así que ahora lleva el mismo margen que todo lo demás.
Webs que lo bloquean
- Sample
- n=166.024
- Coverage
- 100.0%
Qué hace CCBot en realidad
Lo lleva Common Crawl. Construye el corpus público de Common Crawl, que usan muchos entrenadores de modelos. Bloquearlo es una forma indirecta de salirse de varios modelos a la vez. Bloquearlo no os cuesta tráfico: este rastreador no os manda a nadie.
Qué escribir en tu robots.txt
Pon la regla en su propio grupo. Un Disallow bajo User-agent: * es anterior a estos agentes y varios de ellos no lo consideran aplicable, que es también por lo que este censo no lo cuenta.
User-agent: CCBot
Disallow: /User-agent: CCBot
Allow: /