Cómo funciona robots.txt
Es un archivo de texto que vive en la raíz de tu dominio (https://tusitio.com/robots.txt) y que los rastreadores leen antes de entrar. Cada grupo empieza con User-agent y sigue con reglas Allow o Disallow por ruta. Un asterisco en User-agent («*») se aplica a todos los bots; un bot concreto, como Googlebot, puede tener su propio grupo.
Las directivas que genera
- User-agent: a qué rastreador aplica el grupo de reglas («*» para todos).
- Disallow: rutas prohibidas, una por línea. Un Disallow vacío (sin ruta) significa «puedes rastrear todo».
- Allow: excepciones dentro de una ruta bloqueada, por ejemplo permitir /publico/ dentro de /privado/.
- Crawl-delay: segundos de espera entre peticiones. Opcional y no respetado por todos los buscadores (Google lo ignora).
- Sitemap: URL absoluta de tu sitemap.xml para ayudar a descubrir las páginas.
Los presets
«Permitir todo» deja el sitio abierto al rastreo (Allow: /); «Bloquear todo» cierra la web entera con Disallow: /, útil en entornos de prueba; «Bloquear /admin» cierra solo esa carpeta. Elige uno, ajusta las rutas y copia el resultado.
robots.txt pide, no obliga: los bots malintencionados pueden ignorarlo y las URLs bloqueadas pueden llegar a aparecer en resultados sin descripción. Para saca una página del índice, usa la meta etiqueta noindex.