Saltar al contenido principal
Utilia

Generador de robots.txt

Configura quién puede rastrear tu web y por dónde: escribe el User-agent, lista las rutas que bloqueas o permites y añade tu sitemap. Los presets te dejan partir de un caso típico (permitir todo, bloquear todo o cerrar /admin) y el archivo se genera en vivo.

Presets:
* se aplica a todos los buscadores.
Opcional. No todos los buscadores lo respetan.
Una ruta por línea.
Opcional; anula un bloqueo más general.
Opcional; debe ser una URL absoluta.

Todo se calcula en tu navegador: no enviamos tus datos a ningún servidor.

Cómo funciona robots.txt

Es un archivo de texto que vive en la raíz de tu dominio (https://tusitio.com/robots.txt) y que los rastreadores leen antes de entrar. Cada grupo empieza con User-agent y sigue con reglas Allow o Disallow por ruta. Un asterisco en User-agent («*») se aplica a todos los bots; un bot concreto, como Googlebot, puede tener su propio grupo.

Las directivas que genera

  • User-agent: a qué rastreador aplica el grupo de reglas («*» para todos).
  • Disallow: rutas prohibidas, una por línea. Un Disallow vacío (sin ruta) significa «puedes rastrear todo».
  • Allow: excepciones dentro de una ruta bloqueada, por ejemplo permitir /publico/ dentro de /privado/.
  • Crawl-delay: segundos de espera entre peticiones. Opcional y no respetado por todos los buscadores (Google lo ignora).
  • Sitemap: URL absoluta de tu sitemap.xml para ayudar a descubrir las páginas.

Los presets

«Permitir todo» deja el sitio abierto al rastreo (Allow: /); «Bloquear todo» cierra la web entera con Disallow: /, útil en entornos de prueba; «Bloquear /admin» cierra solo esa carpeta. Elige uno, ajusta las rutas y copia el resultado.

robots.txt pide, no obliga: los bots malintencionados pueden ignorarlo y las URLs bloqueadas pueden llegar a aparecer en resultados sin descripción. Para saca una página del índice, usa la meta etiqueta noindex.

Preguntas frecuentes

¿Bloquear una página en robots.txt la quita de Google?
No exactamente: evita el rastreo, pero la página puede aparecer con la URL visible si otros enlazan a ella. Para excluirla del índice, usa noindex (y entonces no la bloquees en robots.txt, o el bot no podrá verlo).
¿Dónde coloco el archivo?
En la raíz del dominio, accesible en https://tudominio.com/robots.txt. Ni en subcarpetas ni con otro nombre servirá para los rastreadores.
¿Google respeta el Crawl-delay?
No; Googlebot lo ignora y gestiona su velocidad solo. Otros rastreadores sí lo usan, así que inclúyelo solo si tu servidor necesita el respiro.
¿Puedo tener varios grupos de reglas?
Sí: cada User-agent abre su grupo. Esta herramienta genera un grupo por agente; si necesitas dos, genera un bloque y añade el segundo a mano siguiendo el mismo formato.

Continúa donde lo dejaste con estas utilidades que combinan bien con esta.