Skip to content
Buscar

robots.txt: qué es y cómo funciona

robots.txt es un archivo de texto en el directorio raíz que indica a rastreadores qué URLs pueden o no solicitar; controla el rastreo (no la clasificación) y puede declarar sitemaps y reglas específicas por user-agent.

Robots.txt: Qué es y cómo funciona

Qué es robots.txt?

robots.txt es un archivo de texto plano colocado en el directorio raíz de un host (por ejemplo https://example.com/robots.txt). Su propósito es comunicar a crawlers y otros agentes web qué rutas pueden solicitar. Es parte del estándar conocido como protocolo de exclusión de robots y se interpreta por muchos motores de búsqueda grandes y crawlers de terceros.

Por qué robots.txt importa para SEO

robots.txt controla el acceso del crawler (fase de crawling). Si bloqueas recursos críticos (CSS, JS o HTML) puedes impedir que un motor de búsqueda vea una página correctamente, lo que afecta la indexación y la interpretación del contenido. Importante: bloquear via robots.txt afecta principalmente el crawling y la posibilidad de que el motor obtenga información; no es en sí mismo un factor directo que "ordene" los resultados. La indexación y el ranking dependen de muchos otros señales.

Cómo funciona robots.txt

Cuando un crawler llega a un host suele solicitar /robots.txt antes de recuperar otras páginas. El parser lee directivas agrupadas por User-agent y aplica Allow/Disallow para rutas. Además se pueden incluir referencias a sitemaps. El motor de búsqueda decide cómo aplicar las directivas; el archivo actúa como señal/consenso, no como un contrato absoluto.

Directivas básicas

Ejemplos de líneas válidas en robots.txt:
User-agent: *
Disallow: /admin/
Allow: /public/
Sitemap: https://example.com/sitemap.xml
Las directivas principales que verás son User-agent, Disallow, Allow y Sitemap. El soporte para Crawl-delay varía por crawler (Google no lo usa).

Tipos de robots.txt

No existen formalmente «tipos» distintos del archivo en sí, pero en la práctica verás varias implementaciones:
- robots.txt por host: cada subdominio debe exponer su propio /robots.txt (ej.: https://sub.example.com/robots.txt).
- robots.txt dinámico: generado por la aplicación en tiempo real (asegúrate de caché apropiado).
- robots.txt vacío o ausente: si falta, la práctica estándar es permitir el rastreo por defecto.
- robots.txt que contiene solo Sitemap: sirve para publicar la ubicación del mapa del sitio sin bloquear rutas.

Cómo empezar con robots.txt

Pasos prácticos para crear un robots.txt seguro y eficiente:
1) Coloca un archivo robots.txt en el directorio raíz del host. 2) Usa User-agent y Disallow/Allow para reglas claras. 3) Evita bloquear recursos necesarios para renderizado (CSS/JS). 4) Añade la directiva Sitemap si tienes un sitemap XML. 5) Prueba y monitoriza los accesos tras publicarlo.

Errores comunes en robots.txt

Errores frecuentes que generan problemas de indexación o renderizado:
- Bloquear CSS/JS necesarios para renderizar la página.
- Usar Disallow para proteger datos sensibles en lugar de autenticación o noindex (si bloqueas el crawling, los motores no verán meta noindex).
- Sintaxis incorrecta o ubicación distinta al directorio raíz.
- Depender de Crawl-delay para controlar Googlebot (Google no lo respeta).
- Cambios frecuentes sin pruebas: un robots.txt mal formado puede devolver 404 o 5xx y ser interpretado como "no rules" por algunos crawlers.

Comprobar robots.txt: checklist técnico

**Robots.txt accesible** — dónde verificar: navegador o curl — pasa cuando: https://tu-dominio/robots.txt devuelve 200 y Content-Type adecuado (text/plain o similar).
**Contenido legible por Googlebot** — dónde verificar: curl -A "Googlebot/2.1 (+http://www.google.com/bot.html)" https://tu-dominio/robots.txt — pasa cuando: las reglas esperadas aparecen en la salida.
**No bloquea recursos de renderizado** — dónde verificar: Chrome DevTools (Network/Render) y revisar si CSS/JS están permitidos — pasa cuando: recursos necesarios se cargan sin bloqueo.
**Sitemap declarado** — dónde verificar: robots.txt y sitemap.xml accesible — pasa cuando: la URL del sitemap es válida y responde 200.
**Comportamiento del crawler en logs** — dónde verificar: registros del servidor — pasa cuando: los user-agent legítimos acceden según las reglas, sin errores 403/404 inesperados.

Comprobaciones con comandos (ejemplos)

Inspeccionar cabeceras: curl -I https://example.com/robots.txt (devuelve solo cabeceras).
Ver contenido como Googlebot: curl -A "Googlebot/2.1 (+http://www.google.com/bot.html)" https://example.com/robots.txt (devuelve el cuerpo completo con ese user-agent).

Herramientas útiles para verificar

Usa herramientas que trabajen desde fuera de tu dominio: curl y navegador para inspección directa; Chrome DevTools para comprobar recursos bloqueados en la renderización; registros del servidor para ver peticiones reales; Bing Webmaster Tools (Site Explorer) para pruebas de rastreo desde Bing. Para páginas que controlas, usa la URL Inspection en Google Search Console para ver cómo Google ve la página (inspección de la versión renderizada).

Nota sobre indexación: si bloqueas una URL en robots.txt, el crawler puede no acceder a la página y, por tanto, no ver meta noindex; en ese caso el motor aún podría indexar la URL basándose en enlaces externos sin contenido. Para evitar la indexación efectiva de información sensible, usa autenticación o elimina el recurso del servidor.

Lee la guía de Technical SEO

Preguntas frecuentes

El SEO técnico y la gestión de rastreo son pasos necesarios para la visibilidad; la configuración de robots.txt es una palanca técnica que requiere pruebas y monitorización continuas. Construye autoridad con backlinks de calidad

¿Robots.txt impide que una página aparezca en resultados?

No necesariamente: robots.txt controla el crawling; la indexación puede ocurrir como “URL-only” si otros sitios enlazan la página. Para evitar indexación visible al público, usa bloqueo por autenticación o meta noindex sin bloquear el crawling (para que el crawler pueda leer la metaetiqueta).

¿Puedo usar reglas por subdirectorios? Sí, pero recuerda que robots.txt se evalúa por host; subdominios necesitan su propio archivo en su raíz.

¿El wildcards (*) y el símbolo $ funcionan? Sí, muchos motores (incluido Google) aceptan '*' para coincidencias y '$' para final de cadena; comprueba el comportamiento del crawler objetivo antes de depender solo de ellos.

¿Qué pasa si mi robots.txt devuelve 5xx o está malformado? Algunos crawlers pueden asumir "sin reglas" y comenzar a rastrear; otros pueden ser más conservadores. Evita publicar robots.txt con errores y monitoriza logs tras cambios.

Términos relacionados