Robots.txt SEO: controla el rastreo de forma eficiente
Aprenderás qué puede y no puede hacer robots.txt, cómo escribirlo correctamente, cómo verificar su efecto y evitar errores que bloqueen contenido valioso.

Qué es robots.txt y qué papel juega en SEO
Robots.txt es un archivo de texto plano ubicado en la raíz de un host (por ejemplo https://example.com/robots.txt) que ofrece instrucciones básicas a rastreadores compatibles sobre qué rutas pueden o no solicitar. Su función principal es optimizar el gasto de rastreo y evitar que los bots accedan a secciones de bajo valor, pero no es una herramienta para controlar por sí sola la indexación o las posiciones en búsqueda.
Es clave distinguir tres fases técnicas: crawling (descubrimiento y fetch), indexing (decisión de almacenar contenido en el índice) y ranking (ordenar resultados). Robots.txt influye sobre el crawling; su efecto sobre indexación y ranking es indirecto y depende de señales adicionales (meta robots, enlaces, contenido).
Sintaxis y directivas clave
Las directivas más útiles y ampliamente soportadas son:
- User-agent: identifica a qué rastreador aplica la regla (por ejemplo: User-agent: *)
- Disallow: bloquea rutas completas o prefijos (por ejemplo: Disallow: /private/)
- Allow: permite rutas concretas que quedarían bloqueadas por una Disallow más amplia (útil en motores que aplican Allow/Disallow)
- Sitemap: apunta a la ubicación del mapa del sitio para mejorar descubrimiento (por ejemplo: Sitemap: https://example.com/sitemap.xml)
- Directivas no estándar: algunos crawlers respetan instrucciones adicionales (Host, Crawl-delay, clean-param), pero su soporte varía; en particular, Google no respalda Crawl-delay.
Ejemplo mínimo práctico
Un robots.txt claro y seguro suele verse así:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap.xml
Qué hace y qué no hace robots.txt
Lo que sí hace:
- Evitar que rastreadores compatibles descarguen ciertas rutas, reduciendo el gasto de rastreo.
- Sugerir a los motores dónde están los sitemaps.
Lo que no hace (o hace de forma limitada):
- No garantiza que una URL no aparezca en el índice: si otros sitios enlazan una URL bloqueada, los motores pueden indexar la URL sin su contenido.
- No reemplaza a meta robots o cabeceras HTTP (por ejemplo, meta robots noindex), que controlan la indexación cuando la página se rastrea.
Verificación y comprobaciones: desde fuera y para tu propio sitio
Comprobaciones externas (no necesitas acceso al servidor)
Para revisar cómo responde un host público:
- Consulta el archivo con curl para ver el contenido real: curl https://example.com/robots.txt
- Si solo necesitas encabezados (por ejemplo, comprobar cacheo o redirecciones): usa curl -I https://example.com/robots.txt
Prueba la ruta que quieres revisar con curl o en el navegador para confirmar si el archivo bloquea su acceso (por ejemplo: curl -I https://example.com/private/page.html).
Comprobaciones para tu propio sitio (tienes Search Console)
Para URLs que controlas, combina pruebas externas con datos de Google Search Console y registros de servidor:
- URL Inspection (Search Console): revisa si Google informa que una URL está bloqueada por robots.txt.
- Registros de servidor: confirma qué user-agents demandan qué URLs y cuándo (útil para diagnosticar un bloqueo accidental de rastreo masivo).
- Chrome DevTools > Network: comprueba que recursos como CSS y JavaScript no estén bloqueados por robots.txt (si están bloqueados, la renderización puede verse afectada).
Errores comunes y cómo evitarlos
Los errores más habituales que dañan la visibilidad suelen ser operaciones sencillas de evitar si se aplican comprobaciones básicas:
- Bloquear recursos críticos (CSS/JS): impide que Google renderice correctamente y puede afectar a Core Web Vitals y extracción de datos estructurados.
- Bloquear por error toda la web (Disallow: /) durante despliegues: comprueba el archivo tras cada despliegue y añade tests automatizados en pipelines.
- Confundir bloqueos de crawling con control de indexación: si quieres impedir indexación, usa meta robots noindex en páginas que se puedan rastrear; no confíes en Disallow para lograr un noindex efectivo.
- Ubicación equivocada del archivo: robots.txt es por host y protocolo (https vs http, www vs non-www). Asegúrate de publicar el archivo en la raíz exacta del host que usan los usuarios y motores.
- Problemas de codificación y redirecciones: un robots.txt que responde con un 404, 5xx o redirige a otra página puede ser interpretado como ausencia de directivas; comprueba códigos HTTP con curl -I.
Buenas prácticas operativas
Adopta procesos sencillos para reducir riesgo humano y técnico:
- Incluye el chequeo del robots.txt en tus pipelines de despliegue y en revisiones de cambios que afecten rutas y rewrites.
- Mantén reglas simples y comentadas; las reglas complejas con múltiples user-agents y excepciones son más propensas a errores.
- Prefiere bloquear áreas de bajo valor con Disallow y usar meta robots noindex en páginas que quieras explícitamente fuera del índice, solo si esas páginas pueden ser rastreadas.
- Comprueba que tu sitemap está referenciado desde robots.txt y disponible públicamente para mejorar descubrimiento de páginas importantes.
Casos de uso prácticos
Algunos ejemplos típicos y su razonamiento:
- Bloquear áreas administrativas o paneles: evita rastreo innecesario de páginas no orientadas a usuarios públicos.
- Bloquear parámetros y filtros duplicados si no gestionas canonicalización adecuadamente; sin embargo, es preferible resolver duplicación con canonical o estructuras canónicas en lugar de depender únicamente de robots.txt.
- Evitar que entornos de staging y QA sean rastreados: protege estos hosts con autenticación o IP allowlist en lugar de depender solo de robots.txt, que es una directiva pública y no una medida de seguridad.
Integración con otros controles de indexación
Para controlar la indexación y la presentación en resultados combinan robots.txt con:
- Meta robots (noindex, nofollow) en páginas que necesiten ser excluidas y que además sean rastreables.
- Cabeceras HTTP X-Robots-Tag para respuestas no HTML o para control a nivel de servidor.
- Canonicalización adecuada para consolidar variantes de URL y evitar duplicados que obliguen a los crawlers a gastar recursos.
Comprobaciones rápidas para incidencias frecuentes
- ¿El archivo responde en la URL esperada? curl -I https://example.com/robots.txt
¿Se bloquean recursos críticos (CSS/JS)? Compruébalo con Chrome DevTools > Coverage o usando curl para las rutas bloqueadas.
¿Google indica bloqueo en URL Inspection? Usa Search Console para tus propias URLs y combina con registros de servidor para ver la actividad real.
Preguntas frecuentes
¿Si bloqueo una URL con robots.txt desaparecerá de Google?
No necesariamente. Disallow impide que Google acceda al contenido de la URL, pero si existen enlaces desde otras páginas Google puede indexar la URL sin contenido. Para excluir una URL del índice de forma fiable deberías permitir el rastreo y usar meta robots noindex o X-Robots-Tag.
¿Puedo usar robots.txt para reducir la carga del servidor en picos de tráfico?
Sí: bloquear rutas de bajo valor puede reducir requests de crawlers, pero no es un sustituto de prácticas como optimizar cachés, controlar politicas de rate-limiting o usar herramientas CDN. Además, algunos crawlers no respetan robots.txt y la reducción no será completa.
¿Qué ocurre si mi robots.txt responde con un error 5xx?
Si el archivo no está disponible por errores del servidor, los rastreadores pueden interpretar que no hay restricciones y proceder a rastrear; además, Search Console puede mostrar avisos. Es importante que robots.txt devuelva 200 y el contenido correcto o, si no aplica, un 404 claro (que implica ausencia de reglas).
¿Cómo afecta mobile-first indexing a robots.txt?
Google utiliza la versión móvil como principal base de crawling e indexación; desde julio de 2024 Googlebot Smartphone es el agente por defecto para Search. Si bloqueas recursos solo en la versión móvil (o bloqueas la versión móvil completa), podrías impedir que Google entienda y renderice tus páginas correctamente. Asegura paridad técnica (no necesariamente idéntica en diseño) entre versiones móviles y de escritorio para evitar problemas.
Si quieres profundizar en controles técnicos relacionados, Lee la guía de Technical SEO para ver cómo robots.txt encaja con canonicalización, Core Web Vitals y verificación de indexación.
Artículos relacionados

Cómo usar robots.txt para SEO
Aprende qué hace robots.txt, cómo escribir reglas seguras, verificar su funcionamiento y solucionar bloqueos que afectan el rastreo y la indexación.

Los mejores servicios de SEO (optimización para motores de búsqueda)
Cómo comparar y elegir servicios de SEO: técnicos, de contenido y de enlaces, con listas de verificación y herramientas de comprobación prácticas.

Consejos SEO para mejorar rankings: estrategias prácticas
Consejos prácticos de SEO para mejorar visibilidad: prioriza intención, experiencia de usuario, técnica y enlaces verificados.
