Skip to content
Buscar

Cómo usar robots.txt para SEO

Aprende qué hace robots.txt, cómo escribir reglas seguras, verificar su funcionamiento y solucionar bloqueos que afectan el rastreo y la indexación.

Cómo usar el archivo Robots.txt para SEO

Qué es robots.txt y qué controla

Robots.txt es un archivo de texto que colocas en el directorio raíz (por ejemplo, https://www.domain.com/robots.txt.) que comunica instrucciones de acceso a rastreadores (crawlers). Es un estándar de exclusión — indica qué rutas pueden o no pueden solicitar los bots. Importante: robots.txt afecta el rastreo, no la decisión final de indexación ni el posicionamiento.

En términos prácticos debes distinguir tres fases: crawling (descubrimiento y petición de páginas), indexing (decidir qué almacenar en el índice) y ranking (cómo se ordenan los resultados). Robots.txt principalmente influye en crawling; bloquear una URL puede impedir que un motor vea su etiqueta noindex o su contenido renderizado, con lo que la indexación puede verse afectada.

Sintaxis básica y directivas habituales

Las directivas más usadas son User-agent, Disallow, Allow y Sitemap. Google y otros motores aceptan comodines in-string como * y el final de cadena $ para patrones. Algunas líneas de ejemplo:

Ejemplo mínimo (permite todo):

User-agent: *

Disallow:

Ejemplo para bloquear todo el sitio:

User-agent: *

Disallow: /

Ejemplo para permitir todo salvo una carpeta de archivos privados:

User-agent: *

Disallow: /privado/

Sitemap: https://www.domain.com/sitemap.xml

Buenas prácticas al escribir robots.txt

Coloca robots.txt en el directorio raíz del host (por ejemplo, http://www.yoursite.com/robots.txt). Si usas varios subdominios cada uno necesita su propio robots.txt. Evita instrucciones ambigüas y mantén el archivo legible para humanos.

Controla el acceso a recursos necesarios para rendering: Google y otros motores renderizan páginas modernas, y si bloqueas CSS o JS importantes puedes impedir que el bot renderice correctamente la página. Eso puede impactar la indexación y la evaluación de Core Web Vitals.

No uses robots.txt como mecanismo de seguridad para ocultar datos sensibles; rastreadores malintencionados pueden ignorar el estándar. Para proteger contenido usa autenticación, ubicaciones no públicas o cabeceras que requieran autorización.

Comprobaciones y comandos útiles

Desde fuera del sitio (útil cuando no tienes Search Console para ese dominio) puedes:

  • Ver el contenido del archivo: usa curl https://www.domain.com/robots.txt — esto devuelve el cuerpo del archivo.
  • Comprobar cabeceras: curl -I https://www.domain.com/robots.txt — devuelve solo las cabeceras HTTP (útil para ver cache, redirecciones o códigos de estado).
  • Simular peticiones de un user-agent concreto: curl -A "Googlebot" https://www.domain.com/mi-pagina — recuerda que -A cambia el user-agent y no justifica servir contenido distinto; evita el cloaking.

Si tienes la propiedad del sitio en Google Search Console usa sus herramientas para depurar: la URL Inspection te dice si Google conoce e indexó una URL; la presencia de bloqueos de robots puede detectarse allí. Ten en cuenta que Google usa la versión móvil como base principal para crawling e indexación; desde julio de 2024 Googlebot Smartphone es el rastreador por defecto.

Errores comunes y cómo solucionarlos

Bloquear CSS/JS críticos: muchas implementaciones bloquean por error carpetas de recursos y eso impide que el bot renderice la página. Revisa los paths y permite acceso a recursos necesarios.

Bloquear todo el sitio por accidente: una línea como Disallow: / cerrará el sitio al crawling. Antes de publicar cambios prueba localmente y verifica con curl.

Confundir paths con URL completas: robots.txt opera con rutas relativas al host; las reglas deben coincidir con la estructura de URLs públicas (cuidado con mayúsculas/minúsculas y barras finales).

Depender de Crawl-delay para controlar carga: Google ignora Crawl-delay; si necesitas limitar carga usa reglas del servidor, rate-limiting o la API de gestión de indexación donde corresponda.

Verificación de backlinks y páginas externas (breve nota)

Si evalúas un publisher o una página externa (por ejemplo, revisando si un enlace hacia tu sitio está en una página indexable), usa herramientas que no requieran acceso a Search Console del dominio externo: curl para ver el HTML, inspección de DOM en el navegador para comprobar que el enlace es visible y consultas públicas (site:ejemplo) como indicio de indexación. Recuerda que el operador site: puede dar una indicación, pero no es una prueba definitiva de indexación.

Ejemplo de comprobación externa rápida:

  • curl https://www.domain.com/pagina-publica (ver HTML)

Checklist rápida antes de publicar cambios

  • ¿Está robots.txt en la raíz correcta y accesible por HTTPS si tu sitio usa HTTPS?
  • ¿Permites CSS/JS necesarios para el rendering?
  • ¿Has validado el archivo con curl y comprobado cabeceras (200 OK vs 404/5xx/redirect)?
  • Si tienes acceso, confirma en Google Search Console que las URLs clave no aparecen bloqueadas por robots.

Para ampliar conceptos técnicos relacionados con crawling, indexación y señales de rendimiento, Lee la guía de Technical SEO.

Preguntas frecuentes

¿Robots.txt evita que una página se indexe?

Robots.txt impide o permite el rastreo de una URL, pero no es un mecanismo de indexación en sí. Si una URL está bloqueada por robots.txt, los motores pueden aún indexar la URL basándose en enlaces externos sin acceder al contenido. Si quieres evitar la indexación, usa una etiqueta meta noindex en la propia página o el encabezado HTTP X-Robots-Tag: noindex, y asegúrate de que la página sea accesible para que el motor pueda leer esa instrucción.

¿Puedo usar robots.txt para ocultar datos sensibles?

No. Robots.txt es un aviso público: cualquier persona o bot puede leerlo y algunos bots malintencionados ignoran sus reglas. Para proteger datos sensibles usa autenticación, almacenamiento privado o respuestas con código 401/403 según corresponda.

¿Qué ocurre si cambio robots.txt con frecuencia?

Los motores reconsultan robots.txt periódicamente y pueden cachear su contenido. Cambios frecuentes pueden provocar comportamientos inconsistentes de crawlers; prueba localmente, versiona el archivo y despliega con cuidado. Revisa las cabeceras HTTP (edad del cache) tras el despliegue.

¿Los comodines funcionan en todos los motores de búsqueda?

La mayoría de motores principales soportan patrones con * y el signo $ en las reglas, pero la interpretación puede variar. Verifica con pruebas y no dependas de un solo patrón complejo sin haberlo comprobado.

Artículos relacionados