robots.txt: qué es y cómo funciona
robots.txt es un archivo de texto en el directorio raíz que indica a rastreadores qué URLs pueden o no solicitar; controla el rastreo (no la clasificación) y puede declarar sitemaps y reglas específicas por user-agent.

Qué es robots.txt?
robots.txt es un archivo de texto plano colocado en el directorio raíz de un host (por ejemplo https://example.com/robots.txt). Su propósito es comunicar a crawlers y otros agentes web qué rutas pueden solicitar. Es parte del estándar conocido como protocolo de exclusión de robots y se interpreta por muchos motores de búsqueda grandes y crawlers de terceros.
Por qué robots.txt importa para SEO
robots.txt controla el acceso del crawler (fase de crawling). Si bloqueas recursos críticos (CSS, JS o HTML) puedes impedir que un motor de búsqueda vea una página correctamente, lo que afecta la indexación y la interpretación del contenido. Importante: bloquear via robots.txt afecta principalmente el crawling y la posibilidad de que el motor obtenga información; no es en sí mismo un factor directo que "ordene" los resultados. La indexación y el ranking dependen de muchos otros señales.
Cómo funciona robots.txt
Cuando un crawler llega a un host suele solicitar /robots.txt antes de recuperar otras páginas. El parser lee directivas agrupadas por User-agent y aplica Allow/Disallow para rutas. Además se pueden incluir referencias a sitemaps. El motor de búsqueda decide cómo aplicar las directivas; el archivo actúa como señal/consenso, no como un contrato absoluto.
Directivas básicas
Ejemplos de líneas válidas en robots.txt:
User-agent: *
Disallow: /admin/
Allow: /public/
Sitemap: https://example.com/sitemap.xml
Las directivas principales que verás son User-agent, Disallow, Allow y Sitemap. El soporte para Crawl-delay varía por crawler (Google no lo usa).
Tipos de robots.txt
No existen formalmente «tipos» distintos del archivo en sí, pero en la práctica verás varias implementaciones:
- robots.txt por host: cada subdominio debe exponer su propio /robots.txt (ej.: https://sub.example.com/robots.txt).
- robots.txt dinámico: generado por la aplicación en tiempo real (asegúrate de caché apropiado).
- robots.txt vacío o ausente: si falta, la práctica estándar es permitir el rastreo por defecto.
- robots.txt que contiene solo Sitemap: sirve para publicar la ubicación del mapa del sitio sin bloquear rutas.
Cómo empezar con robots.txt
Pasos prácticos para crear un robots.txt seguro y eficiente:
1) Coloca un archivo robots.txt en el directorio raíz del host. 2) Usa User-agent y Disallow/Allow para reglas claras. 3) Evita bloquear recursos necesarios para renderizado (CSS/JS). 4) Añade la directiva Sitemap si tienes un sitemap XML. 5) Prueba y monitoriza los accesos tras publicarlo.
Errores comunes en robots.txt
Errores frecuentes que generan problemas de indexación o renderizado:
- Bloquear CSS/JS necesarios para renderizar la página.
- Usar Disallow para proteger datos sensibles en lugar de autenticación o noindex (si bloqueas el crawling, los motores no verán meta noindex).
- Sintaxis incorrecta o ubicación distinta al directorio raíz.
- Depender de Crawl-delay para controlar Googlebot (Google no lo respeta).
- Cambios frecuentes sin pruebas: un robots.txt mal formado puede devolver 404 o 5xx y ser interpretado como "no rules" por algunos crawlers.
Comprobar robots.txt: checklist técnico
**Robots.txt accesible** — dónde verificar: navegador o curl — pasa cuando: https://tu-dominio/robots.txt devuelve 200 y Content-Type adecuado (text/plain o similar).
**Contenido legible por Googlebot** — dónde verificar: curl -A "Googlebot/2.1 (+http://www.google.com/bot.html)" https://tu-dominio/robots.txt — pasa cuando: las reglas esperadas aparecen en la salida.
**No bloquea recursos de renderizado** — dónde verificar: Chrome DevTools (Network/Render) y revisar si CSS/JS están permitidos — pasa cuando: recursos necesarios se cargan sin bloqueo.
**Sitemap declarado** — dónde verificar: robots.txt y sitemap.xml accesible — pasa cuando: la URL del sitemap es válida y responde 200.
**Comportamiento del crawler en logs** — dónde verificar: registros del servidor — pasa cuando: los user-agent legítimos acceden según las reglas, sin errores 403/404 inesperados.
Comprobaciones con comandos (ejemplos)
Inspeccionar cabeceras: curl -I https://example.com/robots.txt (devuelve solo cabeceras).
Ver contenido como Googlebot: curl -A "Googlebot/2.1 (+http://www.google.com/bot.html)" https://example.com/robots.txt (devuelve el cuerpo completo con ese user-agent).
Herramientas útiles para verificar
Usa herramientas que trabajen desde fuera de tu dominio: curl y navegador para inspección directa; Chrome DevTools para comprobar recursos bloqueados en la renderización; registros del servidor para ver peticiones reales; Bing Webmaster Tools (Site Explorer) para pruebas de rastreo desde Bing. Para páginas que controlas, usa la URL Inspection en Google Search Console para ver cómo Google ve la página (inspección de la versión renderizada).
Nota sobre indexación: si bloqueas una URL en robots.txt, el crawler puede no acceder a la página y, por tanto, no ver meta noindex; en ese caso el motor aún podría indexar la URL basándose en enlaces externos sin contenido. Para evitar la indexación efectiva de información sensible, usa autenticación o elimina el recurso del servidor.
Preguntas frecuentes
El SEO técnico y la gestión de rastreo son pasos necesarios para la visibilidad; la configuración de robots.txt es una palanca técnica que requiere pruebas y monitorización continuas. Construye autoridad con backlinks de calidad
¿Robots.txt impide que una página aparezca en resultados?
No necesariamente: robots.txt controla el crawling; la indexación puede ocurrir como “URL-only” si otros sitios enlazan la página. Para evitar indexación visible al público, usa bloqueo por autenticación o meta noindex sin bloquear el crawling (para que el crawler pueda leer la metaetiqueta).
¿Puedo usar reglas por subdirectorios? Sí, pero recuerda que robots.txt se evalúa por host; subdominios necesitan su propio archivo en su raíz.
¿El wildcards (*) y el símbolo $ funcionan? Sí, muchos motores (incluido Google) aceptan '*' para coincidencias y '$' para final de cadena; comprueba el comportamiento del crawler objetivo antes de depender solo de ellos.
¿Qué pasa si mi robots.txt devuelve 5xx o está malformado? Algunos crawlers pueden asumir "sin reglas" y comenzar a rastrear; otros pueden ser más conservadores. Evita publicar robots.txt con errores y monitoriza logs tras cambios.
Términos relacionados

Crawler: qué es y qué significa para el SEO
Un crawler es un programa automatizado que explora la web siguiendo enlaces y recuperando páginas; los motores de búsqueda (por ejemplo Googlebot Smartphone) lo usan para descubrir contenido nuevo y facilitar la indexación.

Motores de búsqueda: qué son y cómo funcionan
Un motor de búsqueda es un sistema que rastrea, indexa y recupera contenido web para responder consultas; en 2026 combinan resultados tradicionales, resúmenes generativos de IA y usan la versión móvil como base principal para indexación.

Algoritmo de búsqueda: qué es y por qué importa
Un algoritmo de búsqueda es el conjunto de procesos y modelos —incluyendo señales tradicionales y modelos generativos de IA— que los motores usan para rastrear, indexar y ordenar páginas en los resultados de búsqueda en 2026.

Clasificaciones en motores de búsqueda: explicación y verificación
Posición que ocupa una página o sitio en los resultados de búsqueda para una consulta concreta; las clasificaciones reflejan cómo los motores ordenan resultados según intención, relevancia, calidad de la página, señales técnicas y contexto como ubicación o dispositivo.

Meta tags: qué son y cómo afectan al SEO
Meta tags son fragmentos de HTML que describen una página para navegadores y motores de búsqueda: título, meta description, directrices de indexación y previsualización social. Influyen en indexación y snippets, pero no determinan por sí solos el ranking.

On-page SEO: definición y checklist técnica
On-page SEO son las prácticas que optimizan el contenido, el HTML y la experiencia de usuario de páginas individuales para mejorar su relevancia e indexabilidad en buscadores: metaetiquetas, estructura de encabezados, rendimiento y datos estructurados.
