Skip to content

Cómo Usar el Archivo Robots.txt para SEO

Aprende a usar el archivo robots.txt para SEO. Controla el rastreo de los motores de búsqueda, mejora la indexación y protege páginas privadas con una configuración adecuada de robots.txt.

How to Use Robots.txt File for SEO

¿Sabías que Robots.txt es uno de los elementos clave en el SEO de tu sitio? ¿Qué es exactamente Robots.txt y cómo lo usarás para SEO? Te lo explicaremos en esta publicación.

¿Qué es Robots.txt?

Hay archivos en el directorio raíz de un sitio web que les dicen a los motores de búsqueda crawlers y spiders qué páginas y archivos deben ver y cuáles no. Los administradores web a menudo quieren que sus sitios sean encontrados por los motores de búsqueda, pero hay momentos en que no es necesario. Si estás guardando información privada o intentando ahorrar espacio, puedes evitar que el motor de búsqueda indexe tus archivos (excluyendo páginas pesadas con imágenes).

El estándar de exclusión de robots, también conocido como protocolo de exclusión de robots o simplemente robots.txt, es un estándar utilizado por los sitios webpara comunicarse con los rastreadores web y otros robots web.

Los robots son a menudo utilizados por los motores de búsqueda para categorizar sitios web. No todos los robots cooperan con el estándar; los recolectores de correos electrónicos, los spambots, el malware y los robots que escanean en busca de vulnerabilidades de seguridad pueden incluso comenzar con las partes del sitio web donde se les ha dicho que no entren. El estándar se puede usar junto con Sitemaps, un estándar de inclusión de robots para sitios web. – Wikipedia

Los motores de búsqueda que usan keywords y metadatos para indexar páginas web muestran los resultados más relevantes a las personas que buscan algo en Internet. Es más importante para los propietarios de tiendas online obtener buenos resultados en los motores de búsqueda que para cualquier otro negocio. Por lo general, la gente no pasa de las primeras páginas de resultados de las sugerencias de un motor de búsqueda.

La indexación se realiza con la ayuda de spiders o crawlers, que se mueven. Así es como las empresas de motores de búsqueda obtienen y organizan toda la información en Internet. Estas empresas utilizan estos bots.

How to Use Robots.txt File for SEO

robots.txt es el archivo que los crawlers buscan cuando visitan un sitio web por primera vez. Tan pronto como el crawler encuentra un archivo como este, buscará en él instrucciones sobre cómo indexar el sitio. No hay instrucciones para el bot que no puede encontrarlas, por lo que utiliza el algoritmo de su funcionamiento para buscarlas. Esto hace que muchas personas busquen cosas en el sitio web, pero también hace que el proceso de indexación sea menos efectivo.

Para que el archivo robots.txt funcione, solo puede haber uno en el sitio. Un nombre de dominio adicional debe tener un archivo robots.txt en la raíz de su página web. Por ejemplo, debe estar en https://www.domain.com/robots.txt, y debe indicar a los robots que no accedan a ese sitio.

También es importante que el archivo Robots.txt se llame robots.txt. Si el nombre no está bien escrito, no funcionará.

Toma el control

Tienes más control sobre el SEO de tu sitio de lo que crees.

En general, esto es cierto. Puedes elegir qué crawlers e indexadores pueden ver e indexar tu sitio a nivel de página. Existe un archivo llamado robots.txt que se puede usar para asegurar que esto no vuelva a suceder. Hay un archivo de texto simple llamado robots.txt en el directorio raíz de tu sitio web. Este archivo les dice a los robots web que no lean tu sitio web. Los robots pueden usar esta información para mejorar sus resultados de búsqueda para ser más específicos.

Aunque no es la solución definitiva, has descubierto que es una excelente manera de lograr que tu sitio web sea visto por los motores de búsqueda. Si quieres que los motores de búsqueda valoren tu sitio, debes causar una buena primera impresión. De la manera correcta, el uso de robots.txt puede ayudar con el SEO.

Entonces, ¿cómo lo haces? ¿Cuál es el propósito de esto? ¿Qué nunca deberías hacer? Las respuestas a estas preguntas están en la siguiente página.

La razón para usar Robots.txt

Robots.txt es un archivo que los motores de búsqueda usan para determinar qué páginas de tu sitio indexar y cuáles mantener fuera de los resultados de búsqueda. Por ejemplo, si indicas en tu archivo Robots.txt que tu página de agradecimiento no debe estar disponible para los motores de búsqueda, esta página no aparecerá en los resultados de búsqueda y no será accesible para las personas que la busquen en la web. Algunas páginas de tu sitio deben estar ocultas a los motores de búsqueda tanto por privacidad como por el ranking. Esto es importante para ambos.

¿Dónde localizar tu archivo Robots?

Get in control

Si tienes un sitio web, el archivo robots.txt está en el directorio raíz de tu sitio. Accede a tu cPanel FTP y búscalo en el área pública de HTML de tu cuenta. Estos archivos no ocupan mucho espacio. Podrían ser solo unos pocos cientos de bytes. Si no encuentras uno, tendrás que crearlo.

Cómo Funciona Robots.txt

Cuando los motores de búsqueda desean indexar tu sitio, envían pequeños programas llamados “spiders” o “robots” que rastrean tu sitio y devuelven datos a los motores de búsqueda. Las directivas “Disallow” de Robots.txt instruyen a los motores de búsqueda y otros programas a no buscar ciertas páginas de tu sitio web que especificas en el comando. Los siguientes comandos se pueden encontrar en el archivo robots.txt:

impedirá que todos los robots de los motores de búsqueda accedan a la siguiente página de tu sitio: http://www.yoursite.com/thankyou

Antes del comando disallow está el comando: “User-agent: * “, La parte User-agent identifica qué robot deseas prohibir.

“User-agent: Googlebot”. Este comando solo impediría que los robots de Google accedieran al sitio web; otros aún podrían acceder a él: http://www.yoursite.com/thankyou

Sin embargo, al usar el carácter “*”, especificas que los comandos a continuación se refieren a todos los robots. Tu archivo robots.txt se ubicaría en el directorio principal de tu sitio. Por ejemplo: http://www.yoursite.com/robots.txt

Cómo Crear un Archivo Robots.txt

How to Put Together a Robots.txt File

Cualquiera puede crear este archivo de texto simple. Necesitas un editor de texto como Notepad para escribir tu texto. Abre un nuevo archivo de texto y guárdalo como “robots.txt”, luego escribe en él. Cuando estés en tu cPanel, ve a la carpeta pública de HTML y haz clic en ella. Comienza asegurándote de que el archivo ya esté allí.

Si todo se ve bien, has terminado. Solo la persona propietaria del archivo debería poder verlo y cambiarlo. Para que el archivo funcione, necesita tener el permiso “0644”.

Si no, haz clic derecho en el archivo y elige “cambiar permisos”. ¡Ahí lo tienes! Hay un archivo llamado robots.txt que contiene instrucciones para robots. Sintaxis de Robots.txt. El archivo robots.txt tiene múltiples secciones de “directivas” para cada user agent que se ha configurado. Cada una comienza con el nombre del user agent. Cada bot de rastreo se identifica por su ID de user agent según el código.

Hay dos formas de hacer esto: Siempre que uses un comodín, puedes dirigirte a todos los motores de búsqueda simultáneamente. Puedes elegir a qué motores de búsqueda quieres dirigirte. Cuando inicies un bot de rastreo, irá a las partes del sitio web que menos le gusten. Funcionará así:

Directiva User-Agent

Las primeras líneas de cada bloque incluyen el user-agent, que identifica a un bot. Así, por ejemplo: si quieres decirle a un Googlebot qué hacer, comenzarías con:

User-agent: Googlebot Como regla general, los motores de búsqueda buscan la información más relevante.

Siempre que tengas una directiva Googlebot-Video y Bingbot en su lugar. El user agent ‘Bingbot’ hará lo que se le indique. Puedes esperar instrucciones más precisas de Googlebot-Video.

A continuación se enumeran los robots de motores de búsqueda más utilizados.

Directiva Disallow

Los bots no podrán acceder a ciertas partes de tu sitio si habilitas esta función. Nada impide que los bots viajen por Internet y accedan a cualquier sitio web que deseen.

Directiva Sitemap (XML Sitemaps)

Esta meta tag les dice a los motores de búsqueda dónde está tu sitemap. Debes enviarlos a la Google Search Console de los motores de búsqueda para que sean encontrados. Sería útil que usaras cada una de estas herramientas porque podrían enseñarte mucho sobre tu sitio web.

Cuando la velocidad es importante, usa la directiva llamada “sitemap”.

Directiva Crawl-Delay

Si quieres ralentizar un poco a Yahoo, Bing y Yandex cuando rastrean, puedes incluir una directiva llamada “crawl-delay”. Lo siguiente sucederá cuando coloques esta línea en tu bloque:

Crawl-Delay:10 Espera diez segundos antes de rastrear.

Cuando se configura un motor de búsqueda, se puede establecer que espere diez segundos antes de rastrear un sitio o diez segundos antes de volver a un sitio después de un rastreo. El efecto es casi el mismo, pero ligeramente diferente según el motor de búsqueda utilizado. Después de un rastreo, un Crawl-delay de 1 significa que los motores de búsqueda comenzarán a rastrear el sitio de inmediato.

Usando Google Search Console para crear Robots.txt

Selecciona “crawler access” de la barra de menú para crear rápidamente un archivo robots.txt con una cuenta gratuita de Google Search Console. Para crear un archivo Robots.txt básico, elige “generate robots.txt” cuando llegues al sitio.

En “action”, elige “block”, y en “User-agent”, elige qué robots no quieres ver en tu sitio web. Elige “directories and files” y escribe los nombres de las carpetas que quieres mantener fuera de alcance. “http://www.yoursite.com” no debe ser parte de esta estrategia de ninguna manera, forma o fondo.” Por ejemplo, si no quieres que la gente pueda ver las páginas a continuación, puedes:

  • http://www.yoursite.com/thank-you
  • http://www.yoursite.com/free-stuff
  • http://www.yoursite.com/private

En Google Search Console, ingresa lo siguiente en el campo “directories and files”:/thank-you

  • /free-stuff
  • /private

Después de ingresar esto para todos los robots y hacer clic en “add a rule”, el archivo Robots.txt final se vería así.

Después de ingresar esto para todos los robots y hacer clic en “add a rule”, el archivo Robots.txt final se vería así.

Hay un comando “Allow” predeterminado si quieres hacer una excepción y permitir que un robot acceda a un sitio web que has bloqueado con un comando.

Using Google Webmaster Tools to create Robots.txt

El Googlebot solo puede acceder al directorio de fotos de tu sitio si el comando de prohibición se coloca junto a él. Luego, haz clic en “download” para obtener tu archivo Robots.txt. Haz clic en “download” cuando hayas elegido las páginas y archivos que deseas bloquear, haz clic en “download”.

Instala tu Archivo Robots.txt

Ahora se puede agregar un archivo llamado “Robots.txt” al directorio principal (www) del área CNC de tu sitio web. Esto significa que ahora se puede encontrar. Filezilla es un buen cliente FTP para esto. Haz que un programador web cree tu archivo robots.txt después de darles una lista de URLs que deben ser bloqueadas para el rastreo. Esta es una opción adicional. En este caso, un desarrollador web experimentado terminará el trabajo en menos de una hora.

Noindex vs. Disallow

Muchas personas no saben qué regla usar en el archivo robots.txt de tu sitio web en la barra de navegación. Esto se debe a que las razones dadas en la sección anterior hacen que las reglas de no indexación de Robots.txt ya no funcionen.

Tu sitio web puede tener una “noindex” meta tag que puedes usar para evitar que los motores de búsqueda indexen una de tus páginas web. Como regla general, esta etiqueta permitirá que los robots web visiten tu sitio, pero también les dirá a los motores de búsqueda que no indexen tu página.

Puede que no sea tan efectiva como la etiqueta noindex a largo plazo. La regla disallow puede no ser tan efectiva como esta etiqueta. Esto es bueno porque robots.txt evita que los motores de búsqueda escaneen tu página. No les impide indexar tu página basándose en información de otras páginas y sitios web, lo cual es bueno.

Es importante recordar que incluso si deshabilitas y agregas una etiqueta noindex a una página, los robots no sabrán sobre la etiqueta y pueden seguir indexando la página incluso si lo haces.

Mistakes you will want to avoid

Errores que querrás evitar

Has aprendido sobre las muchas cosas que puedes hacer con tu archivo robots.txt y cómo puedes usarlo. En esta parte, repasaremos cada problema con más detalle y mostraremos cómo, si se usa incorrectamente, podría tener un efecto negativo en el SEO.

No puedes usar un archivo robots.txt o una etiqueta “noindex” para evitar que las personas accedan a información útil que deseas hacer pública. En el pasado, hemos visto muchas cosas como esta suceder con el SEO. Todas ellas han tenido un efecto negativo en los resultados. Es importante asegurarse de que todas tus páginas web tengan etiquetas y reglas noindex y noblock antes de que se publiquen.

Si usas directivas crawl-delay, no deberías usarlas con demasiada frecuencia. Esto se debe a que limitan el número de páginas que los bots pueden examinar. Por otro lado, tener un sitio web grande puede dificultar la obtención de altos rankings y conseguir muchos visitantes.

Para asegurarte de que el archivo de tu robot se lea correctamente, debes usar el formato Robots.txt correcto para tu archivo. Todas las letras deben estar en minúscula cuando esté en el archivo del robot. Debe llamarse “robots.txt”. No puede funcionar si no lo hace.

Cierre – Prueba tu Robots.TXT

Tu archivo ahora debe ser revisado para asegurarte de que funciona correctamente. Hay un cuadro de prueba de robots.txt que puedes usar en Google Search Console, pero solo si usaste la antigua Google Search Console, que ya no se usa. El probador de robots.txt ya no funciona debido a la GSC más reciente (Google está trabajando arduamente en agregar nuevas funciones a GSC, así que quizás en el futuro podamos ver el probador de Robots.txt en la navegación principal).

Si quieres saber más sobre lo que puede hacer el probador de Robots.txt, ve a la página de ayuda de Google. Otra herramienta útil está disponible:

Elige un proyecto del menú desplegable de la derecha. Por ejemplo, puedes trabajar en el sitio web de tu empresa o en otro proyecto.

Para reemplazar el archivo robots.txt antiguo con el que acabas de crear, primero debes eliminar todo lo que hay en el cuadro. Para iniciar una prueba, haz clic en “Test”.

El valor de “Test” debe cambiarse a “Allowed”. Esto asegurará que tu archivo robots.txt esté funcionando correctamente.

Al asegurarte de que tu archivo robots.txt sea correcto, puedes mejorar el rendimiento de tu motor de búsqueda y la experiencia de usuario de tus visitantes al mismo tiempo. Es más fácil para ti controlar lo que la gente ve cuando busca cosas en tu sitio si los robots pueden pasar sus días buscándolo e indexándolo.

Preguntas frecuentes

Artículos relacionados

Cómo Usar Robots.txt para SEO · BlogDrip