Skip to content
Buscar

Rastreo e indexación: guía práctica de descubrimiento para motores de búsqueda

Aprende cómo los motores de búsqueda descubren y almacenan páginas, cómo verificar rastreo e indexación y cómo resolver los fallos más habituales.

Rastreo e indexación: guía de descubrimiento para motores de búsqueda

Definiciones clave: rastreo vs indexación vs ranking

Antes de profundizar, distingue tres etapas separadas y frecuentemente confundidas:

• Rastreo: descubrimiento y obtención de la URL por parte del motor de búsqueda (seguir enlaces, leer sitemaps, re-visitar URLs).

• Indexación: proceso de evaluación y almacenamiento de la representación de la página en el índice del motor de búsqueda; determina si la página puede ser considerada para resultados.

• Ranking: ordenación de páginas relevadas del índice para una consulta determinada.

Cómo funciona el proceso (mecánica práctica)

Los motores de búsqueda combinan varias señales y fuentes para hallar páginas y decidir su destino. En la práctica operativo:

1) Descubrimiento: link juice interno, backlinks, archivos sitemap XML y feeds de cambios sirven para señalar URLs nuevas o actualizadas.

2) Fetching y renderizado: el crawler recupera HTML y, según sea necesario, renderiza la página para ejecutar JavaScript y ver el DOM final. Desde julio de 2024 Google usa Googlebot Smartphone por defecto; en la práctica Google utiliza la versión móvil como base principal para crawling e indexación.

3) Evaluación de indexabilidad: robots.txt, meta robots (index/noindex), cabeceras X-Robots-Tag, canónicos y señales de calidad influyen en si la página se almacena. Una página rastreada puede no ser indexada.

Fuentes y señales de descubrimiento

En orden práctico: enlaces internos bien estructurados, sitemaps XML actualizados, backlinks indexables y feeds de cambios son los métodos más fiables para que una URL sea localizada.

Renderizado y JavaScript

Si tu página depende del renderizado del navegador para mostrar enlaces o contenido importante, comprueba cómo se ve el DOM renderizado. Para Google, el crawler puede requerir una fase adicional de renderizado; por tanto, el contenido generado tardíamente puede retrasar la indexación o impedirla si el crawler no llega a ejecutarlo correctamente.

Verificación práctica: cómo comprobar rastreo e indexación

Para páginas que gestionas (autoridad del dominio)

1) Google Search Console — URL Inspection: solicita la URL, revisa el estado de indexación, la versión usada para renderizado y problemas detectados. URL Inspection es la fuente autorizada para tus propias páginas.

2) Logs del servidor: analiza user-agents, códigos de respuesta y frecuencia de regreso del crawler. Busca patrones de acceso por Googlebot Smartphone para páginas críticas.

3) Chrome DevTools / Renderizado: abre la página en modo móvil, inspecciona el DOM final y confirma que el contenido clave y los enlaces estén presentes sin interacción adicional.

Para páginas de terceros (publishers, sitios de terceros)

No tienes acceso a Search Console ajeno, así que usa comprobaciones externas:

• Ver fuente HTML / DOM renderizado: visita la página y usa “Ver código fuente” para confirmar que el enlace existe en HTML. Luego abre DevTools → Elements para confirmar que el enlace está visible en el DOM renderizado.

• curl para headers y contenido: para solo cabeceras usa: curl -I https://ejemplo.com/pagina (devuelve solo headers); para ver HTML no uses -I. Para simular un agente concreto:curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" https://ejemplo.com/pagina

• Operador site: y búsquedas dirigidas: usa consultas con site: y frases únicas como indicación pública de que la página está en el índice, pero recuerda la limitación: site: es una señal, no una confirmación absoluta.

• Herramientas externas: Rich Results Test o la Schema Markup Validator para comprobar datos estructurados; Bing Webmaster Tools Site Explorer para visibilidad en Bing.

Checklist rápido de verificación

Usa esta lista cuando una URL importante no aparece en resultados:

  • ¿Devuelve 200 OK en la petición principal? (curl -I o la pestaña Network).
  • ¿robots.txt bloquea el path? (comprobar /robots.txt).
  • ¿Meta robots o X-Robots-Tag indican noindex? (revisar cabeceras y HTML).
  • ¿La página tiene canonical correcto que apunte a otra URL?
  • ¿Está enterrada en la arquitectura del sitio con pocos enlaces internos? Mejora la interconexión desde páginas relevantes.
  • ¿El contenido requiere interacción o JavaScript que el crawler no ejecuta en la primera pasada? Prueba el DOM renderizado en DevTools.

Errores comunes y soluciones prácticas

robots.txt bloquea recursos críticos

Problema: bloquear CSS/JS puede impedir que el crawler renderice la página correctamente. Solución: permite el acceso a recursos necesarios para renderizado y prueba con herramientas de renderizado remoto.

Uso incorrecto de etiquetas canónicas

Problema: canónicos que apuntan a la página equivocada hacen que la URL no se indexe. Solución: revisa rel="canonical" en HTML y cabeceras, y valida decisiones canónicas con URL Inspection.

Contenido delgado o duplicado

Problema: muchas páginas de bajo valor consumen presupuesto de rastreo y diluyen señales. Solución: consolidar con canónicos, bloquear indexación de páginas internas inútiles y mejorar calidad de contenido en páginas que deseas indexar.

Enlaces, atributos rel y comprobaciones al evaluar páginas externas

Cuando evalúes un enlace en un sitio externo, revisa el HTML para ver si el enlace está presente y qué atributo rel usa. Recuerda que no existe rel="dofollow"; una enlace estándar sin rel es simplemente un enlace normal. Para contenido pagado usa rel="sponsored"; para contenido generado por usuarios usa rel="ugc"; para indicar que no quieres que se indexe usa rel="nofollow" (Google trata nofollow como una pista). Ejemplos:

• Enlace estándar: ejemplo

• Enlace patrocinado: ejemplo

• Enlace en UGC: ejemplo

Casos especiales y notificaciones de 2024–2026

• Google usa la versión móvil como base primaria para crawling e indexación; desde julio de 2024 Googlebot Smartphone es el crawler predeterminado para Search. Esto significa que debes asegurar paridad de contenido y metadatos entre versiones móvil y desktop.

• Google eliminó las páginas en caché tradicionales a principios de 2024; ya no debes depender de la función de página en caché como herramienta de verificación pública.

• Las funciones de respuesta asistida por IA (por ejemplo, AI Overviews en los SERP) son ahora comunes; la indexabilidad y la calidad de fragmentos estructurados influyen en la probabilidad de que tu contenido se use en resúmenes automatizados.

Resolución de problemas: flujo práctico paso a paso

Si una URL importante no se indexa, sigue este flujo:

  1. Comprueba respuesta HTTP y robots.txt (curl -I; revisar /robots.txt).
  2. Revisa meta robots y X-Robots-Tag en cabeceras HTML y HTTP.
  3. Valida la versión móvil del contenido en DevTools y con URL Inspection para tus propias páginas.
  4. Si la página depende de JavaScript, simplifica el renderizado del contenido crítico o implementa server-side rendering o pre-render para las partes esenciales.
  5. Mejora enlaces internos desde páginas con tráfico y autoridad; considera actualizar el sitemap XML y enviar cambios en Search Console.

Políticas y consideraciones sobre enlaces pagados

Si trabajas con placements pagados o guest posts: sigue las directrices de motores de búsqueda. Google indica que los enlaces creados con la intención principal de manipular rankings pueden ser tratados como link spam; para enlaces pagados usa rel="sponsored" o rel="nofollow" según proceda. La eficacia de una colocación pagada depende de la calidad editorial, la indexabilidad de la página de destino y la relevancia para tu audiencia, no solo de métricas de terceros.

Recursos y herramientas recomendadas

Google Search Console (URL Inspection), Rich Results Test, Schema Markup Validator, Chrome DevTools (Network y Elements), curl para pruebas programáticas y logs del servidor para analizar accesos de crawlers. Para Bing usa Bing Webmaster Tools Site Explorer.

Preguntas frecuentes

¿Por qué una página está rastreada pero no indexada?

Porque tras el rastreo el motor decidió que la página no cumplía criterios de indexación: puede deberse a meta robots 'noindex', cabeceras X-Robots-Tag, canonical que apunta a otra URL, contenido de baja calidad o duplicado, o decisiones algorítmicas que priorizan otras páginas.

¿Cómo sé si el problema es renderizado por JavaScript?

Comprueba el HTML sin renderizar (Ver código fuente) para ver si el contenido o los enlaces existen allí. Luego abre DevTools → Elements para ver el DOM renderizado. Si algo aparece solo tras interacción o está ausente del HTML inicial y tampoco está en el DOM final cuando el crawler simula una visita, el renderizado es el culpable.

¿Puedo usar el operador site: para confirmar indexación?

site: es útil como indicación pública de indexación, pero no es concluyente. Para tus propias URLs la herramienta definitiva es URL Inspection en Google Search Console.

¿Qué cambiar primero: mejorar contenido o arreglar estructura de enlaces?

Depende del síntoma. Si la página no se descubre, prioriza la arquitectura de enlaces y el sitemap. Si se descubre pero no se indexa, revisa meta robots, canónicos y calidad de contenido. En muchos casos ambas cosas requieren atención coordinada.

Artículos relacionados