Skip to content
Zoeken

Robots.txt SEO: efficiënt crawlen beheren

Leer wat robots.txt regelt, hoe je regels schrijft en test, welke fouten je moet vermijden en hoe je robots.txt gebruikt zonder onbedoeld indexatieproblemen te veroorzaken.

Robots.txt SEO: Efficiënt Crawlen Beheren

Wat robots.txt precies doet (en wat niet)

robots.txt is een eenvoudig tekstbestand op de root van een host dat aanwijzingen geeft aan crawlers over welke paden ze mogen crawlen. Belangrijke preciseringen: robots.txt regelt crawling (discovery en ophalen), niet direct indexering of ranking. Een URL die door robots.txt wordt geblokkeerd kan nog steeds in de index van een zoekmachine terechtkomen als andere sites ernaar verwijzen; zoekmachines kunnen in dat geval alleen beperkte informatie tonen. Gebruik dus robots.txt voor crawl-efficiëntie, niet als primaire methode om content uit zoekresultaten te verwijderen.

Sinds juli 2024 crawlt Google standaard als Googlebot Smartphone; dat maakt het belangrijk dat de resources (CSS/JavaScript/images) die nodig zijn voor mobiele rendering niet per ongeluk door robots.txt worden geblokkeerd. Vergeet ook niet dat Google in 2024 de traditionele cached-paginaweergave heeft verwijderd; je kunt dus niet vertrouwen op een ingebouwde cache-viewer om te controleren wat Google zag.

Basis-syntax en voorbeelden

Een robots.txt bestaat uit groepen: een user-agent regel gevolgd door Disallow/Allow-regels. Voorbeelden van veelgebruikte regels (inline):

Een algemene blokkade van admin-paden: User-agent: * Disallow: /wp-admin/ Allow: /wp-admin/admin-ajax.php Sitemap: https://example.com/sitemap.xml

Enkele notes bij syntax en gedrag:

  • User-agent: specificeert voor welke crawler de groep geldt; gebruik een specifieke naam om één crawler aan te spreken of "*" voor alle crawlers.
  • Disallow: blokkeert URL-paden. Allow: laat een specifiek pad binnen een geblokkeerde map toe (Google ondersteunt Allow expliciet).
  • Wildcards en einde-regel: veel crawlers, waaronder Google, ondersteunen "*" (wildcard) en "$" (einde van URL) in regels; test altijd je regels vóór implementatie.
  • Sitemap: een robots.txt kan een sitemap-locatie meegeven, bijvoorbeeld: Sitemap: https://example.com/sitemap.xml. Dit is aanvullend op het indienen van sitemaps in Google Search Console.

Gebruikscases en aanbevolen aanpak

Robots.txt is praktisch voor het uitsluiten van systemische, laagwaardige of duplicatieve secties die crawlers onevenredig laten besteden van crawlbudget. Gebruik het waar het efficiëntie oplevert, maar kies niet voor robots.txt wanneer je wilt dat een pagina uit de zoekresultaten verdwijnt — voor dat doel gebruik je liever een x-robots-tag of een meta robots-tag met noindex en laat de pagina crawlbaar zodat de instructie gelezen wordt.

Voorbeelden van geschikte toepassingen:

  • Staging- of testmappen die niet publiek moeten worden gecrawld (zorg dat staging op een aparte host draait zodat de hoofd-site robots.txt niet wordt beïnvloed).
  • Interne zoekresultaten, filter-combinaties of paginatie-URL's van lage waarde die crawlers onnodig laten crawlen.
  • Downloadbare assets die geen SEO-waarde hebben (maar pas op: blokkeer nooit de resources die nodig zijn voor correcte rendering op mobiel).

Veelgemaakte fouten en hoe ze te herstellen

Fouten met robots.txt leiden vaak tot onbedoelde indexatieproblemen of slechte rendering. Hieronder de meest voorkomende fouten en concrete herstelstappen.

1) Je blokkeert resources die nodig zijn voor rendering

Symptoom: pagina laadt voor mensen, maar Google kan de mobiele versie niet volledig renderen; dit kan het vermogen van Google om de pagina correct te indexeren en beoordelen (zowel inhoud als Core Web Vitals-signalen) verminderen. Herstel: verwijder de Disallow-regels die CSS/JS/image-paden blokkeren en test opnieuw met de URL Inspection-tool in Google Search Console.

2) Je gebruikt robots.txt om "noindex" te simuleren

Probleem: een meta noindex werkt alleen als de crawler de pagina kan ophalen. Als je de pagina in robots.txt blokkeert, kan de crawler de noindex-instructie niet lezen en blijft de URL mogelijk in de index. Oplossing: laat de pagina crawlbaar en voeg een meta robots:noindex toe of gebruik een x-robots-tag in de HTTP-header.

3) Robots.txt staat op de verkeerde host of heeft onjuiste statuscode

Robots.txt is per host en per protocol. Zorg dat het bestand bereikbaar is op exact de host en het protocol waarmee de site toegankelijk is (bijv. https://www.example.com/robots.txt). Als de server voor robots.txt een 5xx- of andere foutcode retourneert, behandelen crawlers dat meestal als 'geen robots-regels' of zullen proberen later opnieuw; een 404 betekent dat er geen beperkingen zijn. Controleer de HTTP-status en hostingconfiguratie.

4) Syntaxfouten of onjuist geordende user-agent groepen

Foutieve of dubbelzinnige user-agent groepen kunnen ertoe leiden dat een crawler een minder specifieke groep toepast. Test je regels met een robots-parser en in Search Console (voor sites die je beheert) en houd het bestand overzichtelijk: specifieker eerst, algemeen later.

Verifiëren en testen: concrete stappen

Volg deze checklist wanneer je robots.txt wijzigt of problemen oplost. De stappen zijn uitvoerbaar zonder aannames over externe toegang.

  1. Bekijk het bestand live: controleer https://<jouwdomein>/robots.txt in een browser of met curl: curl -I https://example.com/robots.txt om de HTTP-status en headers te zien.
  2. Controleer hoe een specifieke user-agent het bestand ziet: curl -A "Googlebot/2.1 (+http://www.google.com/bot.html)" https://example.com/robots.txt. Gebruik geen -I als je de inhoud wilt zien; -I retourneert alleen headers.
  3. Test of een URL geblokkeerd wordt: gebruik de URL Inspection-tool in Google Search Console voor pagina's die je beheert. De tool toont of Google toegang heeft en welke robots-regel eventueel blokkeert. Voor externe tools kun je robots.txt-parsers of online checkers gebruiken als indicatie.
  4. Controleer of CSS/JS/images bereikbaar zijn: curl -I https://example.com/path/to/style.css of laad de pagina in Chrome DevTools en bekijk de Network- en Console-tab om fouten door geblokkeerde resources te vinden.
  5. Bevestig crawlgedrag in serverlogs: zoek naar requests van user-agents zoals Googlebot en controleer of zij pagina's kunnen ophalen. Serverlogs geven de meest betrouwbare, historische informatie over wat daadwerkelijk is gecrawld.

Geavanceerde tips en governance

Behandel robots.txt als onderdeel van veranderingen in je site-architectuur: houd versiecontrole bij (bijv. via je code repository), review wijzigingen in pull requests en test in een staging-omgeving die op een aparte host draait. Houd een fallback-procedure klaar: als een wijziging per ongeluk te veel blokkeert, kun je snel een veilige fallback-robots.txt terugzetten.

Gebruik robots.txt voor crawl-efficiëntie, maar combineer het met andere instrumenten: sitemaps om content te communiceren, canonical-tags om duplicaten te consolideren, en meta/x-robots instructies voor indexatiecontrole. Robots.txt is een signaal voor crawlers, niet een volledige access-control-oplossing.

Veelgestelde vragen

Kan robots.txt voorkomen dat een pagina in Google verschijnt?

Niet op een betrouwbare manier. robots.txt verhindert crawling, maar zoekmachines kunnen een geblokkeerde URL toch indexeren op basis van externe links en dan beperkte informatie tonen. Gebruik een meta robots:noindex (pagina moet crawlbaar zijn) of een x-robots-tag in de HTTP-header om indexatie expliciet te voorkomen.

Hoe test ik of Google mijn robots.txt volgt?

Voor sites die je beheert: gebruik Google Search Console (URL Inspection en de robots.txt-testfunctie indien beschikbaar) en controleer serverlogs. Extern kun je met curl de robots.txt ophalen en met curl -A een specifieke user-agent simuleren. Vergeet niet dat Search Console de meest directe informatie geeft over hoe Google jouw content ziet.

Is 'Crawl-delay' een betrouwbare manier om crawlbelasting te verminderen?

Crawl-delay wordt niet uniform ondersteund door alle crawlers (Google negeert deze directive). Gebruik serverconfiguratie en rate-limiting op het serverniveau of pas je hostinstellingen aan om crawlbelasting te beheren. Voor Google kun je in Search Console indien nodig de crawl-rate instellen voor je property.

Mag ik robots.txt gebruiken om een staging-site af te schermen?

Beter niet als enige maatregel. Robots.txt op een staging-host is handig, maar zorg voor authentificatie (bijv. HTTP basic auth) of een wachtwoordlaag zodat de staging-site niet per ongeluk publiek-indexeerbaar wordt of zichtbaar is via links.

Gerelateerde artikelen