Skip to content
Zoeken

Zo gebruik je het robots.txt-bestand voor SEO

Leer hoe je robots.txt juist inzet: wat het wel en niet regelt, praktische voorbeelden, testcommando's en veelgemaakte fouten.

Hoe je Robots.txt gebruikt voor SEO

Wat je in dit artikel leert

Dit artikel legt helder uit wat robots.txt doet, waarom het belangrijk is voor crawling (niet hetzelfde als indexering of ranking), welke regels en voorbeelden je kunt gebruiken, en hoe je fouten voorkomt en test. Je krijgt concrete curl-commando's, voorbeeldregels en een checklist om te verifiëren dat je robots.txt doet wat je verwacht.

Wat is robots.txt en wat regelt het wél (en niet)?

Robots.txt is een tekstbestand dat in de root van een website moet staan (bijv. https://www.domain.com/robots.txt of http://www.yoursite.com/robots.txt). Het vertelt webcrawlers welke paden ze mogen of niet mogen ophalen. Belangrijk: robots.txt regelt crawling — het is geen directe instructie voor indexering of ranking. Als je een pagina blokkeert via robots.txt, voorkomt dat dat crawlers de HTML ophalen; daardoor ziet een zoekmachine mogelijk ook geen meta-robots-tag die op de pagina staat.

Kort gezegd: gebruik robots.txt om crawlerverkeer te sturen en onnodige fetches te vermijden (bijv. grote downloads, staging-paden). Gebruik andere mechanismen voor privacy of verwijdering van content: beveiliging met wachtwoord of de juiste HTTP-headers (zie verder).

Basis-syntaxis en veelgebruikte directieven

Een robots.txt bestaat uit regelsets per user-agent en enkele globale directieven. Hieronder staan de meest gebruikte regels, met korte uitleg.

Voorbeeldstructuur

Een eenvoudig voorbeeldbestand:

User-agent: *
Disallow: /private/
Allow: /public/info.html
Sitemap: https://www.domain.com/sitemap.xml

Belangrijke directieven kort

User-agent: specificeert voor welke crawler de regels gelden. Gebruik * voor alle crawlers. Disallow: geeft paden die een crawler niet mag ophalen. Allow: specificeert expliciet toegestane paden binnen een groter geblokkeerd pad. Sitemap: verwijst naar je sitemap (aanbevolen).

Opmerkingen:

Robots.txt bevindt zich altijd in de root van een host; een bestand op een subpad geldt niet voor de hele site.

Regels worden meestal per user-agent gelezen; de meest specifieke regel (langste pad) krijgt bij conflicten voorrang.

Crawl-delay is geen Google-standaard; Google negeert die directief, andere crawlers kunnen hem wel respecteren.

Typische use cases en wanneer je robots.txt wél of niet moet gebruiken

Wanneer robots.txt goed gebruikt is

Voorkom onnodige crawlerbelasting op dure bestanden, blokkeer technische paden (zoals staging of admin-paden) die geen waarde voor zoekmachines hebben, en verwijs in robots.txt naar je sitemap zodat crawlers die gemakkelijk vinden.

Wanneer je robots.txt niet moet gebruiken

Gebruik robots.txt niet voor privacy of om gevoelige informatie te verbergen. Omdat robots.txt openbaar is, wordt de lijst met geblokkeerde paden zichtbaar voor iedereen. Voor echte bescherming gebruik je wachtwoordbeveiliging of verwijder de content van de server.

Praktische tests en troubleshooting

Voordat je wijzigingen publiceert: test lokaal en op productie. Hieronder staan commando's en inspectiestappen die je vanaf buiten (zonder toegang tot de publisher-Search Console) kunt uitvoeren.

Robots.txt ophalen en headers controleren

Bekijk alleen de headers: gebruik het commando curl -I https://www.domain.com/robots.txt. Dat toont de HTTP-status en content-type. Als robots.txt een 4xx- of 5xx-status geeft, beschouwen sommige crawlers dat als onbeschikbaarheid en kunnen ze anders omgaan met je site.

Wil je de inhoud voor een specifieke user-agent zien (bijvoorbeeld hoe de server reageert op een bepaalde user-agent-string), gebruik dan curl -A "Googlebot" https://www.domain.com/robots.txt. -A stelt de user-agent in; let op dat je hiermee alleen de response van de server controleert, niet of Google die daadwerkelijk gebruikt.

Controleren of een specifieke URL geblokkeerd is

Je kunt de regels handmatig vergelijken: zoek in robots.txt naar de meest specifieke Disallow/Allow-regel die overeenkomt met het pad. Voor sites die je beheert kun je de robots.txt-tester in Google Search Console gebruiken. Voor sites die je niet bezit, gebruik curl om de robots.txt op te halen en controleer het pad in de inhoud.

Indexatiecontrole en het verschil met crawling

De site:-operator kan een indicatie geven of Google pagina's toont, maar is geen binair bewijs van indexatie. Voor pagina's die je bezit gebruik je URL Inspection in Google Search Console om indexatie en fetchgegevens te controleren. Houd bij externe sites rekening met de beperkingen van publieke signalen.

Veelgemaakte fouten en best practices

Fout: belangrijke resources blokkeren

Het blokkeren van CSS- of JavaScript-bestanden kan problemen veroorzaken met mobile-first indexing en Core Web Vitals, omdat Google de pagina dan mogelijk niet correct kan renderen. Zorg dat bronnen die nodig zijn om de pagina te bouwen toegankelijk zijn voor crawlers.

Fout: vertrouw op robots.txt om content te verbergen

Omdat robots.txt openbaar is, mag je het niet gebruiken om gevoelige inhoud te verbergen. Als je wilt dat een pagina niet wordt opgenomen in zoekresultaten, laat de pagina crawlen zodat de zoekmachine de meta-robots-tag of X-Robots-Tag kan lezen en de pagina kan deindexeren.

Fout: een verkeerde bestandspad- of hostconfiguratie

Robots.txt werkt per host en protocol. Een robots.txt op https://www.example.com werkt niet voor https://example.com of voor een subdomein. Controleer dat je het bestand op de juiste host en protocol publiceert.

Best practice: combineer robots.txt met sitemap en monitoring

Plaats een Sitemap-directive in je robots.txt en registreer je sitemaps in Search Console en Bing Webmaster Tools. Monitor serverlogs en Search Console-fouten om onverwachte 4xx/5xx-responses of onverwacht crawlgedrag op te sporen.

Checklist: publicatie en verificatie

Plaats robots.txt in de root: bijv. https://www.domain.com/robots.txt of http://www.yoursite.com/robots.txt.

Gebruik curl -I om de HTTP-status te controleren en curl -A "UserAgent" om te zien hoe de server op een specifieke user-agent reageert.

Controleer dat belangrijke CSS/JS niet geblokkeerd is om renderingproblemen bij mobile-first indexing te voorkomen. Sinds juli 2024 gebruikt Google Googlebot Smartphone als standaard crawler voor Search; zorg dat mobiele resources bereikbaar zijn.

Voeg je sitemap toe met een Sitemap-directive en registreer de sitemap in Search Console of Bing Webmaster Tools.

Monitor serverlogs en Search Console voor onverwacht crawlverlies of foutcodes.

Als je gevoelige bestanden wilt beschermen, overweeg X-Robots-Tag headers of echte toegangscontrole; vertrouw niet op robots.txt alleen.

Veelgestelde vragen

Blokkeert robots.txt automatisch indexatie?

Nee. Robots.txt verhindert dat crawlers de URL ophalen, maar indexatie is een afzonderlijke stap. Als een zoekmachine een URL kent via links of andere signalen kan die URL soms alsnog in de index verschijnen zonder dat de HTML is opgehaald. Voor betrouwbare deindexering gebruik je een noindex-tag op de pagina (maar dan moet de pagina wel toegankelijk zijn) of verwijder de pagina met een juiste HTTP-status of toegangscontrole.

Is het veilig om robots.txt te gebruiken om staging- of admin-paden te verbergen?

Nee. Robots.txt maakt die paden alleen zichtbaar in een openbaar bestand en is geen beveiligingsmaatregel. Gebruik wachtwoordbeveiliging of blokkeer toegang via IP/credentials voor staging en admin-interfaces.

Wat gebeurt er als robots.txt niet bereikbaar is?

Als robots.txt retourneert dat het niet beschikbaar is (4xx/5xx), kunnen crawlers verschillend reageren: sommige volgen een fallback-beleid en crawlen toch, anderen verminderen crawlactiviteit. Zorg dat je robots.txt betrouwbaar wordt geserveerd met een correcte statuscode.

Let op: Google heeft traditionele cached-paginaweergaven verwijderd in het begin van 2024; vertrouw er dus niet op dat gebruikers of crawlers een oudere cacheweergave terugvinden.

Meer weten over technische SEO? Lees de Technical SEO Guide.

Gerelateerde artikelen