Skip to content

Zo gebruik je het robots.txt-bestand voor SEO

Leer hoe je het robots.txt-bestand gebruikt voor SEO. Beheer het crawlgedrag van zoekmachines, verbeter de indexering en bescherm privépagina's met een goede robots.txt-configuratie.

How to Use Robots.txt File for SEO

Wist je dat Robots.txt een van de belangrijkste onderdelen van de SEO van je site is? Wat is Robots.txt precies en hoe kun je het voor SEO gebruiken? Dat leggen we in deze post uit.

What is Robots.txt?

In de rootdirectory van een website staan bestanden die zoekmachinecrawlers en -spiders vertellen welke pagina's en bestanden ze wel en niet mogen zien. Webbeheerders willen vaak dat zoekmachines hun site vinden, maar soms is dat niet wenselijk. Als je privégegevens bewaart of ruimte wilt besparen, kun je voorkomen dat zoekmachines je bestanden indexeren (uitgezonderd zware pagina's met afbeeldingen).

De robots exclusion standard, ook bekend als robots exclusion protocol of kortweg robots.txt, is een standaard waarmee websites communiceren met webcrawlers en andere webrobots.

Robots worden vaak door zoekmachines gebruikt om websites te categoriseren. Niet alle robots houden zich aan de standaard; e-mailharvesters, spambots, malware en robots die zoeken naar beveiligingskwetsbaarheden richten zich soms zelfs op delen van een website waarvan ze juist geweerd hadden moeten worden. De standaard kan worden gebruikt in combinatie met Sitemaps, een robot-inclusiestandaard voor websites. – Wikipedia

Zoekmachines die trefwoorden en metadata gebruiken om webpagina’s te indexeren, tonen zo de meest relevante resultaten aan mensen die iets op het internet zoeken. Voor eigenaren van webshops is het nog belangrijker om goede zoekresultaten te behalen dan voor andere bedrijven. Meestal gaan mensen niet verder dan de eerste paar pagina’s met resultaten die een zoekmachine toont.

Spiders of crawlers voeren de indexering uit: ze kruipen rond. Zo verzamelen en organiseren zoekmachinebedrijven alle informatie op internet. Deze bedrijven zetten die bots in.

How to Use Robots.txt File for SEO

robots.txt is het bestand waar crawlers als eerste naar zoeken wanneer ze een website bezoeken. Vinden ze zo'n bestand, dan lezen ze het op instructies voor het indexeren van de site. Vinden ze geen bestand of geen instructies, dan gebruiken de bots hun eigen algoritme om te bepalen wat ze moeten doorzoeken. Dat zorgt voor veel zoekacties op de site, maar maakt het indexeerproces ook minder efficiënt.

Om robots.txt te laten werken, mag er op een site maar één bestand staan. Een add-on-domein moet een robots.txt-bestand in de root van zijn webpagina hebben. Bijvoorbeeld: https://www.domain.com/robots.txt. Dit bestand moet robots instrueren om die site niet te bezoeken.

Robots.txt is ook belangrijk: zorg dat de bestandsnaam precies robots.txt is. Als de naam niet exact zo gespeld is, werkt het niet.

Get in control

You have more control over your site’s SEO than you think.

Over het algemeen klopt dat. Je kunt op paginaniveau bepalen welke crawlers en indexers je site mogen zien en indexeren. Hiervoor kun je het bestand robots.txt gebruiken om te voorkomen dat dit nogmaals gebeurt. Het eenvoudige tekstbestand robots.txt plaats je in de rootmap van je website. Dit bestand geeft webrobots instructies over welke delen van je site ze niet mogen lezen. Crawlers en indexers gebruiken die informatie om hun zoekresultaten specifieker te maken.

Het is niet het ultieme middel, maar wel een goede manier om je website vindbaar te maken voor zoekmachines. Wil je dat zoekmachines je site waarderen, dan moet je een goede eerste indruk maken. Robots.txt kan je SEO helpen als je het op de juiste manier inzet.

Hoe pak je het aan? Wat is het doel van het bestaan van deze persoon? Wat mag je absoluut nooit doen? De antwoorden op deze vragen staan op de volgende pagina.

The reason to use Robots.txt

Robots.txt is het bestand dat zoekmachines vertelt welke pagina's van je site ze wel en niet mogen indexeren. Als je in je Robots.txt-bestand aangeeft dat je bedankpagina niet toegankelijk mag zijn voor zoekmachines, verschijnt die pagina niet in de zoekresultaten en is hij ook niet bereikbaar voor mensen die er online naar zoeken. Sommige pagina's van je site moet je verbergen voor zoekmachines, zowel om privacy te beschermen als om je positie in de zoekresultaten te behouden. Dat is in beide gevallen belangrijk.

Where to locate your Robots file?

Get in control

Het robots.txt-bestand staat in de rootmap van je site. Log in op je FTP- of cPanel-account en zoek het in de public HTML-map van je account. Deze bestanden nemen nauwelijks ruimte in; vaak zijn het slechts enkele honderden bytes. Kun je er geen vinden, dan moet je er een aanmaken.

How Robots.txt Work

Als zoekmachines je site willen indexeren, sturen ze kleine programma's, 'spiders' of 'robots', die je site crawlen en gegevens terugsturen naar de zoekmachines. Robots.txt "Disallow"-instructies geven zoekmachines en andere programma's de opdracht om bepaalde pagina's op je website, die jij in het commando opgeeft, niet te bezoeken. In het robots.txt-bestand staan de volgende commando's:

will prevent all search engine robots from accessing the following page on your site: http://www.yoursite.com/thankyou

Voor de disallow-opdracht staat de opdracht User-agent: *. Het User-agent-gedeelte geeft aan welke robot je wilt uitsluiten.

De regel User-agent: Googlebot blokkeert alleen de Google-robots; andere bots en bezoekers kunnen je site nog steeds bereiken: http://www.yoursite.com/thankyou

Gebruik je het '*' teken, dan geef je aan dat de onderstaande commando's voor alle robots gelden. Het robots.txt-bestand staat in de hoofdmap van je site. Bijvoorbeeld: http://www.yoursite.com/robots.txt

How to Put Together a Robots.txt File

How to Put Together a Robots.txt File

Iedereen kan dit eenvoudige tekstbestand maken. Gebruik een teksteditor zoals Notepad. Maak een nieuw tekstbestand, sla het op als robots.txt en typ de inhoud erin. Log in op je cPanel, ga naar de public_html-map en klik erop. Begin met te controleren of het bestand er al staat.

Als alles er goed uitziet, ben je klaar. Alleen de eigenaar van het bestand mag het bekijken en wijzigen. Het bestand moet de permissie 0644 hebben om te werken.

Als dat niet zo is, klik je met de rechtermuisknop op het bestand en kies je change permissions. Klaar. Er bestaat een bestand genaamd robots.txt dat instructies voor robots bevat. Robots.txt-syntaxis: het robots.txt-bestand bevat meerdere secties met directives voor elke user agent die is ingesteld. Elke sectie begint met de naam van de user agent. Elke crawlbot wordt geïdentificeerd aan de hand van zijn user agent ID volgens de code.

Je kunt dit op twee manieren doen: als je een wildcard gebruikt, kun je je op alle zoekmachines tegelijk richten. Je kunt kiezen op welke zoekmachines je je wilt richten. Wanneer je een crawling bot start, gaat die naar de delen van de website die daar het minst blij mee zijn. Zo werkt het:

User-Agent Directive

De eerste regels van elk blok bevatten de user-agent, die aangeeft welke bot het is. Bijvoorbeeld: als je Googlebot wilt instrueren, begin je met:

User-agent: Googlebot As a rule, search engines are seeking the most relevant information.

Als je zowel een Googlebot-Video- als een Bingbot-richtlijn hebt ingesteld, volgt de 'Bingbot' user agent die instructies. Van Googlebot-Video kun je nog preciezere instructies verwachten.

Listed below are the most widely used search engine robots.

Disallow Directive

Als je deze functie inschakelt, kunnen bots geen toegang krijgen tot bepaalde delen van je website. Niets weerhoudt ze er echter van vrij over het internet te bewegen en elke website te bezoeken die ze willen.

Sitemap Directive (XML Sitemaps)

Deze meta-tag vertelt zoekmachines waar je sitemap staat. Je moet je sitemap bij Google Search Console indienen zodat zoekmachines hem kunnen vinden. Gebruik elk van deze tools; ze kunnen je veel over je website leren.

When speed is important, use the directive called “sitemap.”

Crawl-Delay Directive

Wil je Yahoo, Bing en Yandex iets afremmen tijdens het crawlen? Voeg dan de directive crawl-delay toe. Het volgende gebeurt wanneer je deze regel in je blok plaatst:

Crawl-Delay:10 Wait ten seconds before crawling.

Een zoekmachine kun je instellen om tien seconden te wachten voordat hij een site crawlt, of tien seconden te wachten voordat hij na een crawl terugkeert naar een site. Het effect is vrijwel hetzelfde, maar verschilt iets per zoekmachine. Na een crawl betekent een Crawl-delay van 1 dat zoekmachines meteen beginnen met crawlen.

Using Google Google Search Console to create Robots.txt

Selecteer crawler access in de menubalk om snel een robots.txt-bestand te maken met een gratis Google Search Console-account. Als je op de site bent, kies generate robots.txt om een basis robots.txt-bestand aan te maken.

Onder "action" kies je "block" en bij "User-agent" selecteer je welke robots je niet op je website wilt hebben. Kies "directories and files" en typ de namen van de mappen die je buiten bereik wilt houden. "http://www.yoursite.com" mag op geen enkele wijze deel uitmaken van deze strategie. Bijvoorbeeld, als je niet wilt dat mensen de onderstaande pagina’s kunnen zien, kun je:

  • http://www.yoursite.com/thank-you
  • http://www.yoursite.com/free-stuff
  • http://www.yoursite.com/private

In Google Google Search Console, enter the following into the “directories and files” field:/thank-you

  • /free-stuff
  • /private

After entering these for all robots and hitting “add a rule,” the final Robots.txt file would look like this.

After entering these for all robots and hitting “add a rule,” the final Robots.txt file would look like this.

Er is een standaard Allow-commando waarmee je een uitzondering kunt maken en een robot toegang kunt geven tot een website die je met een commando hebt geblokkeerd.

Using Google Webmaster Tools to create Robots.txt

De Googlebot kan alleen bij de photos directory van je site komen als het ban command ernaast staat. Klik daarna op download om je Robots.txt file te verkrijgen. Als je de pages and files hebt gekozen die je wilt blokkeren, klik je op download.

Install Your Robots.txt File

Je kunt nu een bestand genaamd Robots.txt toevoegen aan de main (www) directory van het CNC area van je website, zodat het gevonden kan worden. Filezilla is een goede FTP-client hiervoor. Laat een webprogrammeur je Robots.txt maken nadat je een lijst met URL's hebt aangeleverd die geblokkeerd moeten worden voor crawlers. Dit is een extra optie. In dat geval rondt een vaardige webontwikkelaar de klus af in minder dan een uur.

Noindex vs. Disallow

Veel mensen weten niet welke regel ze moeten gebruiken in het robots.txt-bestand van je website in de navigatiebalk. Dat komt omdat de redenen in de vorige sectie ervoor zorgen dat robots.txt-noindex-regels niet meer werken.

Je website kan een noindex meta-tag bevatten die je kunt gebruiken om te voorkomen dat zoekmachines een bepaalde webpagina indexeren. Deze tag laat webrobots doorgaans je pagina bezoeken, maar geeft zoekmachines tegelijk de opdracht de pagina niet te indexeren.

Op de lange termijn kan het minder effectief zijn dan de noindex-tag. De disallow-regel is vaak minder effectief dan die tag. Dat heeft echter een voordeel: robots.txt voorkomt dat zoekmachines je pagina crawlen. Het verhindert niet dat ze je pagina indexeren op basis van informatie van andere pagina’s en websites — en dat is juist goed.

Onthoud dat zelfs als je een pagina uitschakelt en er een noindex-tag aan toevoegt, robots die tag mogelijk niet opmerken en de pagina toch blijven indexeren.

Mistakes you will want to avoid

Mistakes you will want to avoid

Je hebt geleerd wat je allemaal met je robots.txt kunt doen en hoe je het gebruikt. In dit deel behandelen we elk probleem uitgebreider en laten we zien hoe verkeerd gebruik schadelijk kan zijn voor je SEO.

Je kunt een robots.txt-bestand of de "noindex"-tag niet gebruiken om te voorkomen dat mensen bij nuttige informatie komen die je juist openbaar wilt maken. In het verleden hebben we bij SEO vaak zulke situaties gezien. Al die gevallen hadden een negatief effect op de resultaten. Zorg dat al je webpagina's vóór livegang de juiste noindex- en noblock-tags en -regels hebben.

Als je crawl-delay-richtlijnen gebruikt, zet ze dan niet te vaak in. Ze beperken namelijk het aantal pagina's dat zoekmachinebots kunnen crawlen. Aan de andere kant kan een grote website het lastiger maken om hoge posities in de zoekresultaten te behalen en veel bezoekers te trekken.

Zorg dat je robots.txt-bestand het juiste formaat heeft, zodat crawlers het correct lezen. Gebruik alleen kleine letters in de bestandsnaam: robots.txt. Als dat niet het geval is, werkt het niet.

Closing – Test Your Robots.TXT

Controleer nu je bestand om te zien of het correct werkt. In de oude Google Search Console zat een robots.txt-testvak, maar die versie wordt niet meer gebruikt. De robots.txt-tester werkt sinds de meest recente GSC-update niet meer. Google werkt hard aan nieuwe functies voor GSC, dus mogelijk verschijnt de robots.txt-tester later weer in het hoofdmenu.

Wil je meer weten over wat de Robots.txt tester kan doen? Ga naar Google's helppagina. Een andere handige tool is:

Kies rechts in het keuzemenu een project, zoals de website van je bedrijf of een ander project.

Om het oude robots.txt-bestand te vervangen door het zojuist gemaakte bestand, verwijder je eerst alle inhoud uit het tekstvak. Klik vervolgens op Test om een test te starten.

The value of “Test” should be changed to “Allowed.” This will make sure that your robots.txt file is working right.

Als je robots.txt-bestand correct is, verbeter je tegelijk je SEO-prestaties en de gebruikerservaring van je bezoekers. Je houdt bovendien meer controle over wat mensen zien bij zoekopdrachten naar jouw site als robots je site vrij kunnen crawlen en indexeren.

Frequently asked questions

Gerelateerde artikelen

Robots.txt gebruiken voor betere SEO · BlogDrip