Skip to content
Zoeken

Crawlen en indexeren: gids voor zoekmachineontdekking

Leer het verschil tussen crawling, indexering en ranking, praktische verificatiestappen en veelvoorkomende fouten bij zoekmachineontdekking.

Crawlen en Indexeren: Gids voor Zoekmachine Ontdekking

Wat zijn crawling en indexering?

Crawling en indexering zijn twee afzonderlijke fasen in hoe zoekmachines het web verwerken. Crawling is de ontdekking en het ophalen van pagina's: crawlers volgen links, lezen een XML-sitemap en proberen bekende URL's opnieuw. Indexering is de evaluatie en opname van content in de zoekmachine-index — de stap waarin een zoekmachine beslist of en hoe een pagina zichtbaar kan worden in zoekresultaten.

Belangrijk om te onthouden: crawling, indexering en ranking zijn aparte processen. Een pagina kan gecrawld worden maar niet geïndexeerd; een geïndexeerde pagina kan later op basis van signalen anders worden gewogen bij het ranken.

Crawling: mechanica en bronnen voor ontdekking

Hoe crawlers pagina's vinden

Crawlers combineren meerdere signalen om URL's te ontdekken: interne links op je site, externe backlinks, XML-sitemaps, feeds en verwijzingen vanuit andere sites. Crawlers plannen fetches op basis van prioriteit en crawlbudget. Voor complexe sites bepaalt een combinatie van paginaprioriteit, servercapaciteit en veranderfrequentie hoe snel en vaak URL's worden bezocht.

Agenten, user-agents en apparaattypes

Sinds juli 2024 crawlt Google standaard met Googlebot Smartphone; Google gebruikt de mobiele versie als primaire basis voor indexering. Houd daar rekening mee bij device-specifieke content en serverconfiguraties. Test met realistische user-agents als je server gedrag per device simuleert (zonder crawlers afzonderlijk te bevoordelen).

Indexering: beslisregels en signalen

Wat bepaalt of een pagina wordt geïndexeerd?

Na het crawlen beoordeelt de zoekmachine of de inhoud waardevol en uniek genoeg is om in de index opgenomen te worden. Factoren die dit beïnvloeden zijn onder meer inhoudskwaliteit, duplicate content, canonicalisatie, toegangsbeperkingen (robots-headers, noindex) en technische indexeerbaarheid (rendering, JavaScript-fallbacks). Ook kan een pagina die niet zichtbaar is voor reguliere gebruikers of die serverfouten geeft, worden uitgesloten.

Indexeren versus ranking

Indexering gaat over opname in de zoekindex; ranking gaat over de positie in de SERP voor een query. Indexatie is een voorwaarde voor ranking, maar meer factoren bepalen uiteindelijk de volgorde in zoekresultaten (relevantie, autoriteit, pagina-ervaring, gebruikerssignalen, en sinds enkele jaren ook AI-overzichten in SERP’s).

Verifiëren: praktische checks en commando's

Snel overzicht: wanneer gebruik je welke tool

Gebruik externe checks als je pagina's op andere domeinen wilt verifiëren; gebruik Google Search Console URL Inspection voor pagina's die je zelf beheert. De volgende opsomming helpt kiezen:

• Externe verificatie (publisher-pagina's of partnerlinks): curl, browser view-source, rendered DOM in Chrome DevTools, site: operator als indicatie.
• Eigen site (definitieve status): Google Search Console URL Inspection, logbestanden en crawlanalyse.
• Structurele of rich-result checks: Rich Results Test en Schema Markup Validator.
• Server- en netwerkproblemen: curl -I voor headers, Chrome DevTools Network-tab voor fetches en tijdlijnen.

Concrete curl-commando's en wat ze doen

Controleer HTTP-headers en statuscode zonder body: gebruik curl -I https://voorbeeld.nl/pagina. Om te zien welke HTML een specifieke user-agent krijgt, doe: curl -A "Googlebot/2.1 (+http://www.google.com/bot.html)" https://voorbeeld.nl/pagina

Let op: -I retourneert alleen headers; gebruik zonder -I om de volledige HTML te zien. Gebruik user-agent testen alleen om te controleren of de server verschillend reageert per agent — vermijd oplossingen die apart gedrag voor crawlers mogelijk maken (cloaking).

Gestructureerde verificatie-checklist

Gebruik deze checklist om indexeerbaarheid praktisch te controleren:

1) HTTP-status: curl -I controle; geen 4xx/5xx bij fetches.
2) Robots-headers en meta-tags: controleer response header X-Robots-Tag en <meta name="robots"> in HTML.
3) Canonical: bekijk <link rel="canonical"> en verzeker dat deze naar de gewenste URL wijst.
4) Rendering: open de pagina in Chrome, bekijk de Elements-panel en Network-tab om te zien of content na JS-rendering verschijnt.
5) Interne links: zorg voor directe interne links vanaf relevante hoger-geplaatste pagina's.
6) XML-sitemap: bevat de URL en is opgenomen in robots.txt of aangemeld in Search Console.
7) Indexatie-status: voor eigen URLs, gebruik Google Search Console URL Inspection; voor derden, gebruik site: als indicatie en controleer zichtbare aanwezigheid in SERP's.

Veelvoorkomende problemen en hoe ze op te lossen

Onbedoelde noindex of robots-uitsluiting

Foutieve X-Robots-Tag configuraties of per ongeluk geplaatste <meta name="robots" content="noindex"> komen regelmatig voor, vooral bij staging-omgevingen of bij paginabouwers. Controleer headers met curl en controleer staging-omgevingen voordat je content live zet.

Duplicate content en foutieve canonical tags

Verkeerde canonicals (self-refererend naar een andere pagina of naar een non-canonical host) kunnen indexatie smeren. Gebruik logica: canonicals moeten naar de beste representatie van de inhoud wijzen en consistent zijn over paginavarianten (https vs http, www vs non-www, URL-parameters).

Rendering- en JavaScript-problemen

Als cruciale content alleen na client-side JavaScript verschijnt, kan dat indexatie bemoeilijken. Test rendering in Chrome DevTools (Toggle device toolbar en View source vs Elements). Wanneer je server-side rendering of prerendering gebruikt, controleer je dat de HTML die aan Googlebot Smartphone wordt geserveerd dezelfde kerncontent bevat.

Praktische workflows en voorbeelden

Twee korte workflows: één voor het vrijgeven van belangrijke landingspagina's en één voor het diagnosticeren van plotselinge indexatie-dalingen.

Vrijgave van belangrijke landingspagina's

1) Bouw en test lokaal/staging — controleer headers, canonicals en robots.
2) Publiceer en voeg de URL toe aan je XML-sitemap.
3) Dien de sitemap in via Google Search Console en monitor URL Inspection voor indexatieverzoeken.
4) Zorg voor interne links vanaf relevante bestaande pagina's en update navigatie waar nodig.
5) Controleer na publicatie serverlogs voor Googlebot-requests om te bevestigen fetches.

Diagnostiek bij plotselinge indexatieverlies

Stap 1: Gebruik Google Search Console URL Inspection (voor eigen URL's) om de laatste crawl- en indexstatus te bekijken. Stap 2: Controleer serverlogs op 4xx/5xx foutpieken. Stap 3: Controleer recente deploys op onbedoelde robots-headers of canonical-wijzigingen. Stap 4: Test rendering en controleer of content achter interactieve elementen staat. Stap 5: Als alles technisch in orde lijkt, onderzoek of er wijzigingen waren in interne linkstructuur of sitemap-inhoud.

Wil je dieper lezen over technische SEO-best practices? Lees de Technical SEO Guide voor richtlijnen over site-architectuur, sitemaps en canonicalisatie.

Veelvoorkomende misvattingen

• "site: toont definitieve indexatiestatus" — site: is een nuttig indicatie voor publieke indexatiesignalen, maar geeft geen sluitende bevestiging.
• "Nofollow-links tellen niet" — rel="nofollow" is door zoekmachines als een hint behandeld; de exacte verwerking is niet publiek.
• "Als Google crawlt, dan rank je automatisch" — crawlen en indexeren zijn voorwaardelijk; ranking hangt van veel extra signalen af.

FAQ

Waarom is mijn pagina gecrawld maar niet geïndexeerd?

Er zijn meerdere redenen: een noindex-meta of X-Robots-Tag, duplicate content met een canonische verwijzing naar een andere URL, technisch renderen dat cruciale content verbergt, of een beoordeling door de zoekmachine dat de pagina onvoldoende uniek of relevant is. Begin met header- en meta-controle (curl -I), controleer canonicals en gebruik Google Search Console URL Inspection voor jouw eigen pagina's.

Hoe kan ik controleren of Google mijn pagina als mobiel ziet?

Gebruik Google Search Console URL Inspection voor de meest specifieke informatie; die tool toont de laatste crawlagent en rendering-resultaat. Voor externe checks kun je met curl en een mobiele user-agent fetches simuleren of in Chrome DevTools de mobiele weergave testen. Houd rekening met de regel dat Google standaard met Googlebot Smartphone crawlt.

Is een pagina op een niet-geïndexeerde publisher-pagina nuttig voor backlinks?

Een backlink op een pagina die Google niet indexeert is doorgaans veel minder aantrekkelijk voor SEO, omdat de potentiële waardedoorgave en zichtbaarheid beperkt is. Als je derden controleert, gebruik dan externe methoden: bekijk de publisher-pagina in de rendered DOM, controleer of de link in de HTML aanwezig is en gebruik site: als een indicatie of Google de pagina publiekelijk kent.

Google verwijderde cached pages — hoe beïnvloedt dat mij?

Google verwijderde traditionele cached pages begin 2024; dat betekent dat je minder snel een statische snapshot van een oude versie via Search krijgt. Voor verificatie en debugging vertrouw je nu meer op Search Console, serverlogs en lokale snapshots. Zorg dat belangrijke wijzigingen gedocumenteerd en traceerbaar zijn via versiebeheer en release-notes.