Skip to content
Search

Robots.txt SEO: styr crawlningen effektivt

Lær at bruge robots.txt til at guide crawlere sikkert, undgå indekseringsfejl, verificere opførsel med curl og logs, og anvende praktiske eksempler på produktionssites.

Robots.txt SEO: Control Crawling Efficiently

Hvad robots.txt gør — og hvad den ikke gør

Robots.txt er en almindelig tekstfil placeret i sitets rod (https://example.com/robots.txt). Dens rolle er snæver: den giver crawling-instruktioner til overholdende crawlere. Brug den til at reducere unødvendige hentninger på lavværdiområder og forbedre crawl-effektiviteten; stol ikke på den til at styre indeksering eller skjule følsomt indhold.

Kontrollerer crawling, ikke indeksering

En Disallow-direktiv forhindrer overholdende crawlere i at hente en URL-sti. Hvis en side er blokeret fra crawling, søgemaskiner kan stadig indeksere dens URL baseret på eksterne signaler (for eksempel links), men de vil ikke se sidens HTML eller meta robots-tags. For at forhindre indeksering pålideligt, tillad crawling så crawleren kan læse et meta robots noindex-tag eller bruge en X-Robots-Tag response header med noindex på ressourcen selv.

Offentlig, vejledende og ikke en sikkerhedskontrol

Robots.txt er offentligt tilgængelig og vejledende: enhver bruger kan læse den på /robots.txt, og ondsindede crawlere kan ignorere dens direktiver. List ikke hemmeligheder eller private stier i robots.txt; behandl den som et dokument til crawl-styring, ikke som en adgangskontrolmekanisme.

Kerne-syntaks og almindelige direktiver

De fleste sites bruger et begrænset sæt direktiver. Specifikationen og de praktiske udvidelser, som de største søgemaskiner bruger, understøtter grundlæggende mønstre, wildcards og sitemap-pegepunkter. Hold reglerne simple og dokumentér hensigten i kommentarer, når det er muligt.

Nøgle-direktiver (eksempler vist som bogstavelige linjer):

  • User-agent: <bot-name> — målret én crawler; brug User-agent: * for alle crawlere.
  • Disallow: /path/ — forhindrer hentning af stier under /path/.
  • Allow: /path/file.js — tillader eksplicit en sti under en ellers disallowed overordnet (understøttet af større søgemaskiner).
  • Sitemap: https://example.com/sitemap.xml — peger crawlere til din XML sitemap(er).
  • Wildcards: * (matcher enhver sekvens) og $ (slutningen af strengen) understøttes i praksis af større søgemaskiner; brug dem med omtanke for mønstre med query-parametre.
  • Ikke-standard direktiver: Crawl-delay og Host genkendes af nogle crawlere, men er ikke en del af den oprindelige standard — test adfærden for de user-agents, du går op i.

Hvordan robots.txt påvirker indeksering og rangering

Adskil crawling, indeksering og rangering: robots.txt påvirker crawlingen (om en crawler henter en URL). Inde ksering kræver, at crawleren læser sidens indhold eller en meta/X-Robots-Tag. Rangering er en efterfølgende proces, der bygger på signaler, hvoraf nogle kommer fra sidens indhold; hvis en crawler ikke kan hente en side, er disse indholdsbaserede signaler ikke tilgængelige.

Praktiske konsekvenser:

  • At blokere en side i robots.txt betyder, at søgemaskinen ikke kan hente siden for at læse meta robots noindex-tags eller strukturerede data.
  • Hvis en vigtig ressource (CSS/JS) er blokeret, mobile-first indexing og rendering kan fejle i at se siden korrekt; da Google bruger mobilversionen som sin primære basis for crawling and indexing, og da Googlebot Smartphone er standardcrawleren fra July 2024, tillad de ressourcer, der kræves for rendering på mobil.

Verifikation: hvordan du tester, hvad crawlere faktisk ser

Bekræft robots.txt’ tilgængelighed og indhold udefra, og bekræft hvordan dit site reagerer på rigtige crawler-forespørgsler. Brug serverlogs, direkte hentninger og Search Console-værktøjer for sider, du ejer.

Hurtige tjek med curl

For at hente HTTP-responsheadere for robots.txt (kun headere):

  • curl -I https://example.com/robots.txt — returnerer kun response-headere; verificér statuskode og Content-Type.

For at hente hele filen som en specifik user-agent (HTML og direktiver):

  • curl -A "Googlebot" https://example.com/robots.txt — returnerer filens indhold ved brug af den angivne user-agent-streng.

Serverlogs og evidens fra rigtige crawls

Undersøg serverlogs for forespørgsler til /robots.txt og for crawler user-agents som Googlebot eller Bingbot. Logs viser hentefrekvens, responsekoder, og om crawlere forsøgte disallowede URLs. For sider du ejer, brug Search Console’s URL Inspection for at se crawl- og indeks-signaler; for tredjepartssider giver et site: query en indikation, men det er ikke endegyldigt.

Almindelige fejl og hvordan du retter dem

Undgå disse hyppige fejl, når du håndterer robots.txt.

  • Blokering af CSS/JS, der er nødvendigt for rendering: løsninger — tillad stier til assets, som kræves af mobile rendering-pipelinen, så Googlebot Smartphone kan rendre siderne korrekt.
  • At forvente at robots.txt noindexer URLs: løsninger — fjern Disallow for siden og brug et meta robots noindex eller en X-Robots-Tag-header, så søgemaskiner kan se instruktionen.
  • At liste følsomme URLs i robots.txt: løsninger — eksponer ikke private stier i robots.txt; beskyt dem via autentificering og korrekt server-side adgangskontrol.
  • Overkomplekse wildcard-regler, der utilsigtet matcher gyldige sider: løsninger — test hvert mønster med prøve-URLs og dokumentér hensigten i kommentarer, og hold reglerne så specifikke som muligt.

Anbefalede robots.txt-strategier

Antag en konservativ, testbar tilgang: hold robots.txt minimal, peg crawlere mod sitemaps, og foretræk side-niveau meta/X-Robots-Tag-kontrol for indeks-styring.

Praktiske mønstre:

  • Standard tilladelse plus sitemap: inkluder User-agent: * og en Sitemap-direktiv, så crawlere hurtigt kan finde din struktur.
  • Disallow lavværdi-forespørgselsider eller interne søgeresultater, men undgå at blokere parameter-mønstre, der også matcher kanonisk indhold; foretræk parameterhåndtering i dit sitemap eller via canonical-tags.
  • Staging eller udvikling: bloker crawlere mens staging er offentligt tilgængelig, men fjern eller ændr blokeringen før lancering; stol ikke på robots.txt som eneste beskyttelse for pre-produktionsassets.

Eksempler du kan tilpasse

Simpelt site med sitemap

User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml

Almindeligt CMS (tillad admin-ajax)

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml

Staging-blok (offentlig server, men ikke live endnu)

User-agent: *
Disallow: /

Advarsel: staging-blokeringer skal fjernes før lancering; sikr også staging med autentificering, så søgemaskiner og tredjepart ikke ved et uheld kan indeksere den, hvis robots-filen ændres.

Vedligeholdelse af robots.txt i stor skala

For store sites, behandl robots.txt som et konfigurationsartefakt: hold den i source control, gennemgå ændringer i pull requests, og deploy sammen med sitet, så staging og produktion har korrekte, miljø-specifikke filer. Automatisér tests, der henter den deployede robots.txt og validerer regelsyntaks imod repræsentative URLs.

Hvis du driver flere subdomæner, så husk, at robots.txt er værtsspecifik: regler ved example.com/robots.txt gælder ikke for sub.example.com.

FAQ

Kan robots.txt forhindre en side i at dukke op i søgeresultater?

Ikke pålideligt. Robots.txt kan forhindre en crawler i at hente en side, men søgemaskiner kan stadig indeksere URL’en baseret på eksterne links eller andre signaler. For at forhindre indeksering, tillad crawling og brug et meta robots noindex-tag på siden eller en X-Robots-Tag: noindex response-header, så crawleren kan læse instruktionen.

Hvordan tjekker jeg, at Google overholder min robots.txt?

Udefra, hent https://example.com/robots.txt med curl for at bekræfte filen og statuskoderne, gennemse serverlogs for Googlebot-forespørgsler til filen og til sider, du forventer bliver crawlet, og brug Search Console’s URL Inspection for sider du ejer for at se crawlforsøg og indeksstatus. Et site: query kan give en offentlig indikation, men er ikke endegyldigt.

Bør jeg blokere URL-parametre i robots.txt?

Vær forsigtig. At blokere parameteriserede URLs kan spare crawl-budget, men risikerer at skjule kanoniseret eller indekseret indhold, hvis mønstrene er for brede. Foretræk canonical-tags, parameterhåndtering i sitemaps, eller server-side redirects hvor passende; test ethvert mønster grundigt før deployment.

Er Crawl-delay sikkert at stole på?

Crawl-delay er et ikke-standard direktiv, og dets understøttelse varierer mellem crawlere. For sites der har brug for kontrol af crawl-rate, foretræk server-side rate limiting, robots meta tags for udvalgte sider, eller crawler-specifikke indstillinger tilgængelige i tjenester som Bing Webmaster Tools . Test altid adfærden for de specifikke user-agents, du målretter.

Related articles