Skip to content
Sök

Robots.txt SEO: kontrollera genomsökning effektivt

Praktisk guide till robots.txt: syntax, verifiering med curl och Search Console, vanliga fel och konkreta åtgärder för bättre genomsökning.

Robots.txt SEO: Kontrollera crawling effektivt

Vad robots.txt gör — och vad den inte gör

Robots.txt är en enkel textfil placerad i webbplatsens rot (https://dindoman.se/robots.txt) som ger kompatibla crawlers instruktioner om vilka sökvägar de bör eller inte bör hämta. Filens primära roll för SEO är att förbättra crawl efficiency — det vill säga att hjälpa sökmotorer spendera crawl-budget på sidor som är viktiga för indexering och sökbarhet.

Vad robots.txt gör: den kan avråda crawlers från att hämta lågvärdeområden (t.ex. interna sökresultat, stagingvägar, admin-områden) och kan peka crawlers mot din sitemap via en Sitemap‑rad. Den påverkar alltså i första hand crawling, inte direkt ranking.

Vad robots.txt inte gör: att blockera en URL i robots.txt innebär inte automatiskt att URL:en tas bort ur Googles index. En blockerad URL kan fortfarande indexeras utan att dess innehåll är tillgängligt för sökmotorer (så kallad URL-only indexering) om Google hittar externa länkar eller metadata som refererar till den. För att undvika indexering av innehåll du inte vill synas bör du istället använda autentisering eller en HTTP-header eller meta‑tagg som uttryckligen säger noindex på sidan (för egen webbplats).

Syntax och vanliga direktiv

Grundläggande rader i en robots.txt är User-agent, Disallow, Allow och Sitemap. Ett enkelt exempel:

User-agent: *
Disallow: /admin/
Allow: /public/
Sitemap: https://example.com/sitemap.xml

Notera viktiga parser-regler som påverkar hur crawlers tolkar filen:

• Google följer en längsta-match‑regel: mer specifika mönster har prioritet. • När både Allow och Disallow matchar samma sökväg vinner ofta det längsta matchande uttrycket (t.ex. en specifik Allow kan tillåta en undermapp trots en bred Disallow). • Google förstår också jokertecken som '*' och slut‑anker '$' i sina pattern-matcher.

Verifiering: hur du kontrollerar robots.txt och effekter

Snabbtitt: hämta filen och kontrollera HTTP‑status

Börja med att hämta robots.txt och kontrollera att filen returnerar 200 och faktiskt ligger i webbplatsens rot. Använd curl för headers eller innehåll:

curl -I https://example.com/robots.txt # visar responsheaders
curl https://example.com/robots.txt # hämtar filens innehåll

Använd -I för att se att filen returnerar 200 och vänta dig ingen omdirigering som skickar crawlers bort från root. Om robots.txt returnerar 404 innebär det att inga regler appliceras (crawlers agerar som om filen saknas).

Testa hur servern svarar för olika user‑agents

Vill du se hur servern svarar mot Googlebot, testa att sätta user‑agent i curl. Observera att curl inte exekverar JavaScript — det visar serverns direkta HTML/headers.

curl -A "Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)" -I https://example.com/some-page

Den här kommandokedjan visar headers som Googlebot skulle få. Använd samma teknik för att kontrollera om en sida ger 200, 403 eller en X-Robots-Tag‑header som instruerar noindex. Exekvera utan -I om du vill se HTML‑kroppen.

Kontroller för egna URL:er (autoriserad vy)

För sidor du äger är Google Search Console auktoritativ för indexstatus och för att begära återcrawling. Använd URL Inspection i Search Console för att se aktuell indexstatus och eventuella blockeringar. Om du ändrar robots.txt bör du begära att Google testar eller begär omcrawling via URL Inspection.

Kontroller för tredjepartssidor

När du kontrollerar publicister eller externa sidor (t.ex. inför en länkplacering) har du inte Search Console‑access. Använd curl för att bekräfta att sidan är åtkomlig för crawlers, använd en webbläsares View Source eller Chrome DevTools Elements för att verifiera att länkar finns i statisk HTML, och kontrollera offentliga indexationssignaler med site:‑operatorn (site:exempel.com "unik fras"). Kom ihåg att site: är indikativt — det är inte en definitiv indexeringsbekräftelse.

Felsökning: steg‑för‑steg när en sida plötsligt försvinner

1) Kontrollera robots.txt: curl https://dindoman.se/robots.txt och leta efter regler som matchar sidan (se jokertecken och längsta‑match). 2) Kontrollera HTTP‑statusen för sidan som Google ser: curl -I -A "Googlebot" https://dindoman.se/sida. 3) Se efter X-Robots-Tag i headers eller meta‑noindex i sidans HTML. 4) Kontrollera att inga viktiga resurser (CSS/JS) blockeras i robots.txt — om viktiga assetfiler blockeras kan Google inte rendera sidan korrekt. 5) För ändringar: uppdatera robots.txt, be Google om omcrawling via URL Inspection och verifiera att nya crawlförsök lyckas.

Vanliga misstag och hur du undviker dem

• Av misstag blockera hela webbplatsen (t.ex. Disallow: /) — kontrollera alltid robots.txt efter ändringar innan deployment. • Blockera CSS eller JS — det kan hindra Google från att rendera och förstå dina sidor. • Använda robots.txt för att skydda känslig information — robots.txt är publik; lägg aldrig länkar till privata filer där. Autentisering eller X‑Robots‑Tag/noindex är rätt verktyg. • Oavsiktliga sökvägsmatcher: små skillnader i snedstreck eller gemener/versaler kan göra att en regel inte täcker som avsett. • Staging‑miljöer indexeras: se till att staging sitter bakom autentisering eller en strikt blockering och dubbelkolla host och subdomän.

Best practices för robots.txt som en del av teknisk SEO

• Håll filen enkel och kommentera komplexa regler så teamet förstår avsikten. • Placera Sitemap‑raden i robots.txt för att göra sitemap‑placeringen tydlig för crawlers: Sitemap: https://example.com/sitemap.xml. • Använd robots.txt för crawl efficiency — inte som ersättning för indexeringskontroller eller canonical‑hantering. • Testa ändringar i staging och rulla ut i kontrollerade steg. • Automatisera en kontroll i din deploy‑pipeline som verifierar att robots.txt returnerar 200 och att kritiska tillgångar inte blockeras.

Ytterligare tekniska noteringar

• Placering och host: robots.txt måste ligga i den host som innehåller sidorna. Om din sida ligger på example.com ska robots.txt finnas på https://example.com/robots.txt — en robots.txt på en annan host gäller inte. • Filens publika natur: kom ihåg att alla kan läsa robots.txt; lista inte privata sökvägar där. • Renderingsbegränsningar: curl och server‑sidor visar vad servern skickar; Chrome DevTools och headless‑browsers visar hur sidan renderas med assets och JavaScript.

FAQ

Kan jag använda robots.txt för att ta bort en sida från Googles index?

Nej — robots.txt förhindrar förhoppningsvis att sidan hämtas, men det garanterar inte indexering tas bort. Om sidan redan är upptäckt kan Google indexera URL:en utan innehåll. För att aktivt begära borttagning använd autentisering, en noindex‑meta‑tagg på sidan eller en X‑Robots‑Tag HTTP‑header, och använd Search Console för att begära omcrawling om du äger domänen.

Stöder alla sökmotorer jokertecken i robots.txt?

Stöd varierar mellan sökmotorer. Google stöder '*' och slutanker '$' i sina rules. Om du vill vara säker i en multibot‑miljö, håll reglerna så explicita som möjligt och testa mot de user‑agents du vill påverka.

Hur ser jag om en extern publishers sida är blockerad för crawlers?

Använd curl för att hämta publisherens robots.txt och sidan i fråga: curl https://publishersida.se/robots.txt och curl -I -A "Googlebot" https://publishersida.se/artikel. Kontrollera om robots.txt innehåller en Disallow som matchar sökvägen, och se om sidan returnerar 200 utan X‑Robots‑Tag:noindex. För indexationsindikatorer kan du komplettera med site:‑sökningar, men kom ihåg att site: bara ger en indikation, inte definitiv bekräftelse.

Påverkar robots.txt mina Core Web Vitals eller ranking direkt?

Robots.txt påverkar inte Core Web Vitals; de är mätvärden från användarens browser. Däremot kan en felaktig robots.txt som blockerar viktiga CSS/JS‑filer förhindra korrekt rendering i sökmotorns renderer och därigenom göra att innehåll eller struktur inte bedöms korrekt vid indexering. Skillnaden mellan crawling, indexering och rankning är viktig: robots.txt styr främst crawlingen.

Relaterade artiklar