Skip to content
Etsintä

Robots.txt: mikä se on ja miten se toimii

robots.txt on juurihakemistoon sijoitettava pelkkä tekstitiedosto, joka määrittelee crawl-säännöt web-crawlereille (User-agent, Disallow, Allow, Sitemap). Se ohjaa crawlauskäyttäytymistä ja voi vaikuttaa indeksointiin epäsuorasti, mutta ei suoraan rankingiin.

Robots.txt: What It Is and How It Works

Mikä on robots.txt?

robots.txt (Robots Exclusion Protocol) on pelkkä tekstitiedosto, joka sijoitetaan isännän juureen — esim. https://example.com/robots.txt — ja joka antaa yksinkertaisia crawl-ohjeita user-agenteille (web crawlers). Se on julkinen ja koneellisesti luettava; se ei autentikoi eikä piilota sisältöä. Crawlers lukevat robots.txt:n selvittääkseen, mitä polkuja sivuston omistaja toivoo niiden välttävän tai priorisoivan.

Miksi robots.txt on tärkeä SEO:ssa

Robots.txt ohjaa crawlingia. Crawling on vaihe, jossa hakukoneet ovat vuorovaikutuksessa sivustosi kanssa; jos crawler estetään hakemasta URL:ia, se ei välttämättä näe sivun sisäisiä ohjeita (kuten meta robots) tai sivun sisältöä, jota tarvitaan indeksointiin. Tämän vuoksi robots.txt voi vaikuttaa indeksointiin epäsuorasti. Se ei suoraan määritä sijoitusta — ranking muodostuu monista signaaleista indeksoinnin jälkeen. Käytä robots.txt:ää suojataksesi palvelinresursseja, välttääksesi duplicated- tai sisäisten työkalusivujen crawlausta ja varmistaaksesi, että crawlerit pääsevät käsiksi renderöinnin kannalta tarvittaviin resursseihin.

Miten robots.txt toimii

Crawler hakee /robots.txt-tiedoston ennen kuin pyytää muita sivuja samalta isännältä ja soveltaa ensimmäistä vastaavaa User-agent-stanzaa ja sen direktiivejä. Suurimpien crawlerien tukemat yleiset direktiivit ovat User-agent, Disallow, Allow ja Sitemap. Mallintuen ja lisädirektiivien tuki vaihtelee crawlerin mukaan — Google tunnistaa malleja kuten * ja $ ja noudattaa Allow/Disallow-etuusjärjestystä dokumentaationsa mukaisesti.

Tyypilliset direktiivit ja esimerkit

Pienin robots.txt-esimerkki:

User-agent: *
Disallow: /private/
Allow: /public/
Sitemap: https://example.com/sitemap.xml

Huom: sijoita robots.txt sivuston juureen. Jos robots.txt palauttaa HTTP 404:n, suurin osa crawlereista käsittelee sen "ei rajoituksia" -tilanteena; jos sitä ei saada haettua tai se palauttaa palvelinvirheitä, crawlerien käyttäytyminen voi vaihdella — testaa ja seuraa, jotta vältät vahingossa laajan eston. Googlen erityiskäyttäytymistä ja esimerkkejä varten tutustu Googlen robots.txt-dokumentaatioon.

robots.txt:n tyypit

Erilaisia robots.txt-malleja käytetään tavoitteen mukaan. Alla yleisiä lähestymistapoja tiivistettyine etuineen ja haittoineen.

- Site-wide block (Disallow: /)
Edut: estää välittömästi crawlerien pääsyn koko isäntään.
Haitat: estää crawlerien pääsyn sisältöihin ja resursseihin; voi estää julkisten sivujen indeksoinnin.

- Path-specific rules (Disallow: /private/)
Edut: helppo sulkea pois sisäisiä tai hallintasivuja.
Haitat: robots.txt on julkinen; älä listaa arkaluonteisia polkuja, joita odotat pidettävän salassa.

- User-agent specific rules (User-agent: Googlebot)
Edut: voit räätälöidä käyttäytymistä tietyille crawlereille.
Haitat: lisää ylläpitotarvetta; jotkut crawlerit voivat jättää huomiotta ei-standardi-direktiivit.

Miten aloittaa robots.txt:n kanssa

1) Päätä, mitä pitää suojata crawlaamiselta (palvelinta kuormittavat alueet, staging-polut) ja mitä täytyy pitää saatavilla crawlereille (julkiset sivut, CSS/JS, joita tarvitaan renderöintiin).
2) Luo pelkkä tekstitiedosto nimeltä robots.txt sivuston juureen. Testaa paikallisesti ja staging-ympäristössä ennen tuotantoon vientiä.
3) Julkaise ja varmista teknisen tarkistuslistan avulla alla. Pidä tiedosto yksinkertaisena ja dokumentoi mahdolliset User-agent-kohtaiset säännöt, jotta tulevat ylläpitäjät ymmärtävät intentiot.

Yleisimmät robots.txt-virheet

• Älä luota robots.txt:ään arkaluonteisen datan piilottamiseen — robots.txt on julkinen eikä sitä tule käyttää tietoturvaratkaisuna. Käytä autentikointia tai poista resurssi.
• Estäminen CSS/JS-resursseilta, joita tarvitaan renderöintiin — tämä voi heikentää hakukoneiden kykyä ymmärtää sivun asettelua ja sisältöä.
• Estäminen sivuilta, jotka sisältävät meta noindex -ohjeen — jos Googlebot estetään hakemasta sivua, se ei näe meta noindex -direktiiviä.
• Sijoittaminen robots.txt:ää alihakemistoon (esim. /blog/robots.txt) — crawlerit etsivät vain juuritason tiedostoa.
• Syntaksivirheet ja väärät HTTP-tilakoodit — varmista, että tiedosto palautetaan asianmukaisella HTTP 200 -vastauksella.

Robots.txt-vahvistus: tekninen tarkistuslista

Käytä alla olevia tarkistuksia robots.txt:n julkaisemisen tai päivittämisen jälkeen. Kukin kohta kertoo, missä tarkistaa ja selkeän hyväksymiskriteerin.

**File reachable** — missä tarkistaa: curl -I https://example.com/robots.txt — menee läpi, kun pyyntö palauttaa HTTP 200 ja tiedosto on odotetun sisältöinen.
**Correct directives** — missä tarkistaa: curl https://example.com/robots.txt tai view-source selaimessa — menee läpi, kun User-agent/Disallow/Allow -rivit vastaavat käytäntöäsi.
**Not blocking rendering assets** — missä tarkistaa: Chrome DevTools Network and Coverage tai noutamalla crawler-simulaattorilla — menee läpi, kun renderöintiin tarvittavat CSS/JS eivät ole estettyjä.
**Google-block check (own site)** — missä tarkistaa: Google Search Console URL Inspection — menee läpi, kun Inspection näyttää URL:n olevan crawlable eikä "Blocked by robots.txt".
**External crawl check** — missä tarkistaa: käytä curl:ia tai kolmannen osapuolen crawleria pyytääksesi oletettua estettyä URL:ia ja varmista, että sivu palauttaa 200 mutta crawlerille pääsy estetään — menee läpi kun käyttäytyminen vastaa odotettua.
**Sitemap presence** — missä tarkistaa: robots.txt:n sisältö ja Google Search Console Sitemaps -raportti — menee läpi, kun sitemap-URL on listattu robots.txt:ssä tai se on lähetetty ja hyväksytty Search Consolessa.

Työkalut ja komennot robots.txt:n tarkistamiseen

curl (headers only): curl -I https://example.com/robots.txt — palauttaa HTTP-statuksen ja vastausotsikot. curl (full file): curl https://example.com/robots.txt — tulostaa tiedoston sisällön tarkastelua varten. Chrome DevTools: avaa tiedoston URL tai katso sivun verkonpyynnöt varmistaaksesi, että resurssit ovat sallittuja. Google Search Console URL Inspection: omistamallesi URL:lle työkalu raportoi, näkeekö Google sivun ja oliko se estetty robots.txt:llä. Bing Webmaster Tools Site Explorer voi näyttää, miten Bing käsitteli tiedoston varmennetuilla sivustoilla. Käytä palvelinlokeja varmistaaksesi, mitkä user-agentit pyysivät robots.txt:ää ja kuinka usein.

Tarkempia tietoja tuetuista direktiiveistä ja etusijajärjestyksestä löydät virallisesta dokumentaatiosta: https://developers.google.com/search/docs/advanced/robots/intro

Lue Technical SEO Guide

Usein kysytyt kysymykset

K: Jos estän sivun robots.txt:llä, katoako se hakutuloksista?
V: Robots.txt:llä estäminen estää crawlereita hakemasta sivua, mikä yleensä estää niiden näkemästä sivun sisäisiä signaaleja. Estetty sivu voi silti näkyä hakutuloksissa ulkoisten signaalien perusteella (pelkkä URL), mutta sillä ei ole välimuistitietuetta tai renderöityä sisältöä. Poistopyyntöihin käytä indeksoinnin poisto-työkaluja omistamillesi URL:ille; jos haluat kontrolloida indeksointia metatiedon avulla, varmista, että sivu on crawlattavissa, jotta crawlerit näkevät meta robots:noindex -direktiivin.

K: Voinko käyttää robots.txt:ää tiettyjen bottien estämiseen?
V: Voit lisätä User-agent-kohtaisia stanzaeja kohdistuaksesi tunnetuille crawlereille. Kuitenkin robots.txt on kunnioitusjärjestelmä: hyvin käyttäytyvät crawlerit noudattavat sitä, pahantahtoiset botit voivat jättää sen huomiotta. Vahvempaan suojaukseen käytä autentikointia, IP-suodatusta tai palomuuria.

K: Pitäisikö lisätä sitemap robots.txt:ään?
V: Sitemap: https://example.com/sitemap.xml lisääminen robots.txt:ään on kätevä tapa osoittaa crawlereille sitemap; lähetä myös sitemapit suoraan Google Search Consoleen hallinnoimillesi sivustoille.

K: Koskeeko robots.txt:a protokolla ja isäntäkohtaisesti?
V: Kyllä. robots.txt haetaan isäntää ja protokollaa kohden: https://example.com/robots.txt on erillinen tiedosto verrattuna http://example.com/robots.txt tai https://sub.example.com/robots.txt. Aseta tiedosto samaan schemeen ja isäntään, jota sivustosi käyttää.

K: Miten mobile-first indexing vaikuttaa robots.txt:ään?
V: Google käyttää mobiiliversiota ensisijaisena pohjana crawling and indexing. Since July 2024, Google crawls sites for Search with Googlebot Smartphone by default. Varmista, että robots.txt ei vahingossa estä mobiiliversion resursseja, jotka tarvitaan sivun oikeaan renderöintiin ja indeksointiin.

K: Mistä löydän virallista ohjeistusta?
V: Viittaa Googlen robots.txt -dokumentaatioon osoitteessa https://developers.google.com/search/docs/advanced/robots/intro ja Schema.orgin sekä W3C:n resursseihin liittyvistä crawling- ja indeksointikäytännöistä.

Rakenna auktoriteettia laadukkailla backlinks-linkeillä

Liittyvät termit