Kuinka käyttää robots.txt-tiedostoa SEO:ssa
Opi mitä robots.txt ohjaa, miten kirjoittaa oikeat säännöt, tarkistaa toiminta curlilla ja DevToolsilla sekä välttää yleiset SEO-virheet.

Mitä tämä opas kattaa
Tässä artikkelissa selitetään, mitä robots.txt ohjaa ja mitä se ei ohjaa, näytetään oikea syntaksi ja käytännön esimerkit, annetaan komentorivintarkistukset joita voit ajaa, ja luetellaan vianmääritysvaiheet yleisimpien virheiden korjaamiseen. Saat myös varmennusvinkkejä, jotka toimivat 2026-hakuympäristöissä (mobile-first indexing on Googlen oletus heinäkuusta 2024 lähtien, ja Google poisti perinteiset välimuistissa olevat sivut vuoden 2024 alussa).
Mikä robots.txt on ja mitä se ohjaa
robots.txt on sivuston juurihakemistossa sijaitseva tavallinen tekstimuotoinen tiedosto, joka antaa käskyjä hyvin käyttäytyville verkkoroboteille. Se on osa Robots Exclusion Standardia. Käytä tiedostoa kertomaan hakuroboteille, mitä polkuja ne saavat hakea; se säätelee hakemista (=crawling), ei indeksointia tai sijoitusta.
Tärkeitä erotteluja, jotka kannattaa muistaa:
Crawling vs indexing vs ranking — robots.txt vaikuttaa hakemiseen (eli siihen, mitä agentti hakee). URL, joka on estetty hakemista, voi silti indeksoitua, jos muut sivut linkittävät siihen ja hakukone päättää indeksoida URL:n ilman sisällön hakemista.
robots.txt on suositusluonteinen — vain sopivat hakurobotit noudattavat sitä. Haitalliset botit, roskapostirobotit ja jotkin skannerit saattavat jättää sen huomiotta.
robots.txt ei korvaa pääsynvalvontaa. Käytä HTTP-autentikointia, salasanasuojaa tai palvelinpuolen kontrollia yksityisen sisällön suojaamiseen.
Missä robots.txt:n pitää sijaita ja perussäännöt
robots.txt tulee tarjota sivuston juuresta täsmälleen sillä isännällä ja protokollalla, joita säännöt koskevat. Eri sijainnit (esimerkkejä): https://example.com/robots.txt ja https://sub.example.com/robots.txt. Et voi sijoittaa robots.txt:ää alikansioon ja odottaa sen ohjaavan koko verkkotunnusta.
Tämän oppaan esimerkeissä ja käytännön takia kanoninen testipolku on http://www.yoursite.com/robots.txt.
robots.txt-syntaksi ja yleiset direktiivit
Minimaalinen robots.txt käyttää direktiivejä ryhmiteltynä user-agentin mukaan. Direktiivien nimet eivät ole kirjainkoon suhteen herkkiä. Alla olevat esimerkit käyttävät standarditunnisteita, joita useimmat suuret crawlerit tukevat:
Estä kaikki hakurobotit kansiosta:
User-agent: *
Disallow: /private/
Salli tietty tiedosto samalla kun estät koko hakemiston (käytännöllistä Googlebot-tyyppiselle jäsentämiselle):
User-agent: *
Disallow: /images/
Allow: /images/logo.png
Sitemapit voidaan ilmoittaa robots.txt:ssä ohjaamaan crawlerit kohti sinun XML sitemap:
Sitemap: http://www.yoursite.com/sitemap.xml
Mallien vastaavuus: suuret hakukoneet tukevat asteriskia (*) wildcardina ja merkin lopun dollaria ($) robots.txt-malleissa. Ei-standardi Crawl-delay-direktiivi jätetään huomiotta joissakin moottoreissa (Google ei tue Crawl-delayä).
Käytännön esimerkit
1) Salli kaikkien crawlerien hakea kaikki (oletus — turvallinen vaihtoehto):
User-agent: *
Disallow:
2) Estä yksittäinen hakurobotti (esim. estä tietty agentti kaikesta sisällöstä):
User-agent: BadBot
Disallow: /
3) Estä hakurobotteja hakemasta renderöintiin tarvittavia resursseja (yleinen virhe — katso vianmääritys):
Disallow: /static/js/
CSS/JS:n estäminen voi estää Googlea näkemästä sivuasi samalla tavalla kuin käyttäjät näkevät sen. Koska Google käyttää mobiiliversiota ensisijaisena perustana hakemiseen ja indeksointiin ja arvioi Core Web Vitals renderöidystä sivusta, älä siis estä renderöintiin tarvittavia resursseja.
Kuinka varmentaa ja vianmäärittää robots.txt
Perustarkistukset, jotka voit suorittaa sivuston ulkopuolelta:
Hae tiedoston sisältö: curl http://www.yoursite.com/robots.txt — palauttaa tiedoston sisällön, jonka crawler näkisi.
Tarkista pelkät otsikot: curl -I http://www.yoursite.com/robots.txt — tarkistaa HTTP-statuksen (200 vs 4xx/5xx) ja Content-Type. -I palauttaa vain vastauksen otsikot.
Näe miten selaimet saavat sen: avaa https://www.yoursite.com/robots.txt selaimessa ja varmista sama sisältö kuin curlilla.
Tarkista palvelinlokit todellisista hakurobotin pyynnöistä /robots.txt:ään sekä Googlebotin tai muiden agenttien yrityksistä hakea estettyjä sivuja — lokit ovat luotettavin kolmannen osapuolen signaali hakurobotin käyttäytymisestä.
Tarkistukset, jotka sinun tulisi suorittaa jos omistat sivuston:
Käytä Google Search Console’n URL Inspection -työkalua yksittäisillä sivuilla nähdäksesi, onko Google hakenut tai indeksoinut URL:ia. URL Inspection on auktoriteettityökalu omistamillesi sivustoille.
Robots.txt:ää muuttaessasi seuraa palvelinlokeja ja Search Console:n Performance-raporttia varmistamaan hakurobotin käytös tärkeillä sivuilla.
Yleiset ongelman merkit ja toimenpiteet
Estit vahingossa CSS/JS:n — oire: sivut renderöityvät eri tavalla hakurobottien näkökulmasta; Ratkaisu: poista resurssipolut Disallow-listasta, jotta crawlerit voivat hakea ne.
robots.txt palauttaa 404/5xx — oire: jotkin crawlerit saattavat käsitellä sivustoa täysin crawlattavana tai keskeyttää crawlaamisen tilapäisesti; Ratkaisu: palauta kelvollinen robots.txt, joka palauttaa 200 ja oikean Content-Typen.
Estit koko isännän tai protokollan laittamalla robots.txt väärään alidomainiin — oire: sivut poistuvat crawl-lokeista; Ratkaisu: lisää robots.txt oikeaan isäntään (ja tarkista uudelleenohjaukset).
Jos sivu on estetty hakemiselta mutta se näkyy silti hakutuloksissa ilman pätkää, se viittaa siihen, että URL on indeksoitu ulkoisten signaalien perusteella vaikka sisältöä ei haettu. Poista tällaiset URL:t hakutuloksista käyttämällä oikeaa HTTP-autentikointia, poistamalla sivu tai palvelemalla noindex-direktiiviä sivulla itsessään (noindex vaatii hakurobotin hakemaan sivun, joten älä estä sitä robots.txt:llä jos aiot käyttää noindexiä).
Tarkistuslista: ota robots.txt käyttöön ja tarkista turvallisesti
Sijoita robots.txt sivuston juureen täsmälliselle isännälle ja protokollalle.
Testaa tiedosto curlilla (sisältö ja otsikot) ja selaimessa.
Vältä estämästä CSS:ää, JavaScript, tai muita renderöinnissä käytettäviä resursseja, ellei tarkoituksellisesti halua estää renderöintiä crawlerien osalta.
Ilmoita sitemapit robots.txt:ssä, jotta crawlerit löytävät indeksoitavissa olevat URL:si.
Seuraa palvelinlokeja ja Search Consolea crawlauskäyttäytymisen varalta muutosten jälkeen.
Jos tarvitset vaiheittaisen ohjeen, lue Read the Technical SEO Guide saadaksesi laajemman näkökulman crawlabilityyn ja Core Web Vitalsiin.
Lisähuomiot vuodelle 2026
Koska Google käyttää mobiiliversiota ensisijaisena perustana hakemiseen ja indeksointiin ja koska perinteiset välimuistissa olevat sivut poistettiin vuoden 2024 alussa, robots.txt:llä tarkoituksella piilotettu sisältö voi olla vähemmän todennäköisesti esillä modernissa AI-vetoisissa yhteenvetotoiminnoissa ja Search Generative Experience -ominaisuuksissa. Jos haluat sisällön olevan käytettävissä AI-yhteenvetoihin tai rikkaisiin SERP-ominaisuuksiin, salli crawlerien hakea ja indeksoida sivu ja käytä strukturoitua dataa tarpeen mukaan.
UKK
Missä robots.txt:n tulee sijaita?
robots.txt tulee olla saatavilla juurihakemistossa täsmälliselle isännälle ja protokollalle, jota haluat hallita, esimerkiksi https://www.example.com/robots.txt. Säännöt eivät periydy yläverkkotunnuksesta aliverkkotunnuksiin.
Voiko sivun estäminen robots.txt:llä poistaa sen hakutuloksista?
Sivun estäminen hakemiselta ei aina estä URL:in näkymistä hakutuloksissa, jos muut sivut linkittävät siihen. Estääksesi indeksoinnin, salli sivun hakeminen ja palauta noindex-direktiivi tai käytä palvelinpuolen pääsynvalvontaa.
Kuinka nopeasti robots.txt-muutokset astuvat voimaan?
Hakurobotit hakevat robots.txt:iä säännöllisin väliajoin; ei ole olemassa yleistä kiinteää aikarajaa. Vahvistaaksesi muutoksen, tarkista palvelinlokeista uudet pyynnöt /robots.txt:ään ja seuraa Search Consolea sekä crawl-lokeja käytösmuutoksista.
Pitäisikö käyttää robots.txt:ää yksityisen sisällön piilottamiseen?
Ei. robots.txt on julkinen tiedosto eikä sitä tule käyttää suojaamaan arkaluonteista dataa. Käytä autentikointia, poista sisältö julkisilta poluilta tai palvele sopivat HTTP-vastaukset pääsyn estämiseksi.
Kuinka annan vain yhdelle crawlerille (esim. Googlebot) pääsyn sivustolleni?
Voit sisällyttää user-agent-ryhmän tietylle crawlerille ja rajoittavampia ryhmiä muille, esimerkiksi:
User-agent: Googlebot
Disallow:
User-agent: *
Disallow: /
Muista, että tämä perustuu user-agent-merkkijonoihin ja hyvin käyttäytyviin hakurobotteihin; se ei ole turvallinen pääsynvalvonta.
Related articles

On-page SEO - tarkistuslista sijoituksiin ja UX
Käytännöllinen on-page SEO -tarkistuslista: tekniset, sisältöön, UX:ään ja varmennukseen liittyvät toimet, jotka voit suorittaa nyt.

Käytännön SEO-vinkkejä hakusijoitusten parantamiseen
Toimeenpantavat, ajattomat SEO-strategiat: avainsanat, on-page-perusteet, tekniset korjaukset, link-building-ohjeet ja varmennusvaiheet, joita voit käyttää heti.

SEO-otsikoiden parhaat käytännöt
Miten jäsentää H1–H3-tunnisteet selkeyden, saavutettavuuden ja johdonmukaisten skannaus- ja indeksointisignaalien näkökulmasta.

Vaiheet orgaanisen liikenneputken rakentamiseen
Vaiheittainen opas toistettavan orgaanisen liikenneputken luomiseen: kohdenna sisältö hakutarkoitukseen, korjaa tekniset esteet, vahvista jakelua ja varmista indeksoitavuus.

FAQ schema: mitä sinun pitää tietää
Käytännön opas FAQ schemasta: mikä se on, miten lisäät JSON-LD:tä sivuillesi, testausvaiheet ja yleisimmät virheet, joita kannattaa välttää.

Crawling and indexing: search engine discovery guide
Konkreettiset toimet, joilla varmistat, että hakukoneet löytävät, renderöivät ja indeksoivat tärkeät sivusi oikein.

Robots.txt SEO: hallitse crawlausta tehokkaasti
Opit käyttämään robots.txt:ää ohjaamaan crawlerit turvallisesti, välttämään indeksointivirheitä, varmentamaan käyttäytymisen curlilla ja lokeilla sekä soveltamaan esimerkkejä tuotantosivustoille.

Tekninen SEO-auditointi: löydä hakua rajoittavat ongelmat
Käytännön, askel askeleelta tekninen SEO-auditointi, joka tunnistaa crawl-, render-, indeksointi- ja suoritusongelmat sekä näyttää, miten varmistat ja priorisoit korjaukset.
