Skip to content
Search

Kuinka käyttää robots.txt-tiedostoa SEO:ssa

Opi mitä robots.txt ohjaa, miten kirjoittaa oikeat säännöt, tarkistaa toiminta curlilla ja DevToolsilla sekä välttää yleiset SEO-virheet.

How to Use Robots.txt File for SEO

Mitä tämä opas kattaa

Tässä artikkelissa selitetään, mitä robots.txt ohjaa ja mitä se ei ohjaa, näytetään oikea syntaksi ja käytännön esimerkit, annetaan komentorivintarkistukset joita voit ajaa, ja luetellaan vianmääritysvaiheet yleisimpien virheiden korjaamiseen. Saat myös varmennusvinkkejä, jotka toimivat 2026-hakuympäristöissä (mobile-first indexing on Googlen oletus heinäkuusta 2024 lähtien, ja Google poisti perinteiset välimuistissa olevat sivut vuoden 2024 alussa).

Mikä robots.txt on ja mitä se ohjaa

robots.txt on sivuston juurihakemistossa sijaitseva tavallinen tekstimuotoinen tiedosto, joka antaa käskyjä hyvin käyttäytyville verkkoroboteille. Se on osa Robots Exclusion Standardia. Käytä tiedostoa kertomaan hakuroboteille, mitä polkuja ne saavat hakea; se säätelee hakemista (=crawling), ei indeksointia tai sijoitusta.

Tärkeitä erotteluja, jotka kannattaa muistaa:

Crawling vs indexing vs ranking — robots.txt vaikuttaa hakemiseen (eli siihen, mitä agentti hakee). URL, joka on estetty hakemista, voi silti indeksoitua, jos muut sivut linkittävät siihen ja hakukone päättää indeksoida URL:n ilman sisällön hakemista.

robots.txt on suositusluonteinen — vain sopivat hakurobotit noudattavat sitä. Haitalliset botit, roskapostirobotit ja jotkin skannerit saattavat jättää sen huomiotta.

robots.txt ei korvaa pääsynvalvontaa. Käytä HTTP-autentikointia, salasanasuojaa tai palvelinpuolen kontrollia yksityisen sisällön suojaamiseen.

Missä robots.txt:n pitää sijaita ja perussäännöt

robots.txt tulee tarjota sivuston juuresta täsmälleen sillä isännällä ja protokollalla, joita säännöt koskevat. Eri sijainnit (esimerkkejä): https://example.com/robots.txt ja https://sub.example.com/robots.txt. Et voi sijoittaa robots.txt:ää alikansioon ja odottaa sen ohjaavan koko verkkotunnusta.

Tämän oppaan esimerkeissä ja käytännön takia kanoninen testipolku on http://www.yoursite.com/robots.txt.

robots.txt-syntaksi ja yleiset direktiivit

Minimaalinen robots.txt käyttää direktiivejä ryhmiteltynä user-agentin mukaan. Direktiivien nimet eivät ole kirjainkoon suhteen herkkiä. Alla olevat esimerkit käyttävät standarditunnisteita, joita useimmat suuret crawlerit tukevat:

Estä kaikki hakurobotit kansiosta:

User-agent: *

Disallow: /private/

Salli tietty tiedosto samalla kun estät koko hakemiston (käytännöllistä Googlebot-tyyppiselle jäsentämiselle):

User-agent: *

Disallow: /images/

Allow: /images/logo.png

Sitemapit voidaan ilmoittaa robots.txt:ssä ohjaamaan crawlerit kohti sinun XML sitemap:

Sitemap: http://www.yoursite.com/sitemap.xml

Mallien vastaavuus: suuret hakukoneet tukevat asteriskia (*) wildcardina ja merkin lopun dollaria ($) robots.txt-malleissa. Ei-standardi Crawl-delay-direktiivi jätetään huomiotta joissakin moottoreissa (Google ei tue Crawl-delayä).

Käytännön esimerkit

1) Salli kaikkien crawlerien hakea kaikki (oletus — turvallinen vaihtoehto):

User-agent: *

Disallow:

2) Estä yksittäinen hakurobotti (esim. estä tietty agentti kaikesta sisällöstä):

User-agent: BadBot

Disallow: /

3) Estä hakurobotteja hakemasta renderöintiin tarvittavia resursseja (yleinen virhe — katso vianmääritys):

Disallow: /static/js/

CSS/JS:n estäminen voi estää Googlea näkemästä sivuasi samalla tavalla kuin käyttäjät näkevät sen. Koska Google käyttää mobiiliversiota ensisijaisena perustana hakemiseen ja indeksointiin ja arvioi Core Web Vitals renderöidystä sivusta, älä siis estä renderöintiin tarvittavia resursseja.

Kuinka varmentaa ja vianmäärittää robots.txt

Perustarkistukset, jotka voit suorittaa sivuston ulkopuolelta:

Hae tiedoston sisältö: curl http://www.yoursite.com/robots.txt — palauttaa tiedoston sisällön, jonka crawler näkisi.

Tarkista pelkät otsikot: curl -I http://www.yoursite.com/robots.txt — tarkistaa HTTP-statuksen (200 vs 4xx/5xx) ja Content-Type. -I palauttaa vain vastauksen otsikot.

Näe miten selaimet saavat sen: avaa https://www.yoursite.com/robots.txt selaimessa ja varmista sama sisältö kuin curlilla.

Tarkista palvelinlokit todellisista hakurobotin pyynnöistä /robots.txt:ään sekä Googlebotin tai muiden agenttien yrityksistä hakea estettyjä sivuja — lokit ovat luotettavin kolmannen osapuolen signaali hakurobotin käyttäytymisestä.

Tarkistukset, jotka sinun tulisi suorittaa jos omistat sivuston:

Käytä Google Search Console’n URL Inspection -työkalua yksittäisillä sivuilla nähdäksesi, onko Google hakenut tai indeksoinut URL:ia. URL Inspection on auktoriteettityökalu omistamillesi sivustoille.

Robots.txt:ää muuttaessasi seuraa palvelinlokeja ja Search Console:n Performance-raporttia varmistamaan hakurobotin käytös tärkeillä sivuilla.

Yleiset ongelman merkit ja toimenpiteet

Estit vahingossa CSS/JS:n — oire: sivut renderöityvät eri tavalla hakurobottien näkökulmasta; Ratkaisu: poista resurssipolut Disallow-listasta, jotta crawlerit voivat hakea ne.

robots.txt palauttaa 404/5xx — oire: jotkin crawlerit saattavat käsitellä sivustoa täysin crawlattavana tai keskeyttää crawlaamisen tilapäisesti; Ratkaisu: palauta kelvollinen robots.txt, joka palauttaa 200 ja oikean Content-Typen.

Estit koko isännän tai protokollan laittamalla robots.txt väärään alidomainiin — oire: sivut poistuvat crawl-lokeista; Ratkaisu: lisää robots.txt oikeaan isäntään (ja tarkista uudelleenohjaukset).

Jos sivu on estetty hakemiselta mutta se näkyy silti hakutuloksissa ilman pätkää, se viittaa siihen, että URL on indeksoitu ulkoisten signaalien perusteella vaikka sisältöä ei haettu. Poista tällaiset URL:t hakutuloksista käyttämällä oikeaa HTTP-autentikointia, poistamalla sivu tai palvelemalla noindex-direktiiviä sivulla itsessään (noindex vaatii hakurobotin hakemaan sivun, joten älä estä sitä robots.txt:llä jos aiot käyttää noindexiä).

Tarkistuslista: ota robots.txt käyttöön ja tarkista turvallisesti

Sijoita robots.txt sivuston juureen täsmälliselle isännälle ja protokollalle.

Testaa tiedosto curlilla (sisältö ja otsikot) ja selaimessa.

Vältä estämästä CSS:ää, JavaScript, tai muita renderöinnissä käytettäviä resursseja, ellei tarkoituksellisesti halua estää renderöintiä crawlerien osalta.

Ilmoita sitemapit robots.txt:ssä, jotta crawlerit löytävät indeksoitavissa olevat URL:si.

Seuraa palvelinlokeja ja Search Consolea crawlauskäyttäytymisen varalta muutosten jälkeen.

Jos tarvitset vaiheittaisen ohjeen, lue Read the Technical SEO Guide saadaksesi laajemman näkökulman crawlabilityyn ja Core Web Vitalsiin.

Lisähuomiot vuodelle 2026

Koska Google käyttää mobiiliversiota ensisijaisena perustana hakemiseen ja indeksointiin ja koska perinteiset välimuistissa olevat sivut poistettiin vuoden 2024 alussa, robots.txt:llä tarkoituksella piilotettu sisältö voi olla vähemmän todennäköisesti esillä modernissa AI-vetoisissa yhteenvetotoiminnoissa ja Search Generative Experience -ominaisuuksissa. Jos haluat sisällön olevan käytettävissä AI-yhteenvetoihin tai rikkaisiin SERP-ominaisuuksiin, salli crawlerien hakea ja indeksoida sivu ja käytä strukturoitua dataa tarpeen mukaan.

UKK

Missä robots.txt:n tulee sijaita?

robots.txt tulee olla saatavilla juurihakemistossa täsmälliselle isännälle ja protokollalle, jota haluat hallita, esimerkiksi https://www.example.com/robots.txt. Säännöt eivät periydy yläverkkotunnuksesta aliverkkotunnuksiin.

Voiko sivun estäminen robots.txt:llä poistaa sen hakutuloksista?

Sivun estäminen hakemiselta ei aina estä URL:in näkymistä hakutuloksissa, jos muut sivut linkittävät siihen. Estääksesi indeksoinnin, salli sivun hakeminen ja palauta noindex-direktiivi tai käytä palvelinpuolen pääsynvalvontaa.

Kuinka nopeasti robots.txt-muutokset astuvat voimaan?

Hakurobotit hakevat robots.txt:iä säännöllisin väliajoin; ei ole olemassa yleistä kiinteää aikarajaa. Vahvistaaksesi muutoksen, tarkista palvelinlokeista uudet pyynnöt /robots.txt:ään ja seuraa Search Consolea sekä crawl-lokeja käytösmuutoksista.

Pitäisikö käyttää robots.txt:ää yksityisen sisällön piilottamiseen?

Ei. robots.txt on julkinen tiedosto eikä sitä tule käyttää suojaamaan arkaluonteista dataa. Käytä autentikointia, poista sisältö julkisilta poluilta tai palvele sopivat HTTP-vastaukset pääsyn estämiseksi.

Kuinka annan vain yhdelle crawlerille (esim. Googlebot) pääsyn sivustolleni?

Voit sisällyttää user-agent-ryhmän tietylle crawlerille ja rajoittavampia ryhmiä muille, esimerkiksi:

User-agent: Googlebot

Disallow:

User-agent: *

Disallow: /

Muista, että tämä perustuu user-agent-merkkijonoihin ja hyvin käyttäytyviin hakurobotteihin; se ei ole turvallinen pääsynvalvonta.

Related articles