Skip to content
Search

Robots.txt SEO: hallitse crawlausta tehokkaasti

Opit käyttämään robots.txt:ää ohjaamaan crawlerit turvallisesti, välttämään indeksointivirheitä, varmentamaan käyttäytymisen curlilla ja lokeilla sekä soveltamaan esimerkkejä tuotantosivustoille.

Robots.txt SEO: Control Crawling Efficiently

Mitä robots.txt tekee — ja mitä se ei tee

Robots.txt on sivuston juurihakemistoon sijoitettu tekstitiedosto (https://example.com/robots.txt). Sen tehtävä on rajattu: se antaa ohjeita crawlereille. Käytä sitä vähentämään tarpeettomia hakuja vähäarvoisilla alueilla ja parantamaan crawl-tehokkuutta; älä luota siihen indeksoinnin hallinnassa tai arkaluontoisen sisällön piilottamisessa.

Säätelee hakurobotin käyntiä, ei indeksointia

Disallow-direktiivi estää sääntöjä noudattavia hakurobotteja hakemasta URL-polkuja. Jos sivu on estetty crawlaamasta, hakukoneet voivat silti indeksoida sen URL-osoitteen ulkoisten signaalien (esim. linkkien) perusteella, vaikka ne eivät näe sivun HTML:ää tai meta robots -tageja. Estääksesi indeksoinnin luotettavasti, salli crawlaus jotta hakurobotti voi lukea meta robots noindex -tagin tai käyttää X-Robots-Tag -vastausotsikkoa, jossa on noindex resurssin kohdalla.

Julkinen, ohjeellinen eikä turvallisuusmekanismi

Robots.txt on julkisesti saatavilla ja ohjeellinen: kuka tahansa voi lukea sen /robots.txt-osoitteesta, ja haitalliset crawlerit voivat jättää direktiivit huomiotta. Älä luettele salaisuuksia tai yksityisiä polkuja robots.txt:ssä; käsittele sitä crawl-ohjausdokumenttina, ei pääsynhallintamekanismina.

Perussyntaksi ja yleiset direktiivit

Useimmat sivustot käyttävät pientä määrää direktiivejä. Määrittely ja käytännön laajennukset, joita suuret hakukoneet käyttävät, tukevat peruskuvioita, wildcardeja ja sitemap-viitteitä. Pidä säännöt yksinkertaisina ja dokumentoi tarkoitus kommentteihin kun mahdollista.

Keskeiset direktiivit (esimerkit sellaisina kuin rivillä näkyvät):

  • User-agent: <bot-name> — kohdenna yhdelle hakurobotille; käytä User-agent: * kaikille hakuroboteille.
  • Disallow: /path/ — estä polkujen hakeminen /path/-alta.
  • Allow: /path/file.js — salli nimenomaisesti polku disallown alapuolelta (tuetaan suurten hakukoneiden toimesta).
  • Sitemap: https://example.com/sitemap.xml — ohjaa crawlereita kohti sinun XML sitemap(t).
  • Wildcardit: * (vastaa mitä tahansa merkkijonoa) ja $ (merkkijonon loppu) toimivat käytännössä suurten hakukoneiden tuella; käytä niitä varoen URL-parametrien kuvioihin.
  • Ei-standardi-direktiivit: Crawl-delay ja Host tunnistetaan joillain crawlereilla mutta eivät kuulu alkuperäiseen standardiin — testaa käyttäytyminen niillä user-agenteilla, joista välität.

Miten robots.txt vaikuttaa indeksointiin ja sijoituksiin

Erottele crawling, indeksointi ja ranking: robots.txt vaikuttaa crawling-vaiheeseen (pitäisikö hakurobotin hakea URL). Indeksointi edellyttää, että hakurobotti lukee sivun sisällön tai meta/X-Robots-Tagin. Ranking on myöhempi prosessi, joka perustuu signaaleihin, joista osa tulee sivun sisällöstä; jos hakurobotti ei pysty hakemaan sivua, sisällöstä peräisin olevat signaalit eivät ole käytettävissä.

Käytännön seuraukset:

  • Sivun estäminen robots.txt:ssä tarkoittaa, että hakukone ei voi hakea sivua lukeakseen meta robots noindex -tageja tai strukturoitua dataa.
  • Jos tärkeä resurssi (CSS/JS) on estetty, mobile-first indexing ja renderointi ei välttämättä näe sivua oikein; koska Google käyttää mobiiliversiota ensisijaisena pohjana crawling and indexing, and since Googlebot Smartphone is the default crawler as of July 2024, allow resources required for rendering on mobile.

Varmennus: miten testata, mitä hakurobotit todellisuudessa näkevät

Tarkista robots.txt:n saavutettavuus ja sisältö ulkoa käsin ja varmista, miten sivustosi vastaa todellisiin hakurobottipyyntöihin. Käytä palvelinlokeja, suoria hakupyyntöjä ja Search Console -työkaluja hallitsemillesi sivuille.

Nopeat tarkistukset curlilla

HTTP-vastausotsikoiden hakeminen robots.txt:stä (vain otsikot):

  • curl -I https://example.com/robots.txt — palauttaa vain vastausotsikot; tarkista statuskoodi ja Content-Type.

Täyden tiedoston hakeminen tietyn user-agentin nimissä (HTML ja direktiivit):

  • curl -A "Googlebot" https://example.com/robots.txt — palauttaa tiedoston sisällön käyttäen annettua user-agent-merkkijonoa.

Palvelinlokit ja todellinen crawlausnäyttö

Tarkastele palvelinlokeja pyyntöjen osalta /robots.txt:ään ja crawler user-agenteille kuten Googlebot tai Bingbot. Lokit näyttävät hakutiheyden, vastauskoodit ja yrittivätkö crawlerit estettyjä URL-osoitteita. Omille sivuille käytä Search Console’n URL Inspectionia nähdäksesi crawl- ja indeksointisignaalit; kolmansien osapuolten sivuilla site:-haku antaa osviittaa mutta ei ole lopullinen.

Yleiset virheet ja miten korjata ne

Vältä näitä yleisiä virheitä robots.txt:ää hallinnoidessasi.

  • CSS/JS:n estäminen, joka tarvitaan renderointiin: korjaus — salli polut mobiilirenderointiputkessa tarvittaville resursseille, jotta Googlebot Smartphone voi renderoida sivut oikein.
  • Oletus, että robots.txt noindexoi URL-osoitteet: korjaus — poista sivun Disallow ja käytä meta robots noindex -tagia tai X-Robots-Tag -otsikkoa, jotta hakukoneet näkevät ohjeen.
  • Arkaluonteisten URL-osoitteiden listaaminen robots.txt:ssä: korjaus — älä paljasta yksityisiä polkuja robots.txt:ssä; suojaa ne autentikoinnilla ja asianmukaisilla palvelinpuolen pääsynhallinnoilla.
  • Liian monimutkaiset wildcard-säännöt, jotka vahingossa osuvat kelvollisiin sivuihin: korjaus — testaa jokainen kuvio esimerkkien URL:illa ja dokumentoi tarkoitus kommenteissa, pitäen säännöt mahdollisimman täsmällisinä.

Suositellut robots.txt-strategiat

Ota konservatiivinen, testattava lähestymistapa: pidä robots.txt minimalistisena, ohjaa crawlerit sitemappeihin ja suosii sivutason meta/X-Robots-Tag -kontrolleja indeksoinnin hallintaan.

Käytännön mallit:

  • Oletussallinta ja sitemap: sisällytä User-agent: * ja Sitemap-direktiivi, jotta crawlerit voivat löytää rakenteesi nopeasti.
  • Estä vähäarvoiset hakusivut tai sisäiset hakutulokset, mutta vältä estämästä parametrikuvioita, jotka osuvat myös kanoniseen sisältöön; suosi parametrien käsittelyä sitemapissa tai kanonisten tagien avulla.
  • Staging tai kehitys: estä crawlerit kun staging on julkinen, mutta poista tai muuta esto ennen julkaisua; älä luota robots.txt:ään ainoana suojana esituotantoresursseille.

Esimerkkejä, joita voit mukauttaa

Yksinkertainen sivusto sitemapilla

User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml

Yleinen CMS (salli admin-ajax)

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml

Staging-esto (julkinen palvelin mutta ei vielä tuotannossa)

User-agent: *
Disallow: /

Varoitus: staging-estot on poistettava ennen julkaisua; varmista myös staging autentikoinnilla, jotta hakukoneet ja kolmannet osapuolet eivät vahingossa indeksoi sitä, jos robots-tiedosto muuttuu.

Robots.txt:n ylläpito laajassa mittakaavassa

Suurella sivustolla käsittele robots.txt konfiguraatiotiedostona: pidä se versionhallinnassa, tarkista muutokset pull requesteissa ja ota se käyttöön sivuston kanssa, jotta staging ja tuotanto saavat oikeat ympäristökohtaiset tiedostot. Automatisoi testit, jotka hakevat julkaistun robots.txt:n ja validoivat sääntöjen syntaksin edustavilla URL-osoitteilla.

Jos ylläpidät useita alidomaineja, muista että robots.txt on host-spesifinen: säännöt osoitteessa example.com/robots.txt eivät koske sub.example.com:ia.

UKK

Voiko robots.txt estää sivun näkymisen hakutuloksissa?

Ei luotettavasti. Robots.txt voi estää hakurobotin hakemasta sivua, mutta hakukoneet voivat silti indeksoida URL-osoitteen ulkoisten linkkien tai muiden signaalien perusteella. Estääksesi indeksoinnin, salli crawlaus ja käytä meta robots noindex -tagia sivulla tai X-Robots-Tag: noindex -vastausotsikkoa, jotta hakurobotti voi lukea ohjeen.

Miten tarkistan, noudattaako Google robots.txt:ääni?

Ulkopuolelta, hae https://example.com/robots.txt curlilla vahvistaaksesi tiedoston ja vastauskoodit, tarkastele palvelinlokeja Googlebotin pyynnöistä tiedostoon ja sivuihin, joiden odotat crawlaavan, ja käytä Search Console’n URL Inspectionia omien sivujesi crawl-yritysten ja indeksoinnin tilan näkemiseen. site:-haku antaa julkisen indikaation mutta ei ole lopullinen.

Pitäisikö minun estää URL-parametreja robots.txt:ssä?

Ole varovainen. Parametrisoitujen URL:ien estäminen voi säästää crawl-budgetia mutta riskeeraa kanonisoidun tai indeksoidun sisällön piilottamisen, jos kuviot ovat liian laajat. Suosi canonical-tageja, parametrien käsittelyä sitemapissa tai palvelinpuolen uudelleenohjauksia tarpeen mukaan; testaa kaikki kuviot huolellisesti ennen käyttöönottoa.

Voinko luottaa Crawl-delay:iin?

Crawl-delay on ei-standardi-direktiivi ja sen tuki vaihtelee crawlerin mukaan. Sivustoilla, jotka tarvitsevat crawl-nopeuden hallintaa, suositaan palvelinpuolen rate limitingia, robots meta-tageja valikoiville sivuille, tai crawler-kohtaisia asetuksia palveluissa kuten Bing Webmaster Tools. Testaa aina käyttäytyminen niillä user-agenteilla, joita kohdennat.

Related articles