Skip to content
Search

Crawling and indexing: search engine discovery guide

Konkreettiset toimet, joilla varmistat, että hakukoneet löytävät, renderöivät ja indeksoivat tärkeät sivusi oikein.

Crawling and Indexing: Search Engine Discovery Guide

Keskeiset määritelmät: crawling, indexing, ranking

Käsittele crawling ja indexing kahtena eri vaiheena. Crawling tarkoittaa löytymistä ja hakemista: a hakurobotti käy läpi URL-osoitteita, hakee palvelimen vastauksen ja rekisteröi renderöintiin vaikuttavat resurssit. Indexing on arviointi- ja tallennusvaihe: kun sivu on haettu ja (yleensä) renderöity, hakukone päättää, tallennetaanko sivu indeksiin ja tehdäänkö siitä hakutuloksissa näkyvä. Ranking on erillinen vaihe, jossa indeksoitu sisältö järjestetään hakukyselyille. Ongelmat crawling- tai indexing-vaiheessa estävät sivua koskaan pääsemästä ranking-kilpailuun.

Miten crawling toimii käytännössä

Kun hakurobotti pyytää URL:ia, se tarkistaa HTTP-tilakoodit, uudelleenohjaukset, vastausotsikot ja palvelimen palauttaman HTML/CSS/JS:n. Hakurobotti löytää linkkejä (HTML-ankkureita, sitemap-merkintöjä, hreflang-linkkejä), upotettuja resursseja ja skriptejä, jotka voivat tuottaa lisä-URL:eja haettavaksi. Tärkeitä operatiivisia huomioita:

• Hakurobotit seuraavat sisäisiä linkkejä ja ulkoisia backlinks-signaaleja.

robots.txt tarkistetaan ennen sivujen hakemista; se voi estää crawlingin mutta ei välttämättä indeksointia, jos muita signaaleja on.

JavaScript renderöinti: monet nykyaikaiset hakurobotit renderöivät sivuja, mutta estetyt tai hitaat resurssit voivat keskeyttää renderöinnin ja piilottaa sisältöä. Käytä palvelinpuolista renderöintiä tai varmista, että kriittinen sisältö on saatavilla alkuperäisessä HTML:ssä aina kun mahdollista.

• Crawl budget and frequency: hakukoneet priorisoivat, mitä URL-osoitteita kannattaa käydä läpi uudelleen. Erittäin suurten sivustojen kannattaa hallita indeksoitavien URL:ien määrää välttääkseen turhaa crawlausta matala-arvoisilla sivuilla.

Indexing: what determines whether a page is stored

Indeksointipäätökset perustuvat moniin signaaleihin: robots meta tags, X-Robots-Tag -otsikoihin, canonical-tageihin, sisällön laatuun, duplikaatteihin ja strukturoituun dataan. Sivun crawlaus on tarpeen mutta ei riitä indeksointiin — sivu voidaan crawlata mutta jättää indeksin ulkopuolelle, jos hakukone katsoo sen matala-arvoiseksi tai sille on annettu suora ohje poissulkemisesta.

Käytännön esimerkkejä indeksointia vaikuttavista direktiiveistä:

• HTML meta robots example: <meta name="robots" content="noindex, nofollow">

• Canonical-esimerkki: <link rel="canonical" href="https://example.com/preferred-page">

• HTTP-otsikkoesimerkki (X-Robots-Tag): X-Robots-Tag: noindex

Varmistus: miten tarkistaa crawling ja indeksointi (oma sivusto vs kolmannen osapuolen sivut)

Omat sivut (auktoritatiiviset tarkistukset)

Käytä Google Search Consolein URL Inspection -työkalua varmistaaksesi crawl- ja indeksitilan, nähdäksesi live-renderöinnin ja havaitaksesi Coverage-ongelmat kyseiselle URL:lle. Coverage- ja Pages-raportit auttavat paikantamaan indeksointiongelmien ryhmiä. Käytä Rich Results Testiä validoimaan strukturoitu data ja tarkistaaksesi, onko tulos oikeutettu parannettuihin ominaisuuksiin.

Kolmannen osapuolen/julkaisijan sivut (ulkoinen varmennus)

Kun et hallitse domainia, luota julkisiin signaaleihin ja live-hauksiin. Käytä curlia ja selainta tarkistaaksesi sivuston palauttaman HTML:n, tarkista HTTP-otsikot ja varmista, että linkki löytyy sivun lähdekoodista ja renderöidystä DOMista. Esimerkkikomennot:

• Hae vain otsikot: curl -I https://example.com/page (palauttaa vain vastausotsikot).

• Hae HTML mobiilikäyttäjäagentilla: curl -A "Mozilla/5.0 (Linux; Android 12)" https://example.com/page (hakee koko HTML-vastauksen kyseiselle UA:lle).

• Tarkista renderöity DOM Chrome DevToolsin Elements-paneelissa tai headless-renderöijällä varmistaaksesi, ettei linkkiä lisätä jälkikäteen tavalla, jota hakukoneet eivät välttämättä suorita.

Käytä site:-operaattoria (esim. site:publisher.com "unique phrase") julkisena indeksointimerkkinä — se voi olla hyödyllinen mutta ei ratkaiseva. Bingille käytä Bing Webmaster Tools' Site Explorerilla indeksointisignaalien tarkasteluun.

Yleiset virheet ja korjaukset

• robots.txt estää tärkeitä resursseja: robots.txt voi estää hakurobotteja hakemasta CSS/JS-tiedostoja, joita tarvitaan sisällön renderöintiin. Ratkaisu: salli kriittiset assetit tai käytä palvelinpuolista renderöintiä ydinsisällölle.

• Tahaton noindex tai X-Robots-Tag -otsikko: tarkista templatet, staging-säännöt ja CDN:n edge-konfiguraatiot otsikoiden varalta, jotka lisäävät noindexin. Käytä curl -I:tä otsikoiden tarkastamiseen.

• Virheellinen canonical-käyttö: monien sivujen osoittaminen väärään canonicaliin voi poistaa suosituimmat sivut indeksistä. Varmista, että canonical-linkit osoittavat sisällön parhaan yksittäisen version.

• Liiallinen indeksointi matala-arvoisille sivuille (faceted navigation, ohut arkisto): vähennä indeksoitavia permutaatioita canonicaloinnilla, parametrien käsittelyllä tai tietoisella noindexillä matala-arvoisille variaanteille.

• Liiallinen riippuvuus client-side renderingista ilman palvelinvaraa: varmista, että kriittinen sisältö näkyy alkuperäisessä HTML:ssä tai renderöityy nopeasti; muuten hakurobotit eivät välttämättä suorita vaadittavia skriptejä tai indeksointi voi viivästyä.

Käytännön auditointitarkistuslista

Nopea läpikäynti löytääksesi ja korjataksesi löytymiseen/indeksointiin liittyvät ongelmat. Työskentele ylhäältä alas niillä sivuilla tai osioissa, joilla on suurin merkitys.

  1. Varmista, että tarkoitettu canonical-URL tarjotaan HTML:ssä eikä se ole ristiriidassa palvelimen uudelleenohjausten kanssa.
  2. Tarkista robots.txt disallowt, jotka vaikuttavat sivuun tai sen CSS/JS-assetteihin: curl https://example.com/robots.txt
  3. Tarkista vastausotsikot: curl -I https://example.com/page ja etsi X-Robots-Tag, tilakoodit ja cache-control-arvot.
  4. Tarkista meta robots -määritykset sivun HTML:ssä: varmista, ettei noindex ole jäänyt vahingossa päälle.
  5. Käytä URL Inspectionia (Search Console) auktoritatiivisiin crawl- ja indeksointitietoihin omille sivuillesi, ja suorita Live Test nähdäksesi nykyisen renderöidyn sisällön.
  6. Tarkista sisäinen linkitys: varmista, että tärkeisiin sivuihin linkitetään globaalista navigaatiosta, kategoriasivuista tai kontekstuaalisesta sisällöstä, jotta hakurobotit pääsevät niiden luo kohtuullisella syvyydellä.
  7. Auditoi kopioitu ja lähes kopioitu sisältö: päätä, mitkä versiot tulisi indeksoida, canonicalisoi tai käytä noindexiä tarpeen mukaan.

Kontekstipäivitykset vuodelle 2026, jotka on hyvä huomioida

Google käyttää mobiiliversiota ensisijaisena pohjana crawlingiin ja indeksointiin. Alkaen July 2024 Google crawls sites for Search with Googlebot Smartphone by default. Google myös poisti perinteiset cached-sivut in early 2024, joten 'Cached'‑näkymä ei enää ole vianmäärityksen resurssi. Search Generative Experience / AI Overviews ovat nyt vakiintuneita monissa SERP:issä; indeksointi ei takaa, että sivu esiintyy AI-yhteenvedoissa, jotka käyttävät lisävalinta- ja tiivistyslogiikkaa.

Lisävianmääritysvinkkejä

Jos sivuja ei indeksoida vaikka ne ovat crawlattavissa, tarkista palvelinlokit varmistaaksesi hakurobotin hakuyritykset ja vastauskoodit. Palvelinlokit paljastavat, saivatko hakurobotit 200-, 3xx-, 4xx- vai 5xx-vastaukset ja mitä user-agenteja käytettiin. Hidas TTFB, toistuvat 5xx-virheet tai aggressiiviset rate limitit voivat vähentää uudelleenkäyntitiheyttä.

JavaScript-painotteisilla sivustoilla vertaa raaka-HTML:ää (curl) renderöityyn DOMiin (DevTools) löytääksesi sisällön, joka ei koskaan materiaalistu ilman tiettyjä käyttäjätoimintoja. Jos kriittinen sisältö vaatii vuorovaikutusta, tarjoa hakuroboteille palvelin-renderöity tai ennakkoon renderöity versio.

Pikaviite: hyödylliset työkalut

• Google Search Console (URL Inspection, Coverage report).

• Rich Results Test and Schema Markup Validator strukturoitua dataa varten.

• Chrome DevTools (Network, Performance, Elements) ja headless-renderöijät.

• curl otsikko- ja sisältötarkastuksiin; serverilogit auktoritatiivisiksi crawlin lokitiedoiksi; Bing Webmaster Tools Site Explorer Bingin indeksin tarkistuksiin.

UKK

Mistä tiedän, onko Google indeksoinut tietyn sivun?

Omien sivujen osalta auktoritatiivinen tapa on Google Search Console'n URL Inspection. Se näyttää crawl-, indeksointi- ja rich result -kelpoisuuden. Kolmansien osapuolten sivuilla julkiset signaalit kuten site:-operaattori voivat antaa viitteitä mutta eivät ole lopullisia; käytä curlia ja renderöidyn DOMin tarkistuksia vahvistaaksesi sivun sisällön ja otsikot.

Jos sivu on crawlatty mutta ei indeksoitu, mitä tarkistan ensin?

Tarkista noindex-meta‑tagit tai X-Robots-Tag -otsikot, canonical-konfliktit, ohut tai kopioitu sisältö sekä renderöintiä estävät resurssit. Käytä curl -I:tä tarkistaaksesi otsikot ja URL Inspectionin Live Testiä nähdäksesi renderöidyn outputin.

Muuttuuko crawlattavuuden auditointi mobile-first indeksoinnin myötä?

Kyllä: arvioi ensin mobiilikokemus (smartphone), koska Google käyttää mobiiliversiota ensisijaisena pohjana crawlingiin ja indeksointiin. Varmista, että keskeinen sisältö, strukturoitu data ja sisäiset linkit ovat paikallaan ja renderöityvät oikein mobiilikäyttäjäagentin alla.

Takaako indeksointi paikan AI-yhteenvedoissa tai SERP-ominaisuuksissa?

Ei. Indeksointi on tarpeen näkyäksesi hakutuloksissa, mutta AI Overviews ja muut SERP-ominaisuudet käyttävät lisävalinta- ja tiivistyslogiikkaa. Strukturoitu data, sisällön selkeys ja auktoriteettinen konteksti lisäävät todennäköisyyttä, mutta takuuta ei ole.

Related articles