Skip to content
Ieškoti

Robots.txt: kas tai yra ir kaip tai veikia

robots.txt yra paprasto teksto failas, patalpintas svetainės šaknyje, nurodantis web crawlers taisykles (User-agent, Disallow, Allow, Sitemap). Jis kontroliuoja crawling elgesį ir gali netiesiogiai paveikti indeksavimą, bet tiesiogiai neįtakoja reitingo.

Robots.txt: What It Is and How It Works

Kas yra robots.txt?

robots.txt (Robots Exclusion Protocol) yra paprasto teksto failas, esantis hosto šaknyje — pvz. https://example.com/robots.txt — kuris pateikia paprastas crawl instrukcijas user-agents (web crawlers). Tai viešas, mašinai skaitomas failas; jis neatlieka autentifikacijos ir negali slėpti turinio. Crawleriai skaito robots.txt, kad sužinotų, kurių kelių savininkas pageidauja vengti arba prioritetizuoti.

Kodėl robots.txt svarbus SEO

Robots.txt kontroliuoja crawling. Crawling yra atradimo ir puslapio užklausų etapas, kaip paieškos sistemos sąveikauja su jūsų svetaine; jei a crawler yra užblokuotas nuo URL užklausos, jis gali nematyti puslapio viduje esančių nurodymų (pvz., meta robots) ar turinio, reikalingo indeksavimui. Tai reiškia, kad robots.txt gali netiesiogiai įtakoti indeksavimą. Jis tiesiogiai nenurodo reitingo — reitingavimas remiasi daugeliu signalų po indeksavimo. Naudokite robots.txt serverio išteklių apsaugai, dublikavimo ar vidinėms įrankių puslapiams atmesti ir tam, kad crawleriai galėtų pasiekti asset'us, reikalingus teisingam puslapio renderinimui.

Kaip veikia robots.txt

Crawleris užkrauna /robots.txt prieš prašydamas kitų puslapių tame pačiame hoste ir pritaiko pirmą atitinkantį User-agent stanzą bei jos direktyvas. Pagrindinės direktyvos, kurias palaiko didieji crawleriai, yra User-agent, Disallow, Allow ir Sitemap. Palaikymas raštų atitikimui ir papildomoms direktyvoms skiriasi priklausomai nuo crawlerio — Google atpažįsta raštus kaip * ir $ ir paiso Allow/Disallow prioriteto taisyklių pagal savo dokumentaciją.

Įprastos direktyvos ir pavyzdžiai

Minimalus robots.txt pavyzdys:

User-agent: *
Disallow: /private/
Allow: /public/
Sitemap: https://example.com/sitemap.xml

Pastabos: talpinkite robots.txt svetainės šaknyje. Jei robots.txt grąžina HTTP 404, dauguma crawlerių traktuoja tai kaip „be apribojimų“; jei jo negalima pasiekti arba serveris grąžina klaidas, crawlerių elgesys gali skirtis — testuokite ir stebėkite, kad išvengtumėte atsitiktinio plačio bloko. Dėl Google specifinio elgesio ir pavyzdžių konsultuokitės Google dokumentacijoje apie robots.txt.

Robots.txt tipai

Priklausomai nuo tikslo naudojami skirtingi robots.txt šablonai. Žemiau pateikti dažni požiūriai su trumpais pliusais ir minusais.

- Blokavimas visam tinklapiui (Disallow: /)
Pliusai: iš karto užkerta crawleriams prieigą prie viso hosto.
Minusai: neleidžia crawleriams užkrauti turinio ir asset'ų; gali sustabdyti viešų puslapių indeksavimą.

- Tikslių kelių taisyklės (Disallow: /private/)
Pliusai: lengva atmesti vidinius arba admin puslapius.
Minusai: robots.txt yra viešas; neįrašykite jautrių kelių, kurių tikitės laikyti paslaptimi.

- User-agent specifinės taisyklės (User-agent: Googlebot)
Pliusai: pritaikote elgesį konkretiems crawleriams.
Minusai: didesnis priežiūros poreikis; kai kurie crawleriai ignoruoja nestandartines direktyvas.

Kaip pradėti dirbti su robots.txt

1) Nustatykite, ką reikia apsaugoti nuo crawling (serverio apkrautoms zonoms, staging keliams) ir kas turi likti pasiekiama crawleriams (vieši puslapiai, CSS/JS reikalingi renderinimui).
2) Sukurkite paprasto teksto failą pavadinimu robots.txt svetainės šaknyje. Išbandykite lokaliai ir staging aplinkoje prieš diegiant į produkciją.
3) Diegkite ir patikrinkite naudodami žemiau esančią techninę kontrolinę lentelę. Laikykite failą paprastą ir dokumentuokite bet kokias User-agent specifines taisykles, kad ateities prižiūrėtojai suprastų jų paskirtį.

Įprastos robots.txt klaidos

• Pasitikėjimas robots.txt slėpti jautrius duomenis — robots.txt yra viešas ir neturėtų būti naudojamas kaip saugumo priemonė. Naudokite autentifikaciją arba pašalinkite resursą.
• Blokuojami CSS/JS, reikalingi renderinimui — tai gali pakenkti, kaip search engines suvokia puslapio išdėstymą ir turinį.
• Blokuojami puslapiai su meta noindex — jei Googlebot negali užkrauti puslapio, jis nematys meta noindex nurodymo.
• Placing robots.txt under a subpath (pvz. /blog/robots.txt) — crawleriai paieško tik root lygio failo.
• Sintaksės klaidos ir neteisingi HTTP status kodai — užtikrinkite, kad failas pateikiamas su tinkamu HTTP 200 atsaku.

Robots.txt tikrinimas: techninė kontrolinė lentelė

Naudokite žemiau esančius patikrinimus po robots.txt diegimo arba atnaujinimo. Kiekvienas punktas nurodo, kur patikrinti, ir aiškų sėkmės kriterijų.

**Failas pasiekiamas** — kur patikrinti: curl -I https://example.com/robots.txt — sėkminga, kai užklausa grąžina HTTP 200 ir failas atitinka lūkesčius.
**Tinkamos direktyvos** — kur patikrinti: curl https://example.com/robots.txt arba view-source naršyklėje — sėkminga, kai User-agent/Disallow/Allow eilutės atitinka jūsų politiką.
**Neužblokuoja renderinimui reikalingų asset'ų** — kur patikrinti: Chrome DevTools Network ir Coverage arba paleisdami crawler simulatorių — sėkminga, kai CSS/JS reikalingi renderinimui nėra disallowed.
**Google-block patikra (savininko svetainė)** — kur patikrinti: Google Search Console URL Inspection — sėkminga, kai Inspection rodo, kad URL yra crawlable ir nėra "Blocked by robots.txt".
**Išorinis patikrinimas** — kur patikrinti: naudokite curl arba trečios šalies crawlerį, kad užklausite užblokuotą URL ir patvirtintumėte, jog puslapis grąžina 200, bet crawleriui buvo uždrausta prieiga — sėkminga, kai elgesys atitinka lūkesčius.
**Sitemap buvimas** — kur patikrinti: robots.txt turinys ir Google Search Console Sitemaps ataskaita — sėkminga, kai sitemap URL yra nurodytas robots.txt arba pateiktas ir priimtas Search Console.

Įrankiai ir komandos robots.txt tikrinimui

curl (tik antraštės): curl -I https://example.com/robots.txt — grąžina HTTP statusą ir atsakymo antraštes. curl (pilnas failas): curl https://example.com/robots.txt — išspausdina turinį patikrinimui. Chrome DevTools: atidarykite failo URL arba žiūrėkite tinklo užklausas puslapyje, kad patvirtintumėte, jog asset'ai leidžiami. Google Search Console URL Inspection: jūsų valdomam URL įrankis praneša, ar Google mato puslapį ir ar jis buvo blokuotas robots.txt. Bing Webmaster Tools Site Explorer gali parodyti, kaip Bing tvarkė failą jūsų patvirtintose svetainėse. Naudokite serverio log'us, kad patvirtintumėte, kuri User-agent prašė robots.txt ir kaip dažnai.

Dėl autoritetingų detalių apie palaikomas direktyvas ir prioriteto taisykles, konsultuokitės oficialioje dokumentacijoje adresu https://developers.google.com/search/docs/advanced/robots/intro

Skaitykite Technical SEO Guide

Dažniausiai užduodami klausimai

K: Jei užblokuosiu puslapį per robots.txt, ar jis dings paieškos rezultatuose?
A: Blokavimas per robots.txt neleidžia crawleriams užkrauti puslapio, todėl jie dažnai nemato puslapio vidinių signalų. Užblokuotas puslapis vis tiek gali atsirasti paieškos rezultatuose remiantis išoriniais signalais (tik URL įrašas), bet jam trūks talpyklos ištraukos ar renderinto turinio. Norėdami prašyti pašalinimo, naudokite index removal įrankius URL, kuriuos valdote; jei norite kontroliuoti indeksavimą per metaduomenis, įsitikinkite, kad puslapis yra crawlable, kad crawleriai galėtų matyti meta robots:noindex direktyvą.

K: Ar galiu naudoti robots.txt specifiniams botams blokuoti?
A: Galite pridėti User-agent specifines stanzas, kad taikytumėte žinomiems crawleriams. Tačiau robots.txt yra pagarbi sistema: gerai elgiamieji crawleriai jos paiso, kenksmingi botai gali jos ignoruoti. Didesnei apsaugai naudokite autentifikaciją, IP filtravimą arba ugniasienę.

K: Ar turėčiau įtraukti savo sitemap į robots.txt?
A: Sitemap: https://example.com/sitemap.xml įtraukimas į robots.txt yra patogus būdas nukreipti crawlerius į jūsų sitemap; taip pat pateikite sitemap tiesiogiai Google Search Console svetainėms, kurių esate savininkas.

K: Ar robots.txt taikomas pagal protokolą ir hostą?
A: Taip. robots.txt užkraunamas pagal hostą ir protokolą: https://example.com/robots.txt skiriasi nuo http://example.com/robots.txt arba https://sub.example.com/robots.txt. Talpinkite failą tame pačiame protokole ir hoste, kuriuo naudojatės savo svetaine.

K: Kaip mobile-first indexing veikia robots.txt?
A: Google naudoja mobilų versiją kaip pagrindą crawling and indexing. Nuo 2024 m. liepos Google pagal numatytuosius nustatymus naršo svetaines su Googlebot Smartphone. Įsitikinkite, kad robots.txt netyčia neblokuoja mobiliai tiekiamų puslapių resursų, kurie reikalingi teisingam renderinimui ir indeksavimui.

K: Kur rasti oficialių gairių?
A: Kreipkitės į Google's robots.txt dokumentaciją adresu https://developers.google.com/search/docs/advanced/robots/intro ir Schema.org bei W3C išteklius, susijusius su crawling ir indexing praktika.

Stiprinkite autoritetą naudodami kokybiškus backlinks

Susiję terminai