Skip to content
Search

Kaip naudoti robots.txt failą SEO

Sužinokite, ką valdo robots.txt, kaip rašyti teisingas taisykles, kaip patikrinti elgseną su curl ir DevTools ir kaip išvengti dažnų SEO klaidų.

How to Use Robots.txt File for SEO

Ką apima šis vadovas

Šiame įraše paaiškiname, ką robots.txt valdo ir ko nevaldo, parodome teisingą sintaksę ir praktinius pavyzdžius, pateikiame komandų eilutės patikrinimus, kuriuos galite vykdyti, ir išvardijame trikčių šalinimo veiksmus, kad atitaisyti dažnas klaidas. Taip pat gausite patikrinimo patarimų, veikiančių 2026 paieškų aplinkoje (mobile-first indexing yra Google numatytasis nuo July 2024 ir Google removed traditional cached pages in early 2024).

Kas yra robots.txt ir ką jis valdo

robots.txt yra paprastas tekstinis failas svetainės šaknyje, kuris perduoda crawling instrukcijas gerai besielgiantiems web robots. Jis yra Robots Exclusion Standard dalis. Naudokite failą nurodyti crawlers, kuriuos kelius jie gali pasiekti; jis valdo crawling, o ne indexing ar ranking.

Svarbūs skirtumai, kuriuos verta prisiminti:

Crawling vs indexing vs ranking — robots.txt veikia crawling (ką agentas parsisiunčia). URL, užblokuotas nuo crawling, vis tiek gali būti indexed, jei kiti puslapiai į jį nuoroduoja ir paieškos sistema pasirenka indeksuoti URL neparsisiuntusi jo turinio.

robots.txt yra rekomendacinis — jo laikosi tik sąžiningi crawlers. Kenksmingi botai, šlamšto rinkėjai ir kai kurie skanerių tipai gali jį ignoruoti.

robots.txt nepakeičia prieigos kontrolės. Privatiems resursams naudokite HTTP autentifikaciją, slaptažodžio apsaugą arba serverio pusės kontrolę.

Kur turi būti robots.txt ir pagrindinės taisyklės

robots.txt turi būti tiekiamas iš svetainės šaknies toje tiksliame hoste ir protokole, kuriems taikomos taisyklės. Pavyzdžiai, kurie yra skirtingi: https://example.com/robots.txt ir https://sub.example.com/robots.txt. Negalite įdėti robots.txt į subkatalogą ir tikėtis, kad jis valdys visą domeną.

Patogumui ir pavyzdžiams šiame vadove kanoninis testinis kelias yra http://www.yoursite.com/robots.txt.

robots.txt sintaksė ir dažniausios direktyvos

Minimalus robots.txt naudoja direktyvas, sugrupuotas pagal user-agent. Eilutės nėra case-insensitive direktyvų pavadinimams. Toliau pateikti pavyzdžiai naudoja standartinius tokenus, kuriuos palaiko dauguma pagrindinių crawlers:

Užblokuoti visus crawlers nuo katalogo:

User-agent: *

Disallow: /private/

Leisti konkretų failą, užblokuojant jo katalogą (naudinga Googlebot stiliaus parsingui):

User-agent: *

Disallow: /images/

Allow: /images/logo.png

Sitemaps galima deklaruoti robots.txt, kad nukreiptumėte crawlers į savo XML sitemap:

Sitemap: http://www.yoursite.com/sitemap.xml

Šablonų atitikimas: pagrindiniai paieškos varikliai palaiko žvaigždutės (*) wildcard ir eilutės pabaigos dolerio ($) simbolį robots.txt šablonuose. Nestandartinė Crawl-delay direktyva kai kurių variklių yra ignoruojama (Google does not support Crawl-delay).

Praktiniai pavyzdžiai

1) Leisti visiems crawlers parsisiųsti viską (numatytoji saugi parinktis):

User-agent: *

Disallow:

2) Užblokuoti vieną crawler (pvz., uždrausti konkrečiam agentui prieigą prie viso turinio):

User-agent: BadBot

Disallow: /

3) Užkirsti crawlers prieigą prie resursų, reikalingų puslapio renderinimui (dažna klaida — žr. trikčių šalinimą):

Disallow: /static/js/

Blokavimas CSS/JS gali užkirsti kelią Google matyti Jūsų puslapį taip, kaip jį mato vartotojai. Kadangi Google naudoja mobilią versiją kaip pagrindinį pagrindą crawling and indexing ir vertina Core Web Vitals iš renderinto puslapio, neblokuokite resursų, reikalingų renderinimui.

Kaip tikrinti ir šalinti robots.txt problemas

Pagrindiniai patikrinimai, kuriuos galite vykdyti išorėje nuo svetainės:

Gauti failo turinį: curl http://www.yoursite.com/robots.txt — tai grąžina failo turinį, kurį matytų crawler'is.

Tikrinti tik antraštes: curl -I http://www.yoursite.com/robots.txt — patikrina HTTP statusą (200 vs 4xx/5xx) ir Content-Type. -I grąžina tik atsakymo antraštes.

Peržiūrėti, kaip jį gauna naršyklės: atidarykite https://www.yoursite.com/robots.txt naršyklėje ir patvirtinkite, kad turinys sutampa su curl.

Peržiūrėkite serverio žurnalus dėl tikrų crawler užklausų į /robots.txt ir dėl Googlebot ar kitų agentų bandančių pasiekti užblokuotus puslapius — žurnalai yra patikimiausias trečiosios šalies signalas apie crawlerių elgseną.

Patikrinimai, kuriuos turėtumėte atlikti, kai valdote turtą:

Naudokite Google Search Console’s URL Inspection for individual pages to see if Google has fetched or indexed a URL. URL Inspection yra autoritetingas įrankis jūsų valdomoms nuosavybėms.

Po robots.txt pakeitimų stebėkite serverio žurnalus ir Performance ataskaitą Search Console, kad patvirtintumėte crawlių elgseną svarbiems puslapiams.

Dažni problemų požymiai ir ką daryti

Netyčia užblokavote CSS/JS — simptomas: puslapiai crawlerių atžvilgiu atvaizduojami kitaip; Sprendimas: pašalinkite resursų kelius iš Disallow, kad crawlers galėtų juos pasiekti.

robots.txt grąžina 404/5xx — simptomas: kai kurie crawlers gali laikyti svetainę visiškai crawlable arba laikinai sustabdyti crawlinimą; Sprendimas: atkurkite galiojantį robots.txt, kuris grąžina 200 ir teisingą Content-Type.

Užblokavote visą hostą ar protokolą įdėję robots.txt netinkamame subdomenyje — simptomas: puslapiai dingsta iš crawl žurnalų; Sprendimas: pridėkite robots.txt tinkamam hostui (ir patikrinkite peradresavimus).

Jei puslapis užblokuotas nuo crawling, bet vis tiek pasirodo paieškos rezultatuose be išnašos, tai reiškia, kad URL buvo indeksuotas pagal išorinius signalus, nors turinys nebuvo parsisiųstas. Norėdami pašalinti tokius URL iš rezultatų, naudokite tinkamą HTTP autentifikaciją, pašalinkite puslapį arba pateikite noindex direktyvą pačiame puslapyje (noindex reikalauja, kad crawler parsisiųstų puslapį, taigi neblokuokite jo robots.txt, jei planuojate naudoti noindex).

Kontrolinis sąrašas: saugiai diegti ir peržiūrėti robots.txt

Įdėkite robots.txt svetainės šaknyje tam tiksliai hostui ir protokolui.

Išbandykite failą su curl (turinį ir antraštes) ir naršyklėje.

Venkite blokuoti CSS, JavaScript, arba kitus išteklius, naudojamus renderinimui, nebent tyčia norite užkirsti crawlers galimybę renderinti.

Nurodykite sitemaps robots.txt, kad padėtumėte crawlers atrasti Jūsų indeksuojamus URL.

Stebėkite serverio žurnalus ir Search Console dėl crawlio elgsenos po pakeitimų.

Jei reikia žingsnis po žingsnio nuorodos, perskaitykite Read the Technical SEO Guide dėl platesnio konteksto apie crawlability ir Core Web Vitals.

Papildomi aspektai 2026

Kadangi Google naudoja mobilią versiją kaip pagrindą crawling ir indexing ir kadangi tradicinės cached pages buvo pašalintos in early 2024, turinys, tyčia paslėptas nuo crawlers per robots.txt, gali mažiau tikėtis būti pateiktas moderniose AI-driven apžvalgose ir Search Generative Experience funkcijose. Jei norite, kad turinys būtų prieinamas AI apžvalgoms arba būtų naudojamas turtingoms SERP funkcijoms, leiskite crawlers parsisiųsti ir indeksuoti puslapį ir naudokite struktūruotus duomenis, kur tai tinkama.

DUK

Kur turi būti talpinamas robots.txt?

robots.txt turi būti pasiekiamas šaknyje to tikslaus hosto ir protokolo, kurį norite valdyti, pavyzdžiui https://www.example.com/robots.txt. Taisyklės nekaskaduoja nuo tėvinio domeno į subdomenus.

Ar blokuojant puslapį robots.txt galima jį pašalinti iš paieškos rezultatų?

Užblokavimas nuo crawling ne visada neleidžia URL atsirasti paieškos rezultatuose, jei kiti puslapiai į jį nuoroduoja. Norint užkirsti kelią indeksavimui, leiskite puslapį crawlinti ir grąžinkite noindex direktyvą arba naudokite serverio pusės prieigos kontrolę.

Kaip greitai įsigalioja robots.txt pakeitimai?

Crawlers periodiškai parsisiunčia robots.txt; nėra universalaus fiksuoto laiko. Norint patvirtinti pakeitimą, patikrinkite serverio žurnalus dėl naujų užklausų į /robots.txt ir stebėkite Search Console bei crawl žurnalus dėl elgsenos pokyčių.

Ar turėtumėte naudoti robots.txt norėdami paslėpti privačią informaciją?

Ne. robots.txt yra viešas failas ir juo nereikėtų pasikliauti saugant jautrius duomenis. Naudokite autentifikaciją, pašalinkite turinį iš viešų kelių arba grąžinkite tinkamus HTTP atsakymų kodus, kad užkirstumėte prieigą.

Kaip leisti prieigą tik vienam crawler'ui (pvz., Googlebot) prie mano svetainės?

Galite įtraukti user-agent grupę konkrečiam crawler'iui ir griežtesnes grupes kitiems, pavyzdžiui:

User-agent: Googlebot

Disallow:

User-agent: *

Disallow: /

Prisiminkite, kad tai remiasi user-agent eilutėmis ir sąžiningais crawlers; tai nėra saugi prieigos kontrolė.

Related articles