Robots.txt SEO: ефективен контрол на обхождането
Научете как да използвате robots.txt, за да насочвате ботовете безопасно, да избягвате грешки при индексирането, да проверявате поведението с curl и логове и да прилагате практични примери за продукционни сайтове.

Какво прави robots.txt — и какво не прави
robots.txt е обикновен текстов файл, разположен в корена на сайта (https://example.com/robots.txt). Неговата роля е стеснена: дава инструкции за обхождане на добросъвестни ботове. Използвайте го, за да намалите ненужните заявки към ниско-стойностни области и да подобрите ефективността на обхождането; не разчитайте на него за контрол върху индексирането или за скриване на чувствително съдържание.
Контролира обхождането, не индексацията
Директивата Disallow възпрепятства съобразяващите се ботове да изтеглят път към URL. Ако страница е блокирана от обхождане, търсачките може все пак да индексират URL-а въз основа на външни сигнали (например линкове), но няма да видят HTML-а на страницата или meta robots таговете. За да предотвратите индексирането надеждно, позволете обхождане, за да може ботът да прочете meta robots noindex тага или да използва X-Robots-Tag отговорен хедър с noindex върху самия ресурс.
Публичен, съветващ и не е механизъм за сигурност
robots.txt е публично достъпен и дава съвети: всеки може да го прочете на /robots.txt, а злонамерени ботове могат да игнорират директивите му. Не изброявайте тайни или лични пътища в robots.txt; третирайте го като документ за контрол на обхождането, а не като механизъм за контрол на достъпа.
Основен синтаксис и общи директиви
Повечето сайтове използват малък набор от директиви. Спецификацията и практичните разширения, използвани от основните търсачки, поддържат базови шаблони, wildcards и указатели към sitemap. Дръжте правилата прости и документирайте намерението в коментари, когато е възможно.
Ключови директиви (примерите са показани като буквални редове):
- User-agent: <bot-name> — насочва един бот; използвайте User-agent: * за всички ботове.
- Disallow: /path/ — предотвратява изтеглянето на пътища под /path/.
- Allow: /path/file.js — явно разрешава път под родител, който е забранен (поддържа се от основните търсачки).
- Sitemap: https://example.com/sitemap.xml — насочва ботовете към Вашия XML sitemap(и).
- Wildcards: * (съвпада с всяка последователност) и $ (край на низ) се поддържат практически от основните търсачки; използвайте ги внимателно за шаблони с query-параметри.
- Нестандартни директиви: Crawl-delay и Host се разпознават от някои ботове, но не са част от оригиналния стандарт — тествайте поведението за user-agents, които Ви интересуват.
Как robots.txt взаимодейства с индексирането и ранкирането
Разделяйте обхождането, индексирането и ранкирането: robots.txt влияе върху стадия на обхождане (дали бот ще изтегли URL). За индексиране ботът трябва да прочете съдържанието на страницата или meta/X-Robots-Tag. Ранкирането е последващ процес, който разчита на сигнали, някои от които идват от съдържанието на страницата; ако ботът не може да изтегли страницата, тези сигнали от съдържанието не са налични.
Практически последици:
- Блокирането на страница в robots.txt означава, че търсачката не може да изтегли страницата, за да прочете meta robots noindex тагове или структурирани данни.
- Ако важен ресурс (CSS/JS) е блокиран, mobile-first индексиране и рендерирането може да не види страницата правилно; тъй като Google използва мобилната версия като основа за обхождането и индексирането, и тъй като Googlebot Smartphone е подразбиращият се бот от July 2024, разрешете ресурсите, необходими за рендериране на мобилни устройства.
Проверка: как да тествате какво всъщност виждат ботовете
Проверете достъпността и съдържанието на robots.txt от външна страна и потвърдете как сайтът Ви реагира на истински заявки от ботове. Използвайте логовете на сървъра, директни заявки и инструменти в Search Console за страници, които контролирате.
Бързи проверки с curl
За извличане на HTTP заглавия за robots.txt (само заглавия):
- curl -I https://example.com/robots.txt — връща само заглавията на отговора; проверете status code и Content-Type.
За да получите целия файл като конкретен user-agent (HTML и директиви):
- curl -A "Googlebot" https://example.com/robots.txt — връща съдържанието на файла, използвайки указаната user-agent стойност.
Логове на сървъра и реални доказателства от обхождане
Прегледайте логовете на сървъра за заявки към /robots.txt и за user-agent-и на ботове като Googlebot или Bingbot. Логовете показват честотата на извличане, response codes и дали ботовете са опитвали да достъпят забранени URL. За страници, които притежавате, използвайте URL Inspection в Search Console, за да видите сигнали за обхождане и индексиране; за страници на трети страни запитването site: дава ориентировъчна информация, но не е окончателно.
Чести грешки и как да ги поправите
Избягвайте тези често срещани грешки при управлението на robots.txt.
- Блокиране на CSS/JS, необходими за рендериране: решения — разрешете пътищата към активи, необходими за мобилния rendering pipeline, така че Googlebot Smartphone да може да визуализира страниците правилно.
- Очакване robots.txt да сложи noindex на URL-ове: решения — премахнете Disallow за страницата и използвайте meta robots noindex или X-Robots-Tag хедър, така че търсачките да могат да видят директивата.
- Изброяване на чувствителни URL в robots.txt: решения — не излагайте лични пътища в robots.txt; защитете ги чрез автентикация и подходящи server-side контроли на достъпа.
- Прекалено сложни wildcard правила, които ненужно съвпадат с валидни страници: решения — тествайте всеки шаблон със примерни URL и документирайте намерението в коментари, поддържайки правилата възможно най-специфични.
Препоръчани стратегии за robots.txt
Приложете консервативен, тестируем подход: дръжте robots.txt минимален, насочвайте ботовете към sitemaps и предпочитайте контроли на ниво страница чрез meta/X-Robots-Tag за управление на индексирането.
Практически шаблони:
- По подразбиране: разрешаване плюс sitemap: включете User-agent: * и Sitemap директива, така че ботовете бързо да открият Вашата структура.
- Блокирайте страници с низка стойност от query или вътрешни резултати от търсене, но избягвайте да блокирате параметърни шаблони, които също съвпадат с канонично съдържание; предпочитайте обработка на параметрите в sitemap-а или чрез canonical тагове.
- Staging или development: блокирайте ботовете, докато staging средата е публична, но премахнете или променете блокирането преди пускане; не разчитайте на robots.txt като единствена мярка за защита на предварителни активи.
Примери, които можете да адаптирате
Прост сайт със sitemap
User-agent: *\nDisallow:\nSitemap: https://example.com/sitemap.xml
Често срещан CMS (разрешете admin-ajax)
User-agent: *\nDisallow: /wp-admin/\nAllow: /wp-admin/admin-ajax.php\nSitemap: https://example.com/sitemap_index.xml
Блок за staging (публичен сървър, но все още не в производство)
User-agent: *\nDisallow: /
Внимание: блокиранията за staging трябва да бъдат премахнати преди пускане; също така защитете staging-а с автентикация, за да не могат търсачките и трети страни случайно да го индексират, ако robots файлът бъде променен.
Поддържане на robots.txt в мащаб
За големи сайтове третирайте robots.txt като конфигурационен артефакт: съхранявайте го в source control, преглеждайте промените в pull requests и го деплойвайте с сайта, така че staging и production да имат правилни, специфични за средата файлове. Автоматизирайте тестове, които извличат деплойнатия robots.txt и валидират синтаксиса на правилата спрямо представителни URL.
Ако оперирате с множество поддомейни, имайте предвид, че robots.txt е специфичен за host: правилата в example.com/robots.txt не важат за sub.example.com.
ЧЗВ
Може ли robots.txt да предотврати появата на страница в резултатите от търсенето?
Не надеждно. robots.txt може да спре бота да изтегли страницата, но търсачките все пак могат да индексират URL-а въз основа на външни връзки или други сигнали. За да предотвратите индексиране, позволете обхождане и използвайте meta robots noindex таг в страницата или X-Robots-Tag: noindex хедър в отговора, така че ботът да може да прочете инструкциите.
Как да проверите дали Google спазва Вашия robots.txt?
От външна страна, изтеглете https://example.com/robots.txt с curl, за да потвърдите файла и status codes, прегледайте логовете на сървъра за заявки от Googlebot към файла и към страници, които очаквате да бъдат обходени, и използвайте URL Inspection в Search Console за страници, които притежавате, за да видите опити за обхождане и статус на индексация. Запитването site: може да даде публична индикация, но не е окончателно.
Трябва ли да блокирам URL параметри в robots.txt?
Бъдете внимателни. Блокирането на параметризирани URL може да спести crawl budget, но рискува да скрие канонизирано или индексирано съдържание, ако шаблоните са твърде общи. Предпочитайте canonical тагове, обработка на параметрите в sitemaps или server-side redirects, където е подходящо; тествайте всеки шаблон щателно преди деплой.
Безопасно ли е да се разчита на Crawl-delay?
Crawl-delay е нестандартна директива и нейното поддържане варира в зависимост от бота. За сайтове, които се нуждаят от контрол на скоростта на обхождане, предпочитайте server-side rate limiting, robots meta тагове за селективни страници, или настройки, специфични за бот, налични в услуги като Bing Webmaster Tools. Винаги тествайте поведението за специфичните user-agents, които таргетирате.
Related articles

Как да използвате robots.txt за SEO
Научете какво контролира robots.txt, как да напишете правилни правила, да проверите поведението с curl и DevTools и да избегнете чести SEO грешки.

Най-добри услуги за оптимизация за търсачки (SEO)
Научете какво трябва да включва пълна SEO услуга, как да проверявате доставчици, технически стъпки за верификация и безопасни практики за backlinks.

Практически SEO съвети за по-добро класиране
Действени, вечнозелени SEO стратегии: избор на keywords, on-page основи, технически поправки, насоки за link building и стъпки за верификация, които може да приложите днес.
