Skip to content
Пошук

robots.txt: що це і як працює

robots.txt — це текстовий файл у корені сайту, який визначає правила crawling для веб-краулерів (User-agent, Disallow, Allow, Sitemap). Він контролює поведінку краулінгу й може опосередковано впливати на індексацію, але не встановлює ранжування напряму.

Robots.txt: What It Is and How It Works

Що таке robots.txt?

robots.txt (Протокол виключення роботів) — це текстовий файл, розташований у корені хоста — наприклад https://example.com/robots.txt — який дає прості інструкції для user-agents (web crawlers). Він публічний і машинозчитуваний; не призначений для автентифікації або приховування контенту. Краулери читають robots.txt, щоб зрозуміти, які шляхи власник сайту просить уникати або яким надає пріоритет.

Чому robots.txt важливий для SEO

robots.txt контролює crawling. Crawling — це етап виявлення та завантаження того, як search engines взаємодіють із вашим сайтом; якщо crawler не може отримати URL, він може не побачити on-page директиви (наприклад meta robots) або контент сторінки, потрібний для індексації. Отже robots.txt може опосередковано впливати на indexation. Він не встановлює порядок ранжування напряму — ранжування визначається багатьма сигналами після індексування. Використовуйте robots.txt, щоб захистити ресурси сервера, уникати краулінгу дубльованих або внутрішніх інструментальних сторінок та переконатися, що crawlers мають доступ до ресурсів, потрібних для коректного рендерингу.

Як працює robots.txt

Краулер спочатку запитує /robots.txt перед тим, як робити інші запити до того ж хоста, і застосовує перший співпадаючий User-agent stanza разом із вказаними директивами. Загальні директиви, які підтримують основні краулери, включають User-agent, Disallow, Allow і Sitemap. Підтримка патернів і додаткових директив залежить від краулера — Google розпізнає патерни, такі як * і $, та дотримується правил пріоритету Allow/Disallow згідно з документацією.

Типові директиви та приклади

Мінімальний приклад robots.txt:

User-agent: *
Disallow: /private/
Allow: /public/
Sitemap: https://example.com/sitemap.xml

Примітки: розміщуйте robots.txt у корені сайту. Якщо robots.txt повертає HTTP 404, більшість краулерів трактують це як «без обмежень»; якщо файл недоступний або повертає помилки сервера, поведінка краулерів може відрізнятися — тестуйте й моніторте, щоб уникнути випадкового широкого блокування. Для поведінки, специфічної для Google, та прикладів звертайтеся до документації Google щодо robots.txt.

Види robots.txt

Різні шаблони robots.txt використовуються залежно від цілі. Нижче — поширені підходи з короткими плюсами та мінусами.

- Site-wide block (Disallow: /)
Pros: immediately prevents crawler access to the whole host.
Cons: prevents crawlers from fetching content and assets; can stop indexation of public pages.

- Path-specific rules (Disallow: /private/)
Pros: easy to exclude internal or admin paths.
Cons: robots.txt is public; do not list sensitive paths you expect to keep secret.

- User-agent specific rules (User-agent: Googlebot)
Pros: tailor behaviour for specific crawlers.
Cons: increased maintenance; some crawlers ignore non-standard directives.

Як почати з robots.txt

1) Визначте, що потрібно захистити від краулінгу (ділянки з високим навантаженням на сервер, staging-шляхи) і що має залишатися доступним для краулерів (публічні сторінки, CSS/JS, потрібні для рендерингу).
2) Створіть текстовий файл з назвою robots.txt у корені сайту. Тестуйте локально та на staging перед розгортанням у продакшн.
3) Розгорніть і перевірте, використовуючи технічний чекліст нижче. Тримайте файл простим і документуйте будь-які правила для конкретних User-agent, щоб майбутні адміністратори розуміли задум.

Поширені помилки з robots.txt

• Покладатися на robots.txt для приховування чутливих даних — robots.txt публічний і не має застосовуватися як безпека. Використовуйте автентифікацію або видаляйте ресурс.
• Блокувати CSS/JS, потрібні для рендерингу — це може нашкодити розумінню сторінки пошуковими системами.
• Блокувати сторінки, які містять meta noindex — якщо Googlebot не може отримати сторінку, він не побачить meta noindex.
• Розміщувати robots.txt під підшляхом (наприклад /blog/robots.txt) — краулери шукають лише файл на рівні кореня.

• Синтаксичні помилки та невірні HTTP-статуси — переконайтеся, що файл повертається з коректним HTTP 200.

Перевірка robots.txt: технічний чекліст

Виконайте наведені перевірки після розгортання або оновлення robots.txt. Кожен пункт вказує, де перевіряти, і чітку умову проходження.**File reachable** — where to verify: curl -I https://example.com/robots.txt — passes when the request returns HTTP 200 and the file is the expected content.
**Correct directives** — where to verify: curl https://example.com/robots.txt or view-source in the browser — passes when the User-agent/Disallow/Allow lines match your policy.
**Not blocking rendering assets** — where to verify: Chrome DevTools Network and Coverage or fetch via a crawler simulator — passes when CSS/JS required for rendering are not disallowed.
**Google-block check (own site)** — where to verify:
Google Search Console

URL Inspection — passes when Inspection shows the URL is crawlable and not "Blocked by robots.txt".
**External crawl check** — where to verify: use curl or a third-party crawler to request a blocked URL and confirm it returns 200 for the page but the crawler was denied access — passes when behaviour matches expectations.
**Sitemap presence** — where to verify: robots.txt content and Google Search Console Sitemaps report — passes when the sitemap URL is listed in robots.txt or submitted in Search Console and accepted.

Інструменти та команди для перевірки robots.txtcurl (headers only): curl -I https://example.com/robots.txt — повертає HTTP-статус і заголовки відповіді. curl (full file): curl https://example.com/robots.txt — виводить вміст для інспекції. Chrome DevTools: відкрийте URL файлу або перегляньте мережеві запити сторінки, щоб підтвердити, що потрібні ресурси дозволені. Google Search Console URL Inspection: для URL, який ви володієте, інструмент показує, чи бачить Google сторінку і чи не була вона заблокована robots.txt.Bing Webmaster Tools

Site Explorer може показати, як Bing обробив файл для підтверджених сайтів. Використовуйте логи сервера, щоб підтвердити, які user-agents запитували robots.txt і як часто.Для авторитетних деталей про підтримувані директиви та правила пріоритетності звертайтеся до офіційної документації: https://developers.google.com/search/docs/advanced/robots/intro

Прочитайте керівництво Technical SEO

Поширені запитання

Q: Якщо я заблокую сторінку через robots.txt, чи зникне вона з результатів пошуку?
A: Блокування через robots.txt перешкоджає краулерам отримувати сторінку, що зазвичай заважає їм бачити on-page сигнали. Заблокована сторінка все ще може зʼявлятися у результатах пошуку на підставі зовнішніх сигналів (URL-only entry), але не матиме кешованого фрагмента або відрендереного вмісту. Щоб запросити видалення, використовуйте інструменти видалення індексації для URL, якими ви володієте; щоб контролювати індексацію через метадані, переконайтеся, що сторінка доступна для краулера, щоб він побачив meta robots:noindex.

Q: Чи можу я використати robots.txt, щоб блокувати конкретних ботів?
A: Ви можете додати User-agent-специфічні stanza, щоб таргетувати відомі краулери. Проте robots.txt — це система честі: добропорядні краулери її дотримуються, тоді як шкідливі боти можуть ігнорувати. Для надійнішого захисту використовуйте автентифікацію, IP-фільтрацію або брандмауер.

Q: Чи варто включати sitemap у robots.txt?
A: Додавання Sitemap: https://example.com/sitemap.xml до robots.txt — зручний спосіб вказати краулерам на вашу карту сайту; також подавайте карти сайту безпосередньо в Google Search Console для сайтів під вашим контролем.

Q: Чи застосовується robots.txt для кожного протоколу й хоста?
A: Так. robots.txt запитують для кожного хоста і протоколу: https://example.com/robots.txt відрізняється від http://example.com/robots.txt або https://sub.example.com/robots.txt. Розміщуйте файл на тому ж протоколі й хості, що використовує ваш сайт.

Q: Як mobile-first indexing впливає на robots.txt?
A: Google використовує мобільну версію як основну основу для crawling and indexing. З липня 2024 року Google краулить сайти для Search за замовчуванням з Googlebot Smartphone. Переконайтеся, що robots.txt випадково не блокує ресурси на сторінках мобільної версії, які потрібні для коректного рендерингу та індексації.

Q: Де знайти офіційну документацію?
A: Зверніться до документації Google щодо robots.txt за адресою https://developers.google.com/search/docs/advanced/robots/intro та до ресурсів Schema.org і W3C щодо повʼязаних практик краулінгу та індексації.

Підвищуйте авторитет за допомогою якісних backlinks

Пов'язані терміни