Skip to content

Jak używać pliku Robots.txt dla SEO

Dowiedz się, jak używać pliku robots.txt dla SEO. Kontroluj indeksowanie przez wyszukiwarki, poprawiaj widoczność i chroń prywatne strony dzięki odpowiedniej konfiguracji robots.txt.

How to Use Robots.txt File for SEO

Czy wiesz, że Robots.txt to jeden z kluczowych elementów SEO Twojej witryny? Czym dokładnie jest Robots.txt i jak go wykorzystać w SEO? Wyjaśnimy to w tym poście.

Czym jest Robots.txt?

W katalogu głównym witryny znajdują się pliki, które informują wyszukiwarki (crawlery i pająki), które strony i pliki powinny widzieć, a których nie. Administratorzy stron często chcą, aby ich witryny były znajdowane przez wyszukiwarki, ale są sytuacje, gdy nie jest to konieczne. Jeśli przechowujesz prywatne informacje lub próbujesz zaoszczędzić miejsce, możesz powstrzymać wyszukiwarkę przed indeksowaniem Twoich plików (z wyłączeniem ciężkich stron z obrazami).

Standard wykluczania robotów, znany również jako protokół wykluczania robotów lub po prostu robots.txt, to standard używany przez witrynydo komunikacji z crawlerami i innymi robotami sieciowymi.

Roboty są często używane przez wyszukiwarki do kategoryzowania stron internetowych. Nie wszystkie roboty współpracują ze standardem; zbieracze adresów e-mail, spamboty, złośliwe oprogramowanie oraz roboty skanujące w poszukiwaniu luk bezpieczeństwa mogą nawet zaczynać od tych części witryny, z których kazano im się wycofać. Standard może być używany w połączeniu z Sitemapami, standardem włączania robotów dla stron internetowych. – Wikipedia

Wyszukiwarki które używają słów kluczowych i metadanych do indeksowania stron internetowych, pokazują najbardziej trafne wyniki osobom, które czegoś szukają w Internecie. Dla właścicieli sklepów internetowych ważniejsze jest, aby uzyskać dobre wyniki w wyszukiwarkach niż dla jakiejkolwiek innej firmy. Zazwyczaj ludzie nie przechodzą poza kilka pierwszych stron wyników z sugestii wyszukiwarki .

Indeksowanie odbywa się za pomocą pająków lub crawlerów, które poruszają się po sieci. W ten sposób wyszukiwarki pozyskują i organizują wszystkie informacje w Internecie. Firmy te używają tych botów.

How to Use Robots.txt File for SEO

robots.txt to plik, którego crawlery szukają, gdy po raz pierwszy odwiedzają witrynę. Gdy tylko crawler znajdzie taki plik, będzie w nim szukał instrukcji dotyczących indeksowania witryny. Jeśli bot nie znajdzie instrukcji, użyje algorytmu swojego działania, aby ich szukać. Powoduje to, że wiele osób szuka rzeczy na stronie, ale także sprawia, że proces indeksowania jest mniej efektywny.

Aby plik robots.txt działał, na stronie może być tylko jeden. Dodatkowa nazwa domeny musi mieć plik robots.txt w katalogu głównym swojej strony internetowej. Na przykład, powinien znajdować się pod adresem https://www.domain.com/robots.txt i powinien informować roboty, aby nie wchodziły na tę stronę.

Ważne jest również, aby upewnić się, że nazwa Twojego pliku to robots.txt. Jeśli nazwa nie jest poprawnie napisana, plik nie zadziała.

Przejmij kontrolę

Masz większą kontrolę nad SEO swojej witryny, niż myślisz.

Ogólnie rzecz biorąc, to prawda. Możesz wybrać, które crawlery i indeksatory mogą widzieć i indeksować Twoją witrynę na poziomie strony. Istnieje plik robots.txt, który może być użyty, aby zapobiec ponownemu wystąpieniu tego problemu. W katalogu głównym Twojej witryny znajduje się prosty plik tekstowy o nazwie robots.txt. Ten plik informuje roboty sieciowe, aby nie czytały Twojej witryny. Roboty mogą wykorzystać te informacje do poprawy swoich wyników wyszukiwania, aby były bardziej precyzyjne.

Ponieważ nie jest to rozwiązanie ostateczne, odkryłeś, że to świetny sposób, aby Twoja witryna była widoczna dla wyszukiwarek. Jeśli chcesz, aby wyszukiwarki polubiły Twoją witrynę, musisz zrobić dobre pierwsze wrażenie. W odpowiedni sposób, użycie robots.txt może pomóc w SEO.

Więc jak się do tego zabrać? Jaki jest cel istnienia tego pliku? Czego nigdy nie powinieneś robić? Odpowiedzi na te pytania znajdziesz na następnej stronie.

Powód używania Robots.txt

Robots.txt to plik, którego wyszukiwarki używają do określenia, które strony Twojej witryny indeksować, a które wykluczyć z wyników wyszukiwania. Na przykład, jeśli w pliku Robots.txt powiesz, że Twoja strona z podziękowaniem nie powinna być dostępna dla wyszukiwarek, ta strona nie pojawi się w wynikach wyszukiwania i nie będzie dostępna dla osób szukających jej w sieci. Niektóre strony Twojej witryny muszą być ukryte przed wyszukiwarkami zarówno ze względu na prywatność, jak i ranking. Jest to ważne dla obu.

Gdzie znaleźć plik Robots?

Get in control

Jeśli masz witrynę, plik robots.txt znajduje się w jej katalogu głównym. Wejdź do swojego cPanelu FTP i poszukaj go w publicznym obszarze HTML Twojego konta. Te pliki nie zajmują dużo miejsca. Mogą mieć zaledwie kilkaset bajtów. Jeśli nie możesz go znaleźć, będziesz musiał go utworzyć.

Jak działa Robots.txt

Gdy wyszukiwarki chcą indeksować Twoją witrynę, wysyłają małe programy zwane „pająkami” lub „robotami”, które przeszukują Twoją witrynę i zwracają dane do wyszukiwarek. Dyrektywy „Disallow” w robots.txt instruują wyszukiwarki i inne programy, aby nie szukały określonych stron w Twojej witrynie, które określisz w poleceniu. W pliku robots.txt można znaleźć następujące polecenia:

uniemożliwi wszystkim robotom wyszukiwarek dostęp do następującej strony w Twojej witrynie: http://www.yoursite.com/thankyou

Przed poleceniem disallow znajduje się polecenie: „User-agent: *”. Część User-agent określa, którego robota chcesz zablokować.

„User-agent: Googlebot”. To polecenie uniemożliwiłoby dostęp do witryny tylko robotom Google; inne nadal miałyby do niej dostęp: http://www.yoursite.com/thankyou

Jednak używając znaku „*”, określasz, że poniższe polecenia odnoszą się do wszystkich robotów. Twój plik robots.txt znajdowałby się w głównym katalogu Twojej witryny. Na przykład: http://www.yoursite.com/robots.txt

Jak stworzyć plik Robots.txt

How to Put Together a Robots.txt File

Każdy może stworzyć ten prosty plik tekstowy. Potrzebujesz edytora tekstu, takiego jak Notatnik, aby napisać swój tekst. Otwórz nowy plik tekstowy i zapisz go jako „robots.txt”, a następnie wpisz w nim treść. Gdy jesteś w swoim cPanelu, przejdź do folderu publicznego HTML i kliknij na niego. Zacznij od upewnienia się, że plik już tam jest.

Jeśli wszystko wygląda dobrze, gotowe. Tylko osoba, która jest właścicielem pliku, powinna mieć możliwość jego przeglądania i zmiany. Aby plik działał, musi mieć uprawnienia „0644”.

Jeśli nie, kliknij prawym przyciskiem myszy plik i wybierz „zmień uprawnienia”. I gotowe! Istnieje plik robots.txt, który zawiera instrukcje dla robotów. Składnia Robots.txt. Plik robots.txt ma wiele sekcji „dyrektyw” dla każdego skonfigurowanego user agenta. Każda z nich zaczyna się od nazwy user agenta. Każdy bot crawlujący jest identyfikowany przez swój identyfikator user agenta zgodnie z kodem.

Istnieją dwa sposoby, aby to zrobić: Dopóki używasz symbolu wieloznacznego, możesz jednocześnie celować we wszystkie wyszukiwarki. Możesz wybrać, które wyszukiwarki chcesz targetować. Kiedy uruchomisz bota crawlującego, przejdzie on do tych części witryny, które są najmniej zadowolone z tego. Będzie to wyglądać tak:

Dyrektywa User-Agent

Pierwsze kilka linii każdego bloku zawiera user-agent, który identyfikuje bota. Na przykład: jeśli chcesz powiedzieć Googlebotowi, co ma robić, zaczniesz od:

User-agent: Googlebot Z reguły wyszukiwarki szukają najbardziej trafnych informacji.

Dopóki masz dyrektywę Googlebot-Video i Bingbot. User agent „Bingbot” postąpi zgodnie z instrukcjami. Możesz oczekiwać bardziej precyzyjnych instrukcji od Googlebot-Video.

Poniżej wymieniono najczęściej używane roboty wyszukiwarek.

Dyrektywa Disallow

Boty nie będą miały dostępu do niektórych części Twojej witryny, jeśli włączysz tę funkcję. Nic nie powstrzymuje botów przed podróżowaniem po Internecie i dostępem do dowolnych stron internetowych, które im się podobają.

Dyrektywa Sitemap (XML Sitemaps)

Ten meta tag informuje wyszukiwarki, gdzie znajduje się Twoja sitemapa. Musisz wysłać je do Google Search Console , aby zostały znalezione. Warto korzystać z każdego z tych narzędzi, ponieważ mogą one wiele nauczyć Cię o Twojej witrynie.

Gdy szybkość jest ważna, użyj dyrektywy o nazwie „sitemap”.

Dyrektywa Crawl-Delay

Jeśli chcesz nieco spowolnić Yahoo, Bing i Yandex podczas ich crawl’owania, możesz umieścić dyrektywę o nazwie „crawl-delay”. Poniższe nastąpi, gdy umieścisz tę linię w swoim bloku:

Crawl-Delay:10 Poczekaj dziesięć sekund przed crawl’owaniem.

Gdy wyszukiwarka jest skonfigurowana, można ją ustawić tak, aby czekała dziesięć sekund przed crawl’owaniem witryny lub dziesięć sekund przed powrotem do witryny po crawl’owaniu. Efekt jest prawie taki sam, ale nieco inny w zależności od używanej wyszukiwarki. Po crawl’owaniu, Crawl-delay o wartości 1 oznacza, że wyszukiwarki natychmiast rozpoczną crawl’owanie witryny.

Używanie Google Search Console do tworzenia Robots.txt

Wybierz „crawler access” z paska menu, aby szybko utworzyć plik robots.txt za pomocą bezpłatnego konta Google Search Console. Aby utworzyć podstawowy plik Robots.txt, wybierz „generate robots.txt”, gdy znajdziesz się na stronie.

W sekcji „action” wybierz „block”, a w sekcji „User-agent” wybierz, których robotów nie chcesz widzieć na swojej stronie. Wybierz „directories and files” i wpisz nazwy folderów, które chcesz ukryć. „http://www.yoursite.com” nie powinno być częścią tej strategii w żaden sposób. Na przykład, jeśli nie chcesz, aby ludzie widzieli poniższe strony, możesz:

  • http://www.yoursite.com/thank-you
  • http://www.yoursite.com/free-stuff
  • http://www.yoursite.com/private

W Google Search Console wpisz następujące dane w polu „directories and files”:/thank-you

  • /free-stuff
  • /private

Po wprowadzeniu tych danych dla wszystkich robotów i kliknięciu „add a rule”, ostateczny plik Robots.txt wyglądałby tak.

Po wprowadzeniu tych danych dla wszystkich robotów i kliknięciu „add a rule”, ostateczny plik Robots.txt wyglądałby tak.

Istnieje domyślne polecenie „Allow”, jeśli chcesz zrobić wyjątek i zezwolić robotowi na dostęp do witryny, którą zablokowałeś poleceniem.

Using Google Webmaster Tools to create Robots.txt

Googlebot może uzyskać dostęp do katalogu zdjęć Twojej witryny tylko wtedy, gdy polecenie zakazu zostanie umieszczone obok niego. Następnie kliknij „download”, aby pobrać plik Robots.txt. Kliknij „download”, gdy wybierzesz strony i pliki, które chcesz zablokować, kliknij „download”.

Zainstaluj swój plik Robots.txt

Plik o nazwie „Robots.txt” można teraz dodać do głównego katalogu (www) obszaru CNC Twojej witryny. Oznacza to, że można go teraz znaleźć. Filezilla to dobry klient FTP do tego celu. Zleć wykonanie pliku robots.txt programiście internetowemu po przekazaniu mu listy URL-i, które powinny być zablokowane przed crawl’owaniem. Jest to dodatkowa opcja. W tym przypadku wykwalifikowany programista internetowy wykona pracę w mniej niż godzinę.

Noindex vs. Disallow

Wiele osób nie wie, której reguły użyć w pliku robots.txt swojej witryny w pasku nawigacji. Dzieje się tak, ponieważ powody podane w poprzedniej sekcji sprawiają, że reguły noindex w Robots.txt przestają działać.

Twoja witryna może mieć meta tag „noindex” , którego możesz użyć, aby powstrzymać wyszukiwarki przed indeksowaniem jednej z Twoich stron internetowych. Z reguły ten tag pozwoli robotom sieciowym odwiedzić Twoją witrynę, ale także poinformuje wyszukiwarki, aby nie indeksowały Twojej strony.

Na dłuższą metę może nie być tak skuteczny jak tag noindex. Reguła disallow może nie być tak skuteczna jak ten tag. To dobrze, ponieważ robots.txt powstrzymuje wyszukiwarki przed skanowaniem Twojej strony. Nie powstrzymuje ich przed indeksowaniem Twojej strony na podstawie informacji z innych stron i witryn, co jest dobre.

Ważne jest, aby pamiętać, że nawet jeśli wyłączysz i dodasz tag noindex do strony, roboty nie będą wiedziały o tym tagu i mogą nadal indeksować stronę, nawet jeśli to zrobisz.

Mistakes you will want to avoid

Błędy, których chcesz uniknąć

Dowiedziałeś się o wielu rzeczach, które możesz zrobić z plikiem robots.txt i jak go używać. W tej części omówimy każdy problem bardziej szczegółowo i pokażemy, jak, jeśli zostanie użyty niewłaściwie, może mieć zły wpływ na SEO.

Nie możesz używać pliku robots.txt ani tagu „noindex”, aby uniemożliwić ludziom dostęp do użytecznych informacji, które chcesz upublicznić. W przeszłości widzieliśmy wiele takich sytuacji w SEO. Wszystkie miały zły wpływ na wyniki. Ważne jest, aby upewnić się, że wszystkie Twoje strony internetowe mają tagi i reguły noindex i noblock, zanim zostaną opublikowane.

Jeśli używasz dyrektyw crawl-delay, nie powinieneś ich używać zbyt często. Dzieje się tak, ponieważ ograniczają one liczbę stron, które boty mogą przeglądać. Z drugiej strony, posiadanie dużej witryny może utrudnić Ci uzyskanie wysokich rankingów i zdobycie wielu odwiedzających.

Aby upewnić się, że plik robota jest poprawnie odczytywany, musisz użyć poprawnego formatu Robots.txt dla swojego pliku. Wszystkie litery powinny być małe, gdy znajduje się w pliku robota. Powinien nazywać się „robots.txt”. Nie zadziała, jeśli nie.

Zakończenie – Przetestuj swój Robots.TXT

Twój plik powinien teraz zostać sprawdzony, aby upewnić się, że działa poprawnie. Istnieje pole testowe robots.txt, którego możesz użyć w Google Search Console, ale tylko jeśli używałeś starej Google Search Console, która nie jest już używana. Tester robots.txt nie działa już z powodu najnowszej GSC (Google ciężko pracuje nad dodawaniem nowych funkcji do GSC, więc być może w przyszłości będziemy mogli zobaczyć tester Robots.txt w głównej nawigacji).

Jeśli chcesz dowiedzieć się więcej o tym, co może zrobić tester Robots.txt, przejdź do strony pomocy Google. Istnieje inne przydatne narzędzie:

Wybierz projekt z rozwijanego menu po prawej stronie. Na przykład, możesz pracować nad stroną internetową swojej firmy lub innym projektem.

Aby zastąpić stary plik robots.txt tym, który właśnie utworzyłeś, musisz najpierw usunąć wszystko z pola. Aby rozpocząć test, kliknij „Test”.

Wartość „Test” powinna zostać zmieniona na „Allowed”. To zapewni, że Twój plik robots.txt działa poprawnie.

Upewniając się, że Twój plik robots.txt jest poprawny, możesz poprawić wydajność swojej witryny w wyszukiwarkach i user experience swoich odwiedzających jednocześnie. Łatwiej jest kontrolować, co ludzie widzą, gdy szukają czegoś na Twojej stronie, jeśli roboty mogą spędzać dni na jej przeglądaniu i indeksowaniu.

Często zadawane pytania

Powiązane artykuły

Jak używać pliku Robots.txt dla SEO · BlogDrip