Skip to content
Hanap

Robots.txt para sa SEO: epektibong kontrol ng crawling

Matutunan kung paano gamitin ang robots.txt para gabayan nang ligtas ang crawlers, iwasan ang mga pagkakamali sa indexing, beripikahin ang behavior gamit ang curl at logs, at mag-apply ng practical examples sa production sites.

Robots.txt SEO: Control Crawling Efficiently

Ano ang kayang gawin ng robots.txt — at ang mga hindi nito kayang gawin

File na robots.txt ay isang plain-text na file na nilalagay sa root ng site (https://example.com/robots.txt). Ang tungkulin nito ay makitid: nagbibigay ito ng crawling instructions sa mga well-behaved na crawler. Gamitin para bawasan ang unnecessary fetches sa low-value na areas at para pagbutihin ang crawl efficiency; huwag umasa rito para kontrolin ang indexation o itago ang sensitive na content.

Kinokontrol ang crawling, hindi ang indexation

Ang Disallow directive ay pumipigil sa mga compliant na crawler na i-fetch ang isang URL path. Kung ang isang page ay na-block mula sa crawling, mga search engine ay maaari pa ring i-index ang URL nito base sa external signals (hal., links) pero hindi nila makikita ang HTML ng page o ang meta robots tags. Para ma-prevent ang indexing nang maaasahan, hayaan ang crawling para mabasa ng crawler ay makapagbasa ng meta robots noindex tag o gumamit ng X-Robots-Tag response header na may noindex sa mismong resource.

Pampubliko, advisory, at hindi isang security control

Ang robots.txt ay pampubliko at nagsisilbing advisory: kahit sino ay maaaring basahin ito sa /robots.txt, at ang mga malicious na crawler ay pwedeng i-ignore ang mga direktiba nito. Huwag ilista ang mga secret o private na path sa robots.txt; ituring ito bilang crawl-control na dokumento, hindi bilang access-control na mekanismo.

Pangunahing syntax at karaniwang directives

Karamihan sa mga site ay gagamit ng maliit na set ng directives. Sinusuportahan ng specification at ng practical extensions na ginagamit ng major search engines ang basic patterns, wildcards at sitemap pointers. Panatilihing simple ang mga rules at idokumento ang intensyon sa comments kung maaari.

Pangunahing directives (mga halimbawa nasa literal na linya):

  • User-agent: <bot-name> — target ang isang crawler; gamitin ang User-agent: * para sa lahat ng crawler.
  • Disallow: /path/ — pigilan ang pag-fetch ng mga path sa ilalim ng /path/.
  • Allow: /path/file.js — hayagang payagan ang isang path sa ilalim ng disallowed na parent (sinusuportahan ng major engines).
  • Sitemap: https://example.com/sitemap.xml — itinuturo nito ang mga crawler sa iyong XML sitemap(s).
  • Wildcards: * (match any sequence) at $ (end-of-string) ay suportado sa practice ng major engines; gamitin nang maingat para sa mga query-parameter na pattern.
  • Non-standard directives: Crawl-delay and Host are recognized by some crawlers but are not part of the original standard — test behavior for the user-agents you care about.

Paano nakikipag-ugnayan ang robots.txt sa indexing at ranking

Ihiwalay ang crawling, indexing at ranking: ang robots.txt ay nakaapekto sa crawling stage (kung kukunin ba ng crawler ang isang URL). Kailangan ng crawler na basahin ang page content o meta/X-Robots-Tag para mag-index. Ang ranking ay isang downstream process na umaasa sa mga signal, ilan dito ay mula sa page content; kung hindi makuha ng crawler ang page, mawawala ang mga content-derived na signal.

Mga praktikal na kahihinatnan:

  • Kapag na-block ang page sa robots.txt ibig sabihin hindi makukuha ng search engine ang page para basahin ang meta robots noindex tags o structured data.
  • Kung ang isang importanteng resource (CSS/JS) ay na-block, mobile-first indexing at maaaring hindi makita nang tama ang page sa rendering; dahil ginagamit ng Google ang mobile version bilang pangunahing base para sa crawling and indexing, at dahil Googlebot Smartphone ang default crawler simula July 2024, payagan ang mga resource na kailangan para sa rendering sa mobile.

Verification: paano i-test kung ano ang nakikita ng mga crawler

I-verify ang accessibility at nilalaman ng robots.txt mula sa labas at kumpirmahin kung paano tumutugon ang site mo sa totoong crawler requests. Gumamit ng server logs, direct fetches at Search Console tools para sa mga page na pag-aari mo.

Mabilis na checks gamit ang curl

Para kunin ang HTTP response headers ng robots.txt (headers lang):

  • curl -I https://example.com/robots.txt — nagbabalik lang ng response headers; i-verify ang status code at Content-Type.

Para i-retrieve ang buong file bilang specific na user-agent (HTML at directives):

  • curl -A "Googlebot" https://example.com/robots.txt — ibinabalik ang file body gamit ang specified user-agent string.

Server logs at ebidensya ng totoong crawl

Suriin ang server logs para sa mga request sa /robots.txt at para sa crawler user-agents gaya ng Googlebot o Bingbot. Ipinapakita ng logs ang fetch frequency, response codes, at kung sinubukan ng mga crawler ang mga disallowed na URL. Para sa mga page na pag-aari mo, gamitin ang Search Console’s URL Inspection para makita ang crawl at index signals; para sa third-party pages, ang site: query ay nagbibigay ng indikasyon pero hindi ito definitive.

Karaniwang pagkakamali at paano ayusin

Iwasan ang mga madalas na error na ito kapag minamanage ang robots.txt.

  • Pagba-block ng CSS/JS na kailangan para sa rendering: solusyon — payagan ang mga path para sa assets na kailangan ng mobile rendering pipeline para ma-render nang tama ng Googlebot Smartphone ang mga page.
  • Pag-aakala na ang robots.txt ay mag-noindex ng URLs: solusyon — alisin ang Disallow para sa page at gumamit ng meta robots noindex o X-Robots-Tag header para makita ng search engines ang instruction.
  • Paglalagay ng sensitive na URL sa robots.txt: solusyon — huwag i-expose ang private paths sa robots.txt; protektahan ang mga ito gamit ang authentication at tamang server-side access controls.
  • Masyadong kumplikadong wildcard rules na hindi sinasadyang tumutugma sa valid na page: solusyon — i-test ang bawat pattern gamit ang sample URLs at idokumento ang intensyon sa comments, panatilihing mas specific hangga't maaari ang rules.

Inirerekomendang strategies para sa robots.txt

Gumamit ng conservative, testable na approach: panatilihing minimal ang robots.txt, ituro ang crawlers sa sitemaps, at mas piliin ang page-level meta/X-Robots-Tag controls para sa index management.

Praktikal na pattern:

  • Default allow plus sitemap: isama ang User-agent: * at isang Sitemap directive para mabilis ma-discover ng crawlers ang structure mo.
  • I-Disallow ang mga low-value query pages o internal search results, pero iwasang i-block ang mga parameter pattern na tumutugma rin sa canonical content; mas piliin ang parameter handling sa sitemap o via canonical tags.
  • Staging o development: i-block ang crawlers habang public ang staging, pero tanggalin o baguhin ang block bago mag-launch; huwag umasa sa robots.txt bilang tanging safeguard para sa pre-production assets.

Mga halimbawa na pwedeng i-adapt

Simpleng site na may sitemap

User-agent: *
Disallow:
Sitemap: https://example.com/sitemap.xml

Karaniwang CMS (payagan admin-ajax)

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.com/sitemap_index.xml

Staging block (public server pero hindi pa live)

User-agent: *
Disallow: /

Babala: dapat tanggalin ang staging blocks bago ang launch; siguraduhin ding i-secure ang staging gamit ang authentication para hindi aksidenteng ma-index ito ng search engines at third parties kung mabago ang robots file.

Pagpapanatili ng robots.txt sa malakihang site

Para sa malalaking site, ituring ang robots.txt bilang configuration artifact: ilagay ito sa source control, i-review ang mga pagbabago sa pull requests, at i-deploy kasabay ng site para tama ang environment-specific files sa staging at production. I-automate ang mga test na nagfe-fetch ng deployed robots.txt at nagva-validate ng rule syntax laban sa representative URLs.

Kung may pinapatakbo kang maraming subdomain, tandaan na host-specific ang robots.txt: ang mga rule sa example.com/robots.txt ay hindi naa-apply sa sub.example.com.

FAQ

Maaari bang pigilan ng robots.txt ang isang page na lumabas sa search results?

Hindi nang reliably. Maaaring pigilin ng robots.txt ang crawler mula sa pag-fetch ng page, pero maaaring i-index pa rin ng search engines ang URL base sa external links o ibang signals. Para mapigilan ang indexing, payagan ang crawling at gumamit ng meta robots noindex tag sa page o X-Robots-Tag: noindex response header para mabasa ng crawler ang instruction.

Paano ko iche-check na sinusunod ng Google ang robots.txt ko?

Mula sa labas, i-fetch ang https://example.com/robots.txt gamit ang curl para i-confirm ang file at status codes, suriin ang server logs para sa Googlebot requests sa file at sa mga page na inaasahan mong i-crawl, at gamitin ang Search Console’s URL Inspection para sa mga page na pag-aari mo upang makita ang crawl attempts at index status. Ang site: query ay maaaring magbigay ng pampublikong indikasyon pero hindi iyon definitive.

Dapat ko bang i-block ang URL parameters sa robots.txt?

Mag-ingat. Ang pagba-block ng parameterized URLs ay makakatipid ng crawl budget pero may panganib na maitago ang canonicalized o indexed content kung masyadong malawak ang patterns. Mas piliin ang canonical tags, parameter handling sa sitemaps, o server-side redirects kung naaangkop; i-test nang mabuti ang anumang pattern bago i-deploy.

Safe bang umasa sa Crawl-delay?

Ang Crawl-delay ay non-standard directive at iba-iba ang suporta nito depende sa crawler. Para sa mga site na kailangan ng crawl-rate control, mas piliin ang server-side rate limiting, robots meta tags para sa selective na mga page, o crawler-specific settings na available sa mga serbisyo tulad ng Bing Webmaster Tools . Laging i-test ang behavior para sa specific user-agents na tinatarget mo.

Kaugnay na artikulo