Skip to content
Hanap

Robots.txt: ano ito at paano ito gumagana

Ang robots.txt ay isang plain-text file na inilalagay sa root ng website na nagdedeklara ng mga patakaran sa pag-crawl para sa web crawlers (User-agent, Disallow, Allow, Sitemap). Kinokontrol nito ang crawling behavior at maaaring makaapekto sa indexation pero hindi direktang ranking.

Robots.txt: What It Is and How It Works

Ano ang robots.txt?

Ang robots.txt (Robots Exclusion Protocol) ay isang plain-text file na nasa root ng host — e.g. https://example.com/robots.txt — na nagbibigay ng simpleng instruksiyon para sa pag-crawl sa mga user-agent (web crawlers). Pampubliko at machine-readable ito; hindi ito nag-a-authenticate o nagtatago ng content. Binabasa ng mga crawler ang robots.txt para malaman kung aling mga path ang nais ng may-ari ng site na iwasan o bigyang-priyoridad.

Bakit mahalaga ang robots.txt para sa SEO

Kinokontrol ng robots.txt ang crawling. Ang crawling ay ang yugto ng pagtuklas at pagkuha kung paano mga search engine nakikipag-interact sa site mo; kung ang crawler ay hinaharangan sa pagkuha ng isang URL, maaaring hindi nito makita ang on-page directives (tulad ng meta robots) o ang content ng pahina na kailangan para ma-index. Ibig sabihin, maaaring makaapekto ang robots.txt nang hindi direkta sa indexation. Hindi nito direktang tinutukoy ang ranking order — maraming signals ang ginagamit para sa ranking pagkatapos ma-index. Gamitin ang robots.txt para protektahan ang server resources, iwasan ang pag-crawl ng duplicated o internal tooling na mga pahina, at siguraduhing makaka-access ang crawlers sa mga assets na kailangan para sa tamang rendering.

Paano gumagana ang robots.txt

Kinukuha ng isang crawler ang /robots.txt bago ito humiling ng ibang mga pahina sa parehong host at ina-aplay ang unang tumutugmang User-agent stanza at ang mga directive nito. Kadalasang sinusuportahan ng malalaking crawler ang mga directive na User-agent, Disallow, Allow at Sitemap. Nag-iiba ang suporta para sa pattern matching at karagdagang directives depende sa crawler — kinikilala ng Google ang mga pattern tulad ng * at $ at iginagalang ang precedence rules ng Allow/Disallow ayon sa dokumentasyon nito.

Karaniwang directives at mga halimbawa

Isang minimal na halimbawa ng robots.txt:

User-agent: *
Disallow: /private/
Allow: /public/
Sitemap: https://example.com/sitemap.xml

Tandaan: ilagay ang robots.txt sa site root. Kung ang robots.txt ay nagbabalik ng HTTP 404, itinuturing ito ng karamihan sa mga crawler bilang 'no restrictions'; kung hindi ito makuha o nagbabalik ng server errors, iba-iba ang pag-uugali ng crawler — mag-test at mag-monitor para maiwasan ang aksidenteng malawak na pag-block. Para sa Google-specific na pag-uugali at mga halimbawa, tingnan ang Google’s robots.txt documentation.

Mga uri ng robots.txt

Iba't ibang pattern ng robots.txt ang ginagamit depende sa layunin. Nasa ibaba ang mga karaniwang approach kasama ang maikling mga pakinabang at kahinaan.

- Site-wide block (Disallow: /)
Pros: agad na pinipigilan ang crawler na ma-access ang buong host.
Cons: pinipigilan nito ang crawlers na i-fetch ang content at assets; maaari nitong pigilan ang indexation ng public pages.

- Path-specific rules (Disallow: /private/)
Pros: madaling i-exclude ang internal o admin paths.
Cons: pampubliko ang robots.txt; huwag ilista ang sensitibong paths na inaasahan mong panatilihing lihim.

- User-agent specific rules (User-agent: Googlebot)
Pros: maaring i-tailor ang pag-uugali para sa partikular na crawlers.
Cons: mas dumadami ang maintenance; may ilang crawlers na hindi sumusunod sa non-standard directives.

Paano magsimula sa robots.txt

1) Tukuyin kung ano ang kailangan protektahan mula sa crawling (mga server-heavy na area, staging paths) at kung ano ang dapat manatiling available sa crawlers (public pages, CSS/JS na kailangan para sa rendering).
2) Gumawa ng plain-text file na pinangalanang robots.txt sa site root. I-test locally at sa staging host bago i-deploy sa production.
3) I-deploy at i-verify gamit ang teknikal na checklist sa ibaba. Panatilihing simple ang file at idokumento ang anumang User-agent-specific na rules para maintindihan ng mga susunod na magmementena ang layunin.

Karaniwang pagkakamali sa robots.txt

• Pag-asa sa robots.txt para itago ang sensitibong data — pampubliko ang robots.txt at hindi dapat gamitin para sa security. Gumamit ng authentication o tanggalin ang resource.
• Pag-block ng CSS/JS na kailangan para sa rendering — maaari nitong masira kung paano iniintindi ng mga search engine ang layout at content ng pahina.
• Pag-block ng mga pahinang may meta noindex — kung hinaharangan ang Googlebot sa pagkuha ng pahina, hindi nito makikita ang meta noindex directive.
• Paglalagay ng robots.txt sa ilalim ng subpath (hal. /blog/robots.txt) — ang mga crawler ay naghahanap lamang ng root-level file.
• Syntax errors at maling HTTP status codes — siguraduhing ang file ay isinaserve na may naaayong 200 response.

Pag-verify ng robots.txt: teknikal na checklist

Gamitin ang mga check sa ibaba matapos i-deploy o i-update ang robots.txt. Bawat item ay nagsasabi kung saan magve-verify at ang malinaw na kriterya ng pagpasa.

**File reachable** — saan i-verify: curl -I https://example.com/robots.txt — pumapasa kapag ang request ay nagbalik ng HTTP 200 at ang file ay ang inaasahang content.
**Correct directives** — saan i-verify: curl https://example.com/robots.txt o view-source sa browser — pumapasa kapag ang mga linya ng User-agent/Disallow/Allow ay tumutugma sa iyong policy.
**Not blocking rendering assets** — saan i-verify: Chrome DevTools Network and Coverage o pag-fetch gamit ang crawler simulator — pumapasa kapag ang CSS/JS na kailangan para sa rendering ay hindi naka-disallow.
**Google-block check (own site)** — saan i-verify: Google Search Console URL Inspection — pumapasa kapag ipinapakita ng Inspection na ang URL ay crawlable at hindi "Blocked by robots.txt".
**External crawl check** — saan i-verify: gumamit ng curl o third-party crawler para humiling ng blocked URL at i-confirm na nagbalik ito ng 200 para sa pahina ngunit tinanggihan ang access ng crawler — pumapasa kapag ang pag-uugali ay tumutugma sa inaasahan.
**Sitemap presence** — saan i-verify: nilalaman ng robots.txt at Google Search Console Sitemaps report — pumapasa kapag ang sitemap URL ay nakalista sa robots.txt o nasumite sa Search Console at tinanggap.

Mga tools at commands para i-verify ang robots.txt

curl (headers only): curl -I https://example.com/robots.txt — nagbabalik ng HTTP status at response headers. curl (full file): curl https://example.com/robots.txt — ipi-print ang content para sa inspeksyon. Chrome DevTools: buksan ang file URL o tingnan ang page network requests para i-confirm na allowed ang assets. Google Search Console URL Inspection: para sa URL na pag-aari mo, nire-report ng tool kung nakikita ng Google ang pahina at kung ito ay na-block ng robots.txt.Bing Webmaster ToolsSite Explorer ay maaaring ipakita kung paano hinawakan ng Bing ang file para sa mga site na na-verify mo. Gamitin ang server logs para i-confirm kung aling mga user-agents ang humiling ng robots.txt at gaano kadalas.

Para sa opisyal at may-awtoridad na detalye tungkol sa sinusuportahang directives at precedence, tingnan ang dokumentasyon sa https://developers.google.com/search/docs/advanced/robots/intro

Basahin ang Technical SEO Guide

Mga madalas na tanong

Q: Kung i-block ko ang isang pahina gamit ang robots.txt, mawawala ba ito sa search results?
A: Ang pag-block gamit ang robots.txt ay pumipigil sa crawlers na i-fetch ang pahina, kaya karaniwang hindi nila makikita ang on-page signals. Maaari pa ring lumabas ang naka-block na pahina sa search results batay sa external signals (URL-only entry), pero wala itong cached snippet o rendered content. Para i-request ang removal, gamitin ang index removal tools para sa mga URL na pag-aari mo; para kontrolin ang indexing via metadata, tiyaking crawlable ang pahina para makita ng crawlers ang meta robots:noindex directive.

Q: Maaari ko bang gamitin ang robots.txt para i-block ang specific na bots?
A: Maaari kang magdagdag ng User-agent-specific stanzas para i-target ang kilalang crawlers. Gayunpaman, robots.txt ay isang honor system: sinusunod ito ng mga well-behaved crawlers, ngunit maaaring balewalain ito ng mga malicious bots. Para sa mas matibay na proteksyon, gumamit ng authentication, IP filtering, o firewall.

Q: Dapat ba kong isama ang sitemap sa robots.txt?
A: Ang paglalagay ng Sitemap: https://example.com/sitemap.xml sa robots.txt ay isang maginhawang paraan para ituro ang crawlers sa iyong sitemap; i-submit din ang sitemaps direkta sa Google Search Console para sa mga site na kontrolado mo.

Q: Nag-aapply ba ang robots.txt per protocol at host?
A: Oo. Kinukuha ang robots.txt per host at protocol: https://example.com/robots.txt ay hiwalay sa http://example.com/robots.txt o https://sub.example.com/robots.txt. Ilagay ang file sa parehong scheme at host na ginagamit ng site mo.

Q: Paano nakakaapekto ang mobile-first indexing sa robots.txt?
A: Ginagamit ng Google ang mobile version bilang pangunahing base para sa crawling at indexing. Simula July 2024, kinukuha ng Google ang mga site para sa Search gamit ang Googlebot Smartphone bilang default. Siguraduhing hindi aksidenteng hinaharangan ng robots.txt ang mga resources sa mobile-served pages na kailangan para sa tamang rendering at indexing.

Q: Saan ako makakahanap ng opisyal na patnubay?
A: Sumangguni sa Google's robots.txt documentation sa https://developers.google.com/search/docs/advanced/robots/intro at sa mga resources ng Schema.org at W3C para sa kaugnay na mga practice sa crawling at indexing.

Palakasin ang authority gamit ang quality backlinks

Mga Kaugnay