Paano gamitin ang robots.txt para sa SEO
Alamin kung ano ang kinokontrol ng robots.txt, paano magsulat ng tamang rules, i-verify ang behavior gamit ang curl at DevTools, at iwasan ang mga karaniwang SEO mistakes.

Ano ang sakop ng gabay na ito
Ipinaliliwanag ng post na ito kung ano ang kinokontrol at hindi kinokontrol ng robots.txt, ipinapakita ang tamang syntax at mga praktikal na halimbawa, nagbibigay ng mga command-line checks na maaari mong patakbuhin, at naglilista ng troubleshooting steps para makabawi mula sa karaniwang pagkakamali. Makakakuha ka rin ng verification tips na gumagana sa 2026 search environments (mobile-first indexing ay default ng Google mula July 2024 at inalis ng Google ang traditional cached pages noong early 2024).
Ano ang robots.txt at ano ang kinokontrol nito
robots.txt ay isang plain text file sa root ng site na nagsasabi ng crawling instructions sa mga well-behaved web robots. Bahagi ito ng Robots Exclusion Standard. Gamitin ang file para sabihan ang crawlers kung alin sa mga path ang maaari nilang i-fetch; kinokontrol nito ang crawling, hindi ang indexing o ranking.
Mga mahalagang pagkakaiba na dapat tandaan:
Crawling vs indexing vs ranking — ang robots.txt ay nakaapekto sa crawling (kung ano ang kino-fetch ng agent). Ang isang URL na na-block mula sa crawling ay maaari pa ring ma-index kung may ibang pages na nagli-link dito at pinili ng search engine na i-index ang URL kahit hindi na-fetch ang content.
Ang robots.txt ay advisory — susundin lang ito ng mga compliant na crawlers. Ang malicious bots, spam harvesters, at ilang scanners ay maaaring i-ignore ito.
Hindi pinapalitan ng robots.txt ang access controls. Gumamit ng HTTP authentication, password protection, o server-side controls para sa private content.
Saan dapat ilagay ang robots.txt at mga pangunahing patakaran
Dapat i-serve ang robots.txt mula sa site root sa eksaktong host at protocol kung saan aplikado ang mga patakaran. Mga halimbawa ng magkakaibang lokasyon: https://example.com/robots.txt at https://sub.example.com/robots.txt. Hindi mo pwedeng ilagay ang robots.txt sa subfolder at asahan na makokontrol nito ang buong domain.
Para sa convenience at mga halimbawa sa gabay na ito, ang canonical test path ay http://www.yoursite.com/robots.txt.
robots.txt syntax at mga karaniwang directives
Ang minimal na robots.txt ay gumagamit ng mga directive na naka-group ayon sa user-agent. Case-insensitive ang mga linya para sa directive names. Ang mga halimbawa sa ibaba ay gumagamit ng standard tokens na sinusuportahan ng karamihan sa major crawlers:
I-block lahat ng crawlers mula sa isang directory:
User-agent: *
Disallow: /private/
Payagan ang isang partikular na file habang dine-disallow ang buong directory (kapaki-pakinabang para sa Googlebot-style parsing):
User-agent: *
Disallow: /images/
Allow: /images/logo.png
Maaaring ideklara ang sitemaps sa robots.txt para ituro ang crawlers sa iyong XML sitemap:
Sitemap: http://www.yoursite.com/sitemap.xml
Pattern matching: ang mga major search engines sinusuportahan ang asterisk (*) wildcard at ang end-of-string dollar ($) sa robots.txt patterns. Ang non-standard na Crawl-delay directive ay ini-ignore ng ilang engines (hindi sinusuportahan ng Google ang Crawl-delay).
Mga praktikal na halimbawa
1) Payagan ang lahat ng crawlers na i-fetch ang lahat (default na ligtas na pagpipilian):
User-agent: *
Disallow:
2) I-block ang isang crawler (hal. i-disallow ang isang partikular na agent mula sa lahat ng content):
User-agent: BadBot
Disallow: /
3) Pigilan ang crawlers mula sa pag-fetch ng mga resources na kailangan para sa rendering (karaniwang pagkakamali — tingnan ang troubleshooting):
Disallow: /static/js/
Ang pag-block ng CSS/JS ay maaaring pumigil sa Google na makita ang page mo tulad ng nakikita ng users. Dahil ginagamit ng Google ang mobile version bilang pangunahing base para sa crawling and indexing at sine-evaluate ang Core Web Vitals mula sa rendered page, huwag i-block ang mga resource na kailangan para sa rendering.
Paano i-verify at i-troubleshoot ang robots.txt
Mga basic checks na pwede mong patakbuhin mula sa labas ng site:
I-fetch ang laman ng file: curl http://www.yoursite.com/robots.txt — ibinabalik nito ang file content na makikita ng crawler.
Suriin lang ang headers: curl -I http://www.yoursite.com/robots.txt — beripikahin ang HTTP status (200 vs 4xx/5xx) at Content-Type. Nagbabalik lang ng response headers ang -I.
Tingnan kung paano ito tinatanggap ng browsers: open https://www.yoursite.com/robots.txt sa browser at i-confirm na pareho ang content tulad ng curl.
I-inspect ang server logs para sa totoong crawler requests papunta sa /robots.txt at para sa Googlebot o ibang agents na nagtatangkang i-fetch ang mga blocked pages — ang logs ang pinaka-reliable na third-party signal ng crawler behavior.
Mga checks na dapat mong patakbuhin kapag pag-aari mo ang property:
Gamitin ang URL Inspection ng Google Search Console para sa indibidwal na pages para makita kung na-fetch o na-index na ng Google ang isang URL. Ang URL Inspection ang authoritative para sa properties na pag-aari mo.
Matapos baguhin ang robots.txt, i-monitor ang server logs at ang Performance report sa Search Console para kumpirmahin ang crawl behavior para sa mga importanteng pages.
Karaniwang palatandaan ng problema at ang dapat gawin
Aksidenteng na-block mo ang CSS/JS — sintomas: iba ang render ng pages para sa crawlers; Solusyon: alisin mula sa Disallow ang resource paths para ma-fetch ito ng crawlers.
robots.txt nagbabalik ng 404/5xx — sintomas: ilang crawlers ay maaaring ituring ang site na fully crawlable o pansamantalang itigil ang crawling; Solusyon: ibalik ang valid na robots.txt na nagbabalik ng 200 at tamang Content-Type.
Na-block mo ang buong host o protocol dahil nailagay ang robots.txt sa maling subdomain — sintomas: nawawala ang pages mula sa crawl logs; Solusyon: ilagay ang robots.txt sa tamang host (at i-check ang redirects).
Kung isang page ay na-block mula sa crawling pero lumalabas pa rin sa search results nang walang snippet, ibig sabihin na-index ang URL mula sa external signals kahit hindi na-fetch ang content. Para alisin ang ganitong mga URL mula sa results, gumamit ng tamang HTTP authentication, i-remove ang page, o mag-serve ng noindex directive sa mismong page (ang noindex ay nangangailangan na i-fetch ng crawler ang page, kaya huwag itong i-block sa robots.txt kung balak mong gumamit ng noindex).
Checklist: ligtas na i-deploy at i-review ang robots.txt
Ilagay ang robots.txt sa site root para sa eksaktong host at protocol.
I-test ang file gamit ang curl (body at headers) at sa browser.
Iwasang i-block ang CSS, JavaScript, o iba pang assets na ginagamit para sa rendering maliban kung sadyang gusto mong pigilan ang rendering ng crawlers.
I-anunsyo ang sitemaps sa robots.txt para tulungan ang crawlers madiskubre ang iyong indexable URLs.
I-monitor ang server logs at Search Console para sa crawl behavior pagkatapos ng pagbabago.
Kung kailangan mo ng step-by-step reference, basahin ang Gabay sa Technical SEO para sa mas malawak na context tungkol sa crawlability at Core Web Vitals.
Karagdagang konsiderasyon sa 2026
Dahil ginagamit ng Google ang mobile version bilang pangunahing base para sa crawling at indexing at dahil inalis ang traditional cached pages noong early 2024, ang content na sadyang itinatago mula sa crawlers gamit ang robots.txt ay maaaring mas maliit ang tsansang lumabas sa modernong AI-driven overviews at Search Generative Experience features. Kung gusto mong magamit ang content sa AI overviews o para sa rich SERP features, payagan ang crawlers na i-fetch at i-index ang page at gumamit ng structured data kung naaangkop.
FAQ
Saan dapat i-host ang robots.txt?
Dapat ma-access ang robots.txt sa root ng eksaktong host at protocol na nais mong kontrolin, halimbawa https://www.example.com/robots.txt. Hindi nagkakascascade ang rules mula sa parent domain papunta sa subdomains.
Maaari bang alisin sa search results ang isang page sa pamamagitan ng pag-block nito sa robots.txt?
Ang pag-block ng page mula sa crawling ay hindi palaging pumipigil sa URL na lumitaw sa search results kung may ibang pages na nagli-link dito. Para pigilan ang indexing, payagan ang page na ma-crawl at mag-return ng noindex directive o gumamit ng server-side access controls.
Gaano kabilis epektibo ang mga pagbabago sa robots.txt?
Regular na kine-fetch ng crawlers ang robots.txt; walang isang universal na fixed timeframe. Para kumpirmahin ang pagbabago, tingnan ang server logs para sa bagong requests sa /robots.txt at i-monitor ang Search Console at crawl logs para sa pagbabago sa behavior.
Dapat ko bang gamitin ang robots.txt para itago ang private content?
Hindi. Ang robots.txt ay public file at hindi dapat pagtiyagaan bilang proteksyon ng sensitive data. Gumamit ng authentication, alisin ang content mula sa public paths, o mag-serve ng tamang HTTP response codes para pigilan ang access.
Paano ko papayagan lamang ang isang crawler (hal. Googlebot) na ma-access ang site ko?
Maaari kang maglagay ng user-agent group para sa isang partikular na crawler at mas restrictive na groups para sa iba, halimbawa:
User-agent: Googlebot
Disallow:
User-agent: *
Disallow: /
Tandaan na umaasa ito sa user-agent strings at mga well-behaved crawlers; hindi ito secure na access control.
Kaugnay na artikulo

Checklist ng On-page SEO para pataasin ang ranggo at UX
Isang praktikal na on-page SEO checklist na may technical checks, content, UX, at verification steps na pwede mong patakbuhin ngayon.

Praktikal na SEO tips para tumaas ang search rankings
Agad magagamit, pangmatagalang SEO strategies: mga keyword, on-page fundamentals, teknikal na pag-aayos, gabay sa link building, at mga hakbang sa pag-verify na magagamit mo ngayon.

Best practices sa SEO headings
Paano i-structure ang H1–H3 para maging malinaw, accessible, at magbigay ng consistent crawl/index signals.

Mga Hakbang sa Pagbuo ng Organic Traffic Pipeline
Step-by-step na gabay para bumuo ng repeatable organic traffic pipeline: ihanay ang content sa user intent, ayusin ang technical blockers, palakasin ang distribution, at siguraduhing mai-index.

FAQ schema: Mga kailangan mong malaman
Praktikal na gabay sa FAQ schema: ano ito, paano mag-add ng JSON-LD sa mga page mo, testing steps, at mga karaniwang pagkakamali na iwasan.

Crawling at Indexing: Gabay para matuklasan ng search engine ang mga pahina mo
Mga konkreto at praktikal na hakbang para masiguro na makikita, ma-render, at ma-index ng search engines nang tama ang mga importanteng pahina mo.

Robots.txt para sa SEO: epektibong kontrol ng crawling
Matutunan kung paano gamitin ang robots.txt para gabayan nang ligtas ang crawlers, iwasan ang mga pagkakamali sa indexing, beripikahin ang behavior gamit ang curl at logs, at mag-apply ng practical examples sa production sites.

Technical SEO audit: alamin ang mga isyung humahadlang sa search
Isang praktikal, step-by-step technical SEO audit na tumutuklas ng mga problema sa crawl, render, index, at performance, at nagpapakita kung paano i-verify at i-prioritize ang mga pag-aayos.
