cara guna fail robots.txt untuk SEO
Ketahui apa yang dikawal oleh robots.txt, cara menulis peraturan yang betul, mengesahkan tingkah laku menggunakan curl dan DevTools, dan elakkan kesilapan SEO biasa.

Apa yang dibahas dalam panduan ini
Pos ini menerangkan apa yang robots.txt kawal dan apa yang ia tidak kawal, menunjukkan sintaks betul dan contoh praktikal, memberi pemeriksaan baris arahan yang anda boleh jalankan, serta menyenaraikan langkah penyelesaian masalah untuk memulihkan kesilapan biasa. Anda juga akan mendapat petua pengesahan yang berfungsi dalam persekitaran carian 2026 (pengindeksan berpandukan mudah alih ialah lalai Google sejak July 2024 dan Google mengalih keluar halaman cache tradisional pada awal 2024).
Apa itu robots.txt dan apa yang ia kawal
robots.txt ialah fail teks ringkas di akar laman yang menyampaikan arahan pengimbasan kepada robot web yang patuh. Ia sebahagian daripada Standard Pengecualian Robots. Gunakan fail ini untuk memberitahu crawler laluan yang mereka boleh ambil; ia mengawal crawling, bukan pengindeksan atau penarafan.
Perbezaan penting yang perlu diingati:
Pengimbasan vs pengindeksan vs penarafan — robots.txt menjejaskan pengimbasan (apa yang agen ambil). URL yang disekat daripada pengimbasan masih boleh diindeks jika halaman lain memaut kepadanya dan enjin carian memilih untuk mengindeks URL tanpa mengambil kandungannya.
robots.txt bersifat nasihat — hanya crawler yang mematuhi akan mengikutinya. Bot berniat jahat, pengumpul spam dan beberapa pengimbas mungkin mengabaikannya.
robots.txt tidak menggantikan kawalan akses. Gunakan pengesahan HTTP, perlindungan kata laluan, atau kawalan di sisi pelayan untuk kandungan peribadi.
Di mana robots.txt mesti diletakkan dan peraturan asas
robots.txt mesti disajikan dari akar laman pada hos dan protokol tepat yang peraturan itu terpakai. Contoh lokasi yang berbeza: https://example.com/robots.txt dan https://sub.example.com/robots.txt. Anda tidak boleh meletakkan robots.txt dalam subfolder dan mengharapkan ia mengawal keseluruhan domain.
Untuk kemudahan dan contoh dalam panduan ini, laluan ujian kanonik ialah http://www.yoursite.com/robots.txt.
Sintaks robots.txt dan arahan biasa
robots.txt minima menggunakan arahan yang dikelompokkan mengikut user-agent. Baris tidak peka huruf besar/kecil untuk nama arahan. Contoh di bawah menggunakan token standard yang disokong oleh kebanyakan crawler utama:
Sekat semua crawler dari sebuah direktori:
User-agent: *
Disallow: /private/
Benarkan fail tertentu walaupun menyekat direktori (berguna untuk analisis gaya Googlebot):
User-agent: *
Disallow: /images/
Allow: /images/logo.png
Sitemap boleh dinyatakan dalam robots.txt untuk menunjuk crawler kepada sitemap XML:
Sitemap: http://www.yoursite.com/sitemap.xml
Padanan corak: enjin carian menyokong wildcard asterisk (*) dan tanda dolar ($) bagi hujung rentetan dalam corak robots.txt. Arahan bukan standard Crawl-delay diabaikan oleh beberapa enjin (Google tidak menyokong Crawl-delay).
Contoh praktikal
1) Benarkan semua crawler mengambil segala-galanya (pilihan selamat lalai):
User-agent: *
Disallow:
2) Sekat seorang crawler (contohnya, menyekat agen tertentu daripada semua kandungan):
User-agent: BadBot
Disallow: /
3) Menghalang crawler daripada mengambil sumber yang diperlukan untuk rendering (kesilapan biasa — lihat penyelesaian masalah):
Disallow: /static/js/
Menyekat CSS/JS boleh menghalang Google daripada melihat halaman anda seperti pengguna melihatnya. Oleh kerana Google menggunakan versi mudah alih sebagai asas utama untuk pengimbasan dan pengindeksan dan menilai Core Web Vitals daripada halaman yang dirender, jangan sekat sumber yang diperlukan untuk rendering.
Cara mengesahkan dan menyelesaikan masalah robots.txt
Pemeriksaan asas yang anda boleh jalankan dari luar laman:
Dapatkan badan fail: curl http://www.yoursite.com/robots.txt — ini memulangkan kandungan fail yang akan dilihat oleh crawler.
Periksa hanya header: curl -I http://www.yoursite.com/robots.txt — mengesahkan status HTTP (200 vs 4xx/5xx) dan Content-Type. -I memulangkan hanya header respons.
Lihat bagaimana pelayar menerimanya: buka https://www.yoursite.com/robots.txt dalam pelayar dan sahkan kandungan sama seperti curl.
Periksa log pelayan untuk permintaan crawler sebenar ke /robots.txt dan untuk Googlebot atau agen lain yang cuba mengambil halaman yang disekat — log adalah isyarat pihak ketiga paling dipercayai tentang tingkah laku crawler.
Pemeriksaan yang perlu dijalankan apabila anda memiliki laman tersebut:
Gunakan URL Inspection di Google Search Console untuk halaman individu bagi melihat sama ada Google telah mengambil atau mengindeks URL. URL Inspection adalah autoritatif untuk laman yang anda miliki.
Selepas menukar robots.txt, pantau log pelayan dan laporan Performance di Search Console untuk mengesahkan tingkah laku pengimbasan bagi halaman penting.
Tanda masalah biasa dan apa yang perlu dilakukan
Anda telah tersilap menyekat CSS/JS — simptom: halaman dirender berbeza untuk crawler; Penyelesaian: keluarkan laluan sumber dari Disallow supaya crawler boleh mengambilnya.
robots.txt memulangkan 404/5xx — simptom: beberapa crawler mungkin menganggap laman boleh diimbas sepenuhnya atau menggantung pengimbasan buat sementara; Penyelesaian: pulihkan robots.txt yang sah yang mengembalikan 200 dan Content-Type yang betul.
Anda menyekat seluruh hos atau protokol dengan meletakkan robots.txt pada subdomain yang salah — simptom: halaman hilang dari log pengimbasan; Penyelesaian: tambah robots.txt pada hos yang betul (dan periksa pengalihan).
Jika halaman disekat daripada pengimbasan tetapi masih muncul dalam hasil carian tanpa petikan, ini menunjukkan URL diindeks daripada isyarat luaran walaupun kandungan tidak diambil. Untuk mengeluarkan URL sedemikian dari hasil, gunakan pengesahan HTTP yang sesuai, alih keluar halaman, atau sediakan arahan noindex pada halaman itu sendiri (noindex memerlukan crawler untuk mengambil halaman, jadi jangan sekatkannya dalam robots.txt jika anda bercadang menggunakan noindex).
Senarai semak: terapkan dan semak robots.txt dengan selamat
Letakkan robots.txt di akar laman untuk hos dan protokol yang tepat.
Uji fail dengan curl (badan dan header) dan dalam pelayar.
Elakkan menyekat CSS, JavaScript, atau aset lain yang digunakan untuk rendering kecuali anda sengaja ingin menghalang rendering oleh crawler.
Umumkan sitemap dalam robots.txt untuk membantu crawler menemui URL anda yang boleh diindeks.
Pantau log pelayan dan Search Console untuk tingkah laku pengimbasan selepas perubahan.
Jika anda memerlukan rujukan langkah demi langkah, baca Baca Panduan Technical SEO untuk konteks lebih luas tentang kebolehcapaian pengimbasan dan Core Web Vitals.
Pertimbangan tambahan pada 2026
Oleh kerana Google menggunakan versi mudah alih sebagai asas utama untuk pengimbasan dan pengindeksan dan kerana halaman cache tradisional telah dialih keluar pada awal 2024, kandungan yang dengan sengaja disembunyikan daripada crawler melalui robots.txt mungkin kurang berkemungkinan muncul dalam ulasan berkuasa AI moden dan ciri Search Generative Experience. Jika anda mahu kandungan tersedia untuk ulasan AI atau digunakan untuk ciri SERP kaya, benarkan crawler mengambil dan mengindeks halaman serta gunakan data berstruktur di mana sesuai.
Soalan Lazim
Di manakah robots.txt mesti dihoskan?
robots.txt mesti boleh diakses di akar hos dan protokol tepat yang anda ingin kawal, contohnya https://www.example.com/robots.txt. Peraturan tidak terturun dari domain induk ke subdomain.
Bolehkah menyekat halaman dalam robots.txt mengeluarkannya dari hasil carian?
Menyekat halaman daripada pengimbasan tidak selalu menghalang URL muncul dalam hasil carian jika halaman lain memaut kepadanya. Untuk mengelakkan pengindeksan, benarkan halaman diimbas dan pulangkan arahan noindex atau gunakan kawalan akses di sisi pelayan.
Berapa cepat perubahan robots.txt berkuat kuasa?
Crawler mengambil robots.txt secara berkala; tiada jangka masa tetap universal. Untuk mengesahkan perubahan, periksa log pelayan untuk permintaan baru ke /robots.txt dan pantau Search Console serta log pengimbasan untuk perubahan tingkah laku.
Patutkah saya menggunakan robots.txt untuk menyembunyikan kandungan peribadi?
Tidak. robots.txt adalah fail awam dan tidak patut dijadikan perlindungan untuk data sensitif. Gunakan pengesahan, keluarkan kandungan dari laluan awam, atau kembalikan kod respons HTTP yang sesuai untuk menghalang akses.
Bagaimana cara membenarkan hanya satu crawler (contohnya, Googlebot) mengakses laman saya?
Anda boleh menyertakan kumpulan user-agent untuk crawler tertentu dan kumpulan yang lebih ketat untuk yang lain, contohnya:
User-agent: Googlebot
Disallow:
User-agent: *
Disallow: /
Ingat bahawa ini bergantung pada rentetan user-agent dan crawler yang mematuhi; ia bukan kawalan akses yang selamat.
Artikel berkaitan

Senarai semak on-page SEO untuk tingkatkan kedudukan dan UX
Senarai semak on-page SEO praktikal—termasuk semakan teknikal, kandungan, UX dan langkah pengesahan yang anda boleh jalankan sekarang.

Tip SEO praktikal untuk naikkan kedudukan carian
Strategi SEO yang relevan dan boleh dilaksanakan: kata kunci, asas on-page, pembaikan teknikal, panduan link building dan langkah pengesahan yang anda boleh gunakan hari ini.

Amalan terbaik tajuk SEO
Cara menyusun tag H1–H3 untuk kejelasan, kebolehcapaian, dan isyarat pengimbasan dan pengindeksan yang konsisten.

Langkah membina saluran trafik organik
Panduan langkah demi langkah untuk membina saluran trafik organik yang boleh diulang: padankan kandungan dengan niat pengguna, atasi halangan teknikal, perluaskan pengedaran, dan pastikan boleh diindeks.

Skema FAQ: asas yang perlu anda tahu
Panduan praktikal mengenai skema FAQ: apa itu, cara tambah JSON-LD ke halaman anda, langkah ujian, dan kesilapan biasa yang perlu dielakkan.

Perayapan dan Pengindeksan: Panduan Penemuan Enjin Carian
Langkah konkrit untuk memastikan enjin carian dapat menemui, memaparkan dan mengindeks halaman penting anda dengan betul.

robots.txt untuk SEO: kawal perayapan dengan cekap
Pelajari cara menggunakan robots.txt untuk mengarahkan perayap dengan selamat, elakkan kesilapan pengindeksan, sahkan kelakuan dengan curl dan log, serta terapkan contoh praktikal untuk laman produksi.

Audit teknikal SEO: temui isu yang menghalang carian
Audit teknikal SEO praktikal langkah demi langkah yang mengesan masalah perayapan, pemaparan, pengindeksan dan prestasi serta menunjukkan cara mengesah dan memprioritaskan pembaikan.
