Skip to content
Carian

cara guna fail robots.txt untuk SEO

Ketahui apa yang dikawal oleh robots.txt, cara menulis peraturan yang betul, mengesahkan tingkah laku menggunakan curl dan DevTools, dan elakkan kesilapan SEO biasa.

How to Use Robots.txt File for SEO

Apa yang dibahas dalam panduan ini

Pos ini menerangkan apa yang robots.txt kawal dan apa yang ia tidak kawal, menunjukkan sintaks betul dan contoh praktikal, memberi pemeriksaan baris arahan yang anda boleh jalankan, serta menyenaraikan langkah penyelesaian masalah untuk memulihkan kesilapan biasa. Anda juga akan mendapat petua pengesahan yang berfungsi dalam persekitaran carian 2026 (pengindeksan berpandukan mudah alih ialah lalai Google sejak July 2024 dan Google mengalih keluar halaman cache tradisional pada awal 2024).

Apa itu robots.txt dan apa yang ia kawal

robots.txt ialah fail teks ringkas di akar laman yang menyampaikan arahan pengimbasan kepada robot web yang patuh. Ia sebahagian daripada Standard Pengecualian Robots. Gunakan fail ini untuk memberitahu crawler laluan yang mereka boleh ambil; ia mengawal crawling, bukan pengindeksan atau penarafan.

Perbezaan penting yang perlu diingati:

Pengimbasan vs pengindeksan vs penarafan — robots.txt menjejaskan pengimbasan (apa yang agen ambil). URL yang disekat daripada pengimbasan masih boleh diindeks jika halaman lain memaut kepadanya dan enjin carian memilih untuk mengindeks URL tanpa mengambil kandungannya.

robots.txt bersifat nasihat — hanya crawler yang mematuhi akan mengikutinya. Bot berniat jahat, pengumpul spam dan beberapa pengimbas mungkin mengabaikannya.

robots.txt tidak menggantikan kawalan akses. Gunakan pengesahan HTTP, perlindungan kata laluan, atau kawalan di sisi pelayan untuk kandungan peribadi.

Di mana robots.txt mesti diletakkan dan peraturan asas

robots.txt mesti disajikan dari akar laman pada hos dan protokol tepat yang peraturan itu terpakai. Contoh lokasi yang berbeza: https://example.com/robots.txt dan https://sub.example.com/robots.txt. Anda tidak boleh meletakkan robots.txt dalam subfolder dan mengharapkan ia mengawal keseluruhan domain.

Untuk kemudahan dan contoh dalam panduan ini, laluan ujian kanonik ialah http://www.yoursite.com/robots.txt.

Sintaks robots.txt dan arahan biasa

robots.txt minima menggunakan arahan yang dikelompokkan mengikut user-agent. Baris tidak peka huruf besar/kecil untuk nama arahan. Contoh di bawah menggunakan token standard yang disokong oleh kebanyakan crawler utama:

Sekat semua crawler dari sebuah direktori:

User-agent: *

Disallow: /private/

Benarkan fail tertentu walaupun menyekat direktori (berguna untuk analisis gaya Googlebot):

User-agent: *

Disallow: /images/

Allow: /images/logo.png

Sitemap boleh dinyatakan dalam robots.txt untuk menunjuk crawler kepada sitemap XML:

Sitemap: http://www.yoursite.com/sitemap.xml

Padanan corak: enjin carian menyokong wildcard asterisk (*) dan tanda dolar ($) bagi hujung rentetan dalam corak robots.txt. Arahan bukan standard Crawl-delay diabaikan oleh beberapa enjin (Google tidak menyokong Crawl-delay).

Contoh praktikal

1) Benarkan semua crawler mengambil segala-galanya (pilihan selamat lalai):

User-agent: *

Disallow:

2) Sekat seorang crawler (contohnya, menyekat agen tertentu daripada semua kandungan):

User-agent: BadBot

Disallow: /

3) Menghalang crawler daripada mengambil sumber yang diperlukan untuk rendering (kesilapan biasa — lihat penyelesaian masalah):

Disallow: /static/js/

Menyekat CSS/JS boleh menghalang Google daripada melihat halaman anda seperti pengguna melihatnya. Oleh kerana Google menggunakan versi mudah alih sebagai asas utama untuk pengimbasan dan pengindeksan dan menilai Core Web Vitals daripada halaman yang dirender, jangan sekat sumber yang diperlukan untuk rendering.

Cara mengesahkan dan menyelesaikan masalah robots.txt

Pemeriksaan asas yang anda boleh jalankan dari luar laman:

Dapatkan badan fail: curl http://www.yoursite.com/robots.txt — ini memulangkan kandungan fail yang akan dilihat oleh crawler.

Periksa hanya header: curl -I http://www.yoursite.com/robots.txt — mengesahkan status HTTP (200 vs 4xx/5xx) dan Content-Type. -I memulangkan hanya header respons.

Lihat bagaimana pelayar menerimanya: buka https://www.yoursite.com/robots.txt dalam pelayar dan sahkan kandungan sama seperti curl.

Periksa log pelayan untuk permintaan crawler sebenar ke /robots.txt dan untuk Googlebot atau agen lain yang cuba mengambil halaman yang disekat — log adalah isyarat pihak ketiga paling dipercayai tentang tingkah laku crawler.

Pemeriksaan yang perlu dijalankan apabila anda memiliki laman tersebut:

Gunakan URL Inspection di Google Search Console untuk halaman individu bagi melihat sama ada Google telah mengambil atau mengindeks URL. URL Inspection adalah autoritatif untuk laman yang anda miliki.

Selepas menukar robots.txt, pantau log pelayan dan laporan Performance di Search Console untuk mengesahkan tingkah laku pengimbasan bagi halaman penting.

Tanda masalah biasa dan apa yang perlu dilakukan

Anda telah tersilap menyekat CSS/JS — simptom: halaman dirender berbeza untuk crawler; Penyelesaian: keluarkan laluan sumber dari Disallow supaya crawler boleh mengambilnya.

robots.txt memulangkan 404/5xx — simptom: beberapa crawler mungkin menganggap laman boleh diimbas sepenuhnya atau menggantung pengimbasan buat sementara; Penyelesaian: pulihkan robots.txt yang sah yang mengembalikan 200 dan Content-Type yang betul.

Anda menyekat seluruh hos atau protokol dengan meletakkan robots.txt pada subdomain yang salah — simptom: halaman hilang dari log pengimbasan; Penyelesaian: tambah robots.txt pada hos yang betul (dan periksa pengalihan).

Jika halaman disekat daripada pengimbasan tetapi masih muncul dalam hasil carian tanpa petikan, ini menunjukkan URL diindeks daripada isyarat luaran walaupun kandungan tidak diambil. Untuk mengeluarkan URL sedemikian dari hasil, gunakan pengesahan HTTP yang sesuai, alih keluar halaman, atau sediakan arahan noindex pada halaman itu sendiri (noindex memerlukan crawler untuk mengambil halaman, jadi jangan sekatkannya dalam robots.txt jika anda bercadang menggunakan noindex).

Senarai semak: terapkan dan semak robots.txt dengan selamat

Letakkan robots.txt di akar laman untuk hos dan protokol yang tepat.

Uji fail dengan curl (badan dan header) dan dalam pelayar.

Elakkan menyekat CSS, JavaScript, atau aset lain yang digunakan untuk rendering kecuali anda sengaja ingin menghalang rendering oleh crawler.

Umumkan sitemap dalam robots.txt untuk membantu crawler menemui URL anda yang boleh diindeks.

Pantau log pelayan dan Search Console untuk tingkah laku pengimbasan selepas perubahan.

Jika anda memerlukan rujukan langkah demi langkah, baca Baca Panduan Technical SEO untuk konteks lebih luas tentang kebolehcapaian pengimbasan dan Core Web Vitals.

Pertimbangan tambahan pada 2026

Oleh kerana Google menggunakan versi mudah alih sebagai asas utama untuk pengimbasan dan pengindeksan dan kerana halaman cache tradisional telah dialih keluar pada awal 2024, kandungan yang dengan sengaja disembunyikan daripada crawler melalui robots.txt mungkin kurang berkemungkinan muncul dalam ulasan berkuasa AI moden dan ciri Search Generative Experience. Jika anda mahu kandungan tersedia untuk ulasan AI atau digunakan untuk ciri SERP kaya, benarkan crawler mengambil dan mengindeks halaman serta gunakan data berstruktur di mana sesuai.

Soalan Lazim

Di manakah robots.txt mesti dihoskan?

robots.txt mesti boleh diakses di akar hos dan protokol tepat yang anda ingin kawal, contohnya https://www.example.com/robots.txt. Peraturan tidak terturun dari domain induk ke subdomain.

Bolehkah menyekat halaman dalam robots.txt mengeluarkannya dari hasil carian?

Menyekat halaman daripada pengimbasan tidak selalu menghalang URL muncul dalam hasil carian jika halaman lain memaut kepadanya. Untuk mengelakkan pengindeksan, benarkan halaman diimbas dan pulangkan arahan noindex atau gunakan kawalan akses di sisi pelayan.

Berapa cepat perubahan robots.txt berkuat kuasa?

Crawler mengambil robots.txt secara berkala; tiada jangka masa tetap universal. Untuk mengesahkan perubahan, periksa log pelayan untuk permintaan baru ke /robots.txt dan pantau Search Console serta log pengimbasan untuk perubahan tingkah laku.

Patutkah saya menggunakan robots.txt untuk menyembunyikan kandungan peribadi?

Tidak. robots.txt adalah fail awam dan tidak patut dijadikan perlindungan untuk data sensitif. Gunakan pengesahan, keluarkan kandungan dari laluan awam, atau kembalikan kod respons HTTP yang sesuai untuk menghalang akses.

Bagaimana cara membenarkan hanya satu crawler (contohnya, Googlebot) mengakses laman saya?

Anda boleh menyertakan kumpulan user-agent untuk crawler tertentu dan kumpulan yang lebih ketat untuk yang lain, contohnya:

User-agent: Googlebot

Disallow:

User-agent: *

Disallow: /

Ingat bahawa ini bergantung pada rentetan user-agent dan crawler yang mematuhi; ia bukan kawalan akses yang selamat.

Artikel berkaitan