Robots.txt: apa itu dan bagaimana ia berfungsi
robots.txt ialah fail teks ringkas yang diletakkan di root laman web yang menyatakan peraturan perayapan untuk web crawler (User-agent, Disallow, Allow, Sitemap). Ia mengawal tingkah laku perayapan dan boleh menjejaskan pengindeksan tetapi bukan kedudukan secara langsung.

Apakah robots.txt?
robots.txt (Protokol Pengecualian Robots) ialah fail teks biasa yang terletak di akar hos — contohnya https://example.com/robots.txt — yang memberi arahan ringkas kepada user-agents (perayap web). Ia bersifat awam dan boleh dibaca mesin; ia tidak mengesahkan identiti atau menyembunyikan kandungan. Perayap membaca robots.txt untuk mengetahui laluan yang pemilik laman lebih suka mereka elakkan atau utamakan.
Mengapa robots.txt penting untuk SEO
Robots.txt mengawal perayapan. Perayapan ialah peringkat penemuan dan pengambilan bagaimana enjin carian berinteraksi dengan laman anda; jika seorang perayap disekat daripada mengambil sebuah URL, ia mungkin tidak melihat arahan pada halaman (contohnya meta robots) atau kandungan halaman yang diperlukan untuk diindeks. Itu bermakna robots.txt boleh mempengaruhi pengindeksan secara tidak langsung. Ia tidak menetapkan susunan ranking secara langsung — ranking menggunakan banyak isyarat selepas pengindeksan. Gunakan robots.txt untuk melindungi sumber server, elakkan perayapan halaman berganda atau halaman alat dalaman, dan pastikan perayap dapat mengakses aset yang diperlukan untuk penyajian yang betul.
Bagaimana robots.txt berfungsi
Perayap akan mengambil /robots.txt sebelum ia meminta halaman lain pada hos yang sama dan menggunakan stanza User-agent pertama yang sepadan serta arahan di dalamnya. Arahan biasa yang disokong oleh perayap utama termasuk User-agent, Disallow, Allow dan Sitemap. Sokongan untuk padanan corak dan arahan tambahan berbeza mengikut perayap — Google mengiktiraf corak seperti * dan $ dan menghormati peraturan keutamaan Allow/Disallow mengikut dokumentasinya.
Arahan tipikal dan contoh
Contoh robots.txt ringkas:
User-agent: *
Disallow: /private/
Allow: /public/
Sitemap: https://example.com/sitemap.xml
Nota: letakkan robots.txt di akar tapak. Jika robots.txt mengembalikan HTTP 404, kebanyakan perayap menganggap itu sebagai 'tiada sekatan'; jika ia tidak dapat diambil atau mengembalikan ralat server, kelakuan perayap boleh berbeza — uji dan pantau untuk mengelakkan penyekatan luas secara tidak sengaja. Untuk kelakuan dan contoh khusus Google, rujuk dokumentasi robots.txt Google.
Jenis robots.txt
Corak robots.txt berbeza bergantung pada tujuan. Di bawah adalah pendekatan biasa bersama kebaikan dan keburukan ringkas.
- Sekatan seluruh tapak (Disallow: /)
Kelebihan: segera menghalang akses perayap ke seluruh hos.
Keburukan: menghalang perayap daripada mengambil kandungan dan aset; boleh menghentikan pengindeksan halaman awam.
- Peraturan khusus laluan (Disallow: /private/)
Kelebihan: mudah untuk mengecualikan laluan dalaman atau pentadbiran.
Keburukan: robots.txt adalah awam; jangan senaraikan laluan sensitif yang anda jangka kekal sulit.
- Peraturan khusus User-agent (User-agent: Googlebot)
Kelebihan: laraskan kelakuan untuk perayap tertentu.
Keburukan: penyelenggaraan meningkat; beberapa perayap mengabaikan arahan bukan piawai.
Cara untuk mula dengan robots.txt
1) Tentukan apa yang perlu dilindungi daripada perayapan (kawasan yang membebankan server, laluan staging) dan apa yang mesti kekal tersedia kepada perayap (halaman awam, CSS/JS yang diperlukan untuk penyajian).
2) Buat fail teks bernama robots.txt di akar tapak. Uji secara lokal dan pada hos staging sebelum dideploy ke production.
3) Deploy dan sahkan menggunakan senarai semak teknikal di bawah. Kekalkan fail ringkas dan dokumentasikan sebarang peraturan khusus User-agent supaya penyelenggara akan datang faham niat.
Kesilapan biasa robots.txt
• Bergantung pada robots.txt untuk menyembunyikan data sensitif — robots.txt bersifat awam dan tidak sepatutnya digunakan untuk keselamatan. Gunakan pengesahan atau alih keluar sumber tersebut.
• Menyekat CSS/JS yang diperlukan untuk penyajian — ini boleh menjejaskan bagaimana enjin carian memahami susun atur dan kandungan halaman.
• Menyekat halaman yang mengandungi meta noindex — jika Googlebot disekat daripada mengambil halaman, ia tidak dapat melihat arahan meta noindex.
• Meletakkan robots.txt di bawah subpath (contohnya /blog/robots.txt) — perayap hanya mencari fail di peringkat root.
• Kesalahan sintaks dan kod status HTTP yang salah — pastikan fail dihidangkan dengan respons 200 yang sesuai.
Pengesahan robots.txt: senarai semak teknikal
Gunakan pemeriksaan di bawah selepas mengeluarkan atau mengemas kini robots.txt. Setiap item menyenaraikan tempat untuk disahkan dan syarat lulus yang jelas.
Fail boleh dicapai — tempat untuk disahkan: curl -I https://example.com/robots.txt — lulus apabila permintaan mengembalikan HTTP 200 dan fail itu adalah kandungan yang dijangka.
Arahan betul — tempat untuk disahkan: curl https://example.com/robots.txt atau view-source dalam pelayar — lulus apabila baris User-agent/Disallow/Allow sepadan dengan polisi anda.
Tidak menyekat aset penyajian — tempat untuk disahkan: Chrome DevTools Network dan Coverage atau ambil menggunakan simulator perayap — lulus apabila CSS/JS yang diperlukan untuk penyajian tidak disekat.
Pemeriksaan sekatan Google (laman sendiri) — tempat untuk disahkan: Google Search Console Pemeriksaan URL — lulus apabila Inspection menunjukkan URL boleh diperayap dan tidak "Blocked by robots.txt".
Pemeriksaan perayapan luar — tempat untuk disahkan: gunakan curl atau perayap pihak ketiga untuk meminta URL yang disekat dan sahkan ia mengembalikan 200 untuk halaman tetapi perayap ditolak akses — lulus apabila kelakuan sepadan dengan jangkaan.
Kehadiran Sitemap — tempat untuk disahkan: kandungan robots.txt dan laporan Sitemaps dalam Google Search Console — lulus apabila URL sitemap disenaraikan dalam robots.txt atau dihantar dalam Search Console dan diterima.
Alat dan arahan untuk mengesahkan robots.txt
curl (hanya header): curl -I https://example.com/robots.txt — memulangkan status HTTP dan header respons. curl (fail penuh): curl https://example.com/robots.txt — mencetak kandungan untuk pemeriksaan. Chrome DevTools: buka URL fail atau lihat permintaan rangkaian halaman untuk mengesahkan aset dibenarkan. Pemeriksaan URL Google Search Console: untuk URL yang anda miliki, alat melaporkan jika Google melihat halaman dan sama ada ia disekat oleh robots.txt.Bing Webmaster ToolsSite Explorer boleh menunjukkan bagaimana Bing mengendalikan fail untuk tapak yang anda sahkan. Gunakan log server untuk mengesahkan user-agents mana yang meminta robots.txt dan berapa kerap.
Untuk butiran berwibawa tentang arahan yang disokong dan keutamaan, rujuk dokumentasi rasmi di https://developers.google.com/search/docs/advanced/robots/intro
Soalan Lazim
S: Jika saya menyekat halaman dengan robots.txt, adakah ia akan hilang dari keputusan carian?
J: Menyekat dengan robots.txt menghalang perayap daripada mengambil halaman, yang biasanya menghalang mereka melihat isyarat pada halaman. Halaman yang disekat masih boleh muncul dalam keputusan carian berdasarkan isyarat luaran (entri hanya-URL), tetapi ia tidak akan mempunyai petikan cache atau kandungan yang dipaparkan. Untuk meminta penghapusan, gunakan alat penghapusan indeks untuk URL yang anda miliki; untuk mengawal pengindeksan melalui metadata, pastikan halaman boleh diperayap supaya perayap dapat melihat arahan meta robots:noindex.
S: Bolehkah saya menggunakan robots.txt untuk menyekat bot tertentu?
J: Anda boleh menambah stanza khusus User-agent untuk menyasarkan perayap yang dikenali. Walau bagaimanapun, robots.txt adalah sistem kehormatan: perayap yang berkelakuan baik akan mengikutinya, bot berniat jahat mungkin mengabaikannya. Untuk perlindungan lebih teguh, gunakan pengesahan, penapisan IP, atau firewall.
S: Patutkah saya sertakan sitemap saya dalam robots.txt?
J: Menyertakan Sitemap: https://example.com/sitemap.xml dalam robots.txt adalah cara mudah untuk menunjuk perayap ke sitemap anda; hantar juga sitemap terus dalam Google Search Console untuk tapak yang anda kendalikan.
S: Adakah robots.txt terpakai mengikut protokol dan hos?
J: Ya. robots.txt diambil mengikut hos dan protokol: https://example.com/robots.txt adalah berasingan daripada http://example.com/robots.txt atau https://sub.example.com/robots.txt. Letakkan fail pada skema dan hos yang sama yang digunakan oleh laman anda.
S: Bagaimana pengindeksan mobile-first menjejaskan robots.txt?
J: Google menggunakan versi mudah alih sebagai asas utama untuk perayapan dan pengindeksan. Sejak July 2024, Google merayap tapak untuk Search dengan Googlebot Smartphone secara lalai. Pastikan robots.txt tidak secara tidak sengaja menyekat sumber pada halaman yang dilayan untuk mudah alih yang diperlukan untuk penyajian dan pengindeksan yang betul.
S: Di manakah saya boleh mendapatkan panduan rasmi?
J: Rujuk dokumentasi robots.txt Google di https://developers.google.com/search/docs/advanced/robots/intro dan sumber Schema.org serta W3C untuk amalan berkaitan perayapan dan pengindeksan.
Terma berkaitan

Crawler: apa itu dan mengapa ia penting untuk SEO
Crawler ialah bot automatik yang mengambil halaman web, mengikuti pautan dan sumber untuk menemui kandungan bagi enjin carian; halaman yang dicrawling menjadi calon untuk pengindeksan (Google menggunakan Googlebot Smartphone secara lalai sejak July 2024).

Enjin carian: cara ia berfungsi dan asas SEO
Enjin carian ialah sistem perisian yang menemui, merangkak, mengindeks dan memulangkan kandungan web untuk menjawab pertanyaan pengguna; SERP moden juga memaparkan Gambaran AI, keputusan kaya dan senarai berperingkat berdasarkan pelbagai isyarat.

Algoritma Carian: Definisi, Cara Berfungsi & Impak pada SEO
Algoritma carian ialah set peraturan perisian yang enjin carian gunakan untuk menemui, merangkak, mengindeks dan menyusun halaman web bagi pertanyaan dengan menggabungkan isyarat relevan, kualiti kandungan, isyarat pautan dan model niat berasaskan AI untuk menyusun keputusan.

Kedudukan enjin carian: definisi dan cara ia berfungsi
Kedudukan enjin carian ialah susunan di mana enjin carian memaparkan halaman yang diindeks untuk sesuatu carian; kedudukan mencerminkan banyak isyarat—kaitan, backlink, kualiti kandungan, pengalaman halaman dan niat pengguna—dan berinteraksi dengan gambaran AI pada 2026.

Tag meta: jenis, kegunaan, dan amalan terbaik SEO
Tag meta ialah elemen HTML yang menyediakan metadata tentang halaman (tajuk, keterangan, arahan robots, tag pratonton sosial dan lain‑lain). Enjin carian dan platform membacanya untuk mempengaruhi pengindeksan, petikan hasil enjin carian dan cara pembentangan.

On-page SEO: definisi, senarai semak dan pengesahan
On‑page SEO ialah mengoptimumkan kandungan, HTML dan UX halaman supaya ia relevan, boleh diindeks dan berguna kepada pengguna serta enjin carian moden — merangkumi rendering mobile‑first, data berstruktur, kanonik dan prestasi halaman.
