Robots.txt คืออะไร และทำงานอย่างไร
robots.txt เป็นไฟล์ข้อความที่วางอยู่ที่รูทของโดเมนเพื่อให้คำแนะนำแก่เว็บครอเลอร์ว่าควรเข้าถึงหรือข้ามส่วนใดของเว็บไซต์ ไฟล์นี้ช่วยควบคุมการรวบรวมข้อมูล (crawling) และชี้ไปยัง Sitemap แต่ไม่ใช่กลไกความปลอดภัย

What is robots.txt ค ออะไร และทำงานอย างไร?
robots.txt เป็นไฟล์ข้อความธรรมดาที่ต้องวางไว้ที่รูทของโฮสต์ เช่น https://example.com/robots.txt เพื่อให้เว็บครอเลอร์ (เช่น Googlebot) รับทราบข้อแนะนำว่าพาธใดสามารถหรือไม่สามารถถูกดึงข้อมูลได้ ไฟล์นี้เป็นชุดคำสั่งเชิงบอกเล่า (directive) ไม่ใช่คำสั่งบังคับ และไม่ได้ป้องกันการเข้าถึงจากผู้ใช้หรือบอทที่ไม่นอบน้อม
Why robots.txt ค ออะไร และทำงานอย างไร matters for SEO
robots.txt มีผลต่อการรวบรวมข้อมูล (crawling) และด้วยเหตุนี้อาจกระทบต่อการที่ Google หรือเครื่องมือค้นหาอื่นจะเห็นหน้าเพื่อพิจารณาการทำดัชนี (indexing) แต่ต้องแยกความต่างชัดเจน: การบล็อกด้วย robots.txt ป้องกันการรวบรวมข้อมูล แต่ไม่ได้เป็นกลไกที่แสดงว่าหน้านั้นจะไม่ปรากฏในดัชนีหรือไม่ — หน้าอาจถูกใส่ในดัชนีบนพื้นฐานของลิงก์ภายนอกโดยไม่มีเนื้อหาที่ถูกดึงมา เครื่องมือตรวจสอบและการจัดลำดับผลการค้นหา (ranking) ขึ้นกับสัญญาณหลายอย่าง; robots.txt ส่งผลที่ระดับการรวบรวมข้อมูล/การเข้าถึง ไม่ใช่การตัดสินอันดับโดยตรง
How robots.txt ค ออะไร และทำงานอย างไร works
หลักการทำงานพื้นฐาน: เว็บครอเลอร์จะร้องขอไฟล์ robots.txt ที่รูทก่อนเมื่อมาเยี่ยมโฮสต์นั้น ถ้ามีคำสั่งที่ตรงกับ user-agent และพาธ บ็อตที่เคารพกฎจะไม่ดึง (fetch) หน้าเหล่านั้นอีกต่อไป บรรทัดคำสั่งทั่วไปได้แก่ User-agent, Disallow, Allow และ Sitemap ตัวอย่างไฟล์สั้น ๆ: User-agent: * Disallow: /private/ Sitemap: https://example.com/sitemap.xml
ข้อควรทราบด้านเทคนิค: หลายครอเลอร์สนับสนุนรูปแบบ wildcard (เช่น *) และเครื่องหมาย $ สำหรับจบพาธ แต่การตีความลำดับของ Allow/Disallow อาจต่างกันระหว่างครอเลอร์ ตัวอย่างเช่น กฎที่ยาวกว่าจะชนะเมื่อตรงกันกับพาธ นอกจากนี้ Google ใช้ Googlebot Smartphone เป็นค่าเริ่มต้นสำหรับการครอลล์และจัดทำดัชนีตั้งแต่ July 2024 ดังนั้นการบล็อกไฟล์ทรัพยากรสำหรับมือถืออาจมีผลต่อการที่ Google เห็นเพจของคุณ
Types of robots.txt ค ออะไร และทำงานอย างไร
ตัวอย่างรูปแบบการใช้งานทั่วไปและการใช้งานที่เหมาะสม:
- ไฟล์เปิดทั้งหมด (Permissive): User-agent: * Disallow: — เหมาะกับเว็บไซต์ที่ต้องการให้ทุกครอเลอร์เข้าถึง
- บล็อกทั้งไซต์ (Block all): User-agent: * Disallow: / — ใช้เฉพาะโฮสต์ทดสอบหรือโดเมนชั่วคราว
- บล็อกเฉพาะพาธสำหรับเซอร์วิส (Block resources): Disallow: /wp-admin/ หรือ Disallow: /private/ — ลดการใช้ crawl budget แต่ระวังอย่าให้บล็อก CSS/JS สำคัญ
- กำหนด Sitemap: Sitemap: https://example.com/sitemap.xml — ช่วยให้ครอเลอร์ค้นพบ URL ได้เร็วขึ้น
How to get started with robots.txt ค ออะไร และทำงานอย างไร
ขั้นตอนเริ่มต้นที่แนะนำ:
1) ตรวจสอบไฟล์ปัจจุบัน — เข้าถึง https://example.com/robots.txt ด้วยเบราว์เซอร์ หรือใช้คำสั่ง curl: curl https://example.com/robots.txt เพื่อตรวจดูเนื้อหา
2) สำรองและทดสอบในสเตจจิง — อย่าเขียนไฟล์ใหม่ลงบนโปรดักชั่นโดยตรง ให้ทดสอบการตอบสนองกับครอเลอร์จำลองก่อน
3) เพิ่ม Sitemap ถ้ายังไม่มี — เพิ่มบรรทัด Sitemap: เพื่อช่วยการค้นพบ
4) อย่าพึ่งพา robots.txt เป็นกลไกป้องกันข้อมูล — หากต้องการปิดกั้นเนื้อหาให้ใช้การยืนยันตัวตนหรือการส่งหัวข้อ HTTP x-robots-tag: noindex (ซึ่งต้องอนุญาตให้ครอเลอร์เข้าถึงเพื่ออ่านแท็ก)
5) ดีพลอยและตรวจสอบ — วางไฟล์ที่ https://yourdomain.tld/robots.txt แล้วตรวจสอบการเข้าถึงผ่าน curl และล็อกเซิร์ฟเวอร์
Common robots.txt ค ออะไร และทำงานอย างไร mistakes
ข้อผิดพลาดที่พบบ่อยและผลที่ตามมา:
- บล็อก CSS/JS สำคัญ — ทำให้หน้าไม่ถูกเรนเดอร์อย่างถูกต้องสำหรับครอเลอร์ (โดยเฉพาะเมื่อ Googlebot Smartphone เป็นค่าเริ่มต้น)
- ใช้ robots.txt เพื่อซ่อนข้อมูลลับ — robots.txt ไม่ได้ป้องกันการเข้าถึงโดยตรงและอาจทำให้ข้อมูลถูกเปิดเผยเพราะไฟล์นี้สาธารณะ
- วางไฟล์ไม่ถูกที่ — robots.txt ต้องอยู่ที่รูทของโฮสต์; https://sub.example.com ต้องการไฟล์ของตัวเอง
- ลำดับคำสั่งผิดพลาดหรือใช้ไวยากรณ์ที่ไม่สอดคล้อง — อาจทำให้บ็อตตีความผิดและบล็อกเพจสำคัญ
- คาดหวังว่า robots.txt จะทำให้หน้าไม่ปรากฏใน SERP — ไฟล์นี้เกี่ยวกับการรวบรวมข้อมูล ไม่ใช่การตัดสินอันดับ
ตรวจสอบ robots.txt: technical checklist
**ไฟล์อยู่ที่รูท** — ตรวจสอบที่: curl https://example.com/robots.txt — ผ่านเมื่อได้รับ 200 และเห็นเนื้อหาไฟล์
**บรรทัด Sitemap** — ตรวจสอบที่: ดูเนื้อหา robots.txt — ผ่านเมื่อมีบรรทัด Sitemap: ที่ชี้ไปยังไฟล์ sitemap.xml ที่ใช้ได้
**ทรัพยากรถูกบล็อกโดยไม่ได้ตั้งใจ** — ตรวจสอบที่: Chrome DevTools > Network ขณะโหลดเพจ, หรือ curl -A "Googlebot" https://example.com/page — ผ่านเมื่อ CSS/JS สำคัญสามารถถูกดึงโดย Googlebot
**ผลการตอบสนอง HTTP** — ตรวจสอบที่: curl -I https://example.com/robots.txt — ผ่านเมื่อตอบ 200, และไฟล์ไม่ถูกรีไดเร็กต์ผิดที่
**ล็อกเซิร์ฟเวอร์** — ตรวจสอบที่: server logs — ผ่านเมื่อครอเลอร์ที่คาดหวังเข้าถึง robots.txt แล้วปฏิบัติตามกฎตามที่ตั้งใจไว้
How to verify / troubleshoot
ตรวจด้วย curl
ดูตัวอย่างเนื้อหา: curl https://example.com/robots.txt
ดู header เท่านั้น: curl -I https://example.com/robots.txt
จำลองการเข้าถึงโดย user-agent เฉพาะ: curl -A "Googlebot" -I https://example.com/somepage (ใช้ -I ถ้าต้องการ header เท่านั้น, ลบ -I เพื่อดึง body)
ตรวจด้วยเบราว์เซอร์และ DevTools
โหลดหน้าแล้วเปิด DevTools > Network เพื่อดูว่าไฟล์ทรัพยากรถูกดึงหรือถูกบล็อก ถ้าทรัพยากรถูกบล็อกจาก robots.txt หน้าอาจเรนเดอร์ไม่สมบูรณ์สำหรับครอเลอร์
สำหรับเว็บไซต์ที่คุณเป็นเจ้าของ
ใช้ Google Search Console URL Inspection เพื่อดูว่า Google สามารถเข้าถึงหน้าและทรัพยากรใดได้บ้าง (เครื่องมือนี้ใช้ได้เฉพาะกับโดเมนที่คุณยืนยันความเป็นเจ้าของ) และใช้ Bing Webmaster Tools Site Explorer สำหรับมุมมองของ Bing
Frequently asked questions
ดูรายละเอียดเพิ่มเติมในคู่มือเทคนิค: /guide/technical-seo
บทสรุป: robots.txt เป็นเครื่องมือสำคัญสำหรับการจัดการการรวบรวมข้อมูล แต่ต้องใช้ร่วมกับวิธีการอื่น เช่น การควบคุมการเข้าถึงจริง (authentication), แท็ก noindex/x-robots-tag และการตรวจสอบล็อกเซิร์ฟเวอร์ เพื่อให้แน่ใจว่าหน้าสำคัญของคุณถูกค้นพบและเรนเดอร์โดยครอเลอร์อย่างถูกต้อง
สร้างอำนาจในเชิงเทคนิคเป็นส่วนหนึ่งของการเติบโตทางออร์แกนิก การมี robots.txt ที่ถูกต้องช่วยให้เครื่องมือค้นหาใช้ทรัพยากรของเว็บไซต์คุณอย่างมีประสิทธิภาพ หากคุณต้องการขยายอำนาจตามหัวข้อ ให้พิจารณาการได้มาซึ่งลิงก์คุณภาพจากสำนักพิมพ์ที่เกี่ยวข้อง — /marketplace
Q: ถ้าฉันบล็อกเพจด้วย robots.txt หน้าเหล่านั้นจะไม่ขึ้นในผลการค้นหาใช่ไหม?
A: ไม่เสมอไป — robots.txt ป้องกันการรวบรวมข้อมูลแต่หน้าอาจถูกใส่ดัชนีโดยอ้างอิงจากลิงก์ภายนอกโดยไม่มีเนื้อหาที่ถูกดึงมา หากต้องการให้ไม่ปรากฏให้ใช้การยืนยันตัวตนหรืออนุญาตให้ครอเลอร์เข้ามาอ่านแล้วส่งหัวข้อ noindex
Q: robots.txt สามารถป้องกันการดาวน์โหลดไฟล์หรือข้อมูลสำคัญได้ไหม?
A: ไม่ควรใช้อย่างนั้น — robots.txt เป็นไฟล์สาธารณะที่ทุกคนสามารถอ่านได้ ดังนั้นอย่าใส่เส้นทางของข้อมูลลับเพื่อ "ซ่อน" จากสาธารณะ
Q: Google ปฏิบัติตามคำสั่ง robots.txt เสมอหรือไม่?
A: Google และครอเลอร์ที่มีมารยาทมักจะเคารพคำสั่ง แต่ robots.txt เป็นคำแนะนำ: ครอเลอร์ที่ไม่เป็นมิตรอาจไม่ปฏิบัติตาม และการตีความกฎอาจแตกต่างกันระหว่างครอเลอร์
Q: ควรวาง Sitemap ไว้ใน robots.txt หรือส่งแยกผ่าน Search Console?
A: ทำทั้งสองอย่างได้ — ใส่ Sitemap: ใน robots.txt เพื่อให้ครอเลอร์ทั่วไปเห็น และส่งแผนผังไซต์ผ่านเครื่องมือเจ้าของเว็บไซต์ (เช่น Google Search Console) เพื่อการตรวจสอบที่ชัดเจน
คำที่เกี่ยวข้อง

ครอว์เลอร์ส่งผลต่อ SEO: ความหมายและเช็คลิสต์ทางเทคนิค
ครอว์เลอร์ส่งผลต่อ SEO คือการที่ซอฟต์แวร์อัตโนมัติ (crawlers/spiders) สำรวจหน้าเว็บและส่งข้อมูลให้เครื่องมือค้นหาเพื่อการจัดเก็บ (indexing); การเข้าถึง การจัดทำดัชนี และการแสดงผลของหน้านั้นมีผลต่อการมองเห็นในผลการค้นหา

เครื่องมือค้นหา: อธิบายและพื้นฐาน SEO
เครื่องมือค้นหาเป็นระบบซอฟต์แวร์ที่ค้นหา จัดเก็บ และเรียกคืนเนื้อหาเว็บเพื่อนำเสนอผลการค้นหาแก่ผู้ใช้; ในปี 2026 SERP มักรวม AI Overviews และ Google ใช้ Googlebot Smartphone เป็นค่าเริ่มต้นสำหรับการครอลและการจัดทำดัชนี

อัลกอริทึมการค้นหา: ความหมาย ผลกระทบ และเช็คลิสต์ทางเทคนิค
อัลกอริทึมการค้นหาเป็นชุดกฎ โมเดล และสัญญาณที่เครื่องมือค้นหาใช้ค้นหา จัดเก็บ (index) และเรียงลำดับผลลัพธ์สำหรับคำค้นของผู้ใช้; ในปี 2026 ผลลัพธ์ยังได้รับอิทธิพลจากเนื้อหา ลิงก์ ความเร็วหน้า โครงสร้างข้อมูล และสรุป AI บน SERP

การจัดอันดับบนเสิร์ชเอ็นจิน: ความหมายและผลกระทบต่อ SEO
การจัดอันดับบนเสิร์ชเอ็นจินคือการเรียงลำดับหน้าเว็บในผลการค้นหา (SERPs) ซึ่งเครื่องมือค้นหาใช้สัญญาณหลายด้าน—ความเกี่ยวข้อง คุณภาพเนื้อหา สถานะการจัดทำดัชนี และสัญญาณเชิงเทคนิค—เพื่อเลือกและจัดลำดับผลลัพธ์สำหรับคำค้นแต่ละคำ

เมตาแท็ก: คำอธิบาย เทคนิค และเช็คลิสต์
เมตาแท็กคือส่วนใน <head> ของ HTML ที่ให้ข้อมูลเชิงเมตาเกี่ยวกับหน้าเว็บ—ตัวอย่างเช่น title, meta description, meta robots, canonical และ Open Graph—ซึ่งช่วยให้เครื่องมือค้นหาและแพลตฟอร์มโซเชียลเข้าใจการทำดัชนีและการแสดงตัวอย่างหน้า

On-page SEO: คำอธิบายและเช็คลิสต์ทางเทคนิค
On‑page SEO คือการปรับแต่งคอนเทนต์ โค้ด HTML เมตาแท็ก โครงสร้าง URL ลิงก์ภายใน ความปลอดภัย และประสิทธิภาพหน้าเว็บ (รวม Core Web Vitals และ structured data) เพื่อให้หน้าเว็บถูกครอลล์ จัดทำดัชนี และแสดงผลอย่างเหมาะสมในผลการค้นหาและ AI Overviews ของปี 2026
