Robots.txt: Fungsi, Cara Kerja, dan Kesalahan yang Perlu Dihindari
Dyaksa Naya
20 Juli 2026
Robots.txt: Fungsi, Cara Kerja, dan Kesalahan yang Perlu Dihindari
Robots.txt adalah file di domain website yang memberi arahan kepada crawler mesin pencari tentang bagian situs mana yang boleh atau tidak perlu dirayapi.
File ini berguna untuk mengelola aktivitas crawler, terutama pada website yang memiliki banyak URL teknis, parameter, atau area yang tidak perlu muncul dalam proses penjelajahan. Namun, robots.txt bukan tombol untuk menghapus halaman dari hasil Google.
Cara kerja robots.txt
Crawler biasanya mencari file robots.txt di akar domain sebelum menjelajahi website. Dari sana, crawler membaca aturan yang berlaku untuk user-agent tertentu dan menyesuaikan permintaan crawl bila aturan tersebut didukung.
Misalnya, website dapat meminta crawler agar tidak membuang waktu pada halaman pencarian internal atau folder sistem yang tidak relevan bagi pengguna mesin pencari. Tujuannya bukan menyembunyikan informasi sensitif, melainkan membantu crawler memusatkan perhatian pada halaman yang bernilai.
Hal penting yang perlu diingat: memblokir crawl tidak otomatis mencegah sebuah URL muncul di hasil pencarian. Jika Google menemukan URL itu dari tautan lain, URL tersebut masih mungkin tercatat tanpa Google dapat mengambil isi halamannya. Untuk mencegah sebuah halaman diindeks, gunakan metode pengindeksan yang tepat dan tetap izinkan crawler membaca instruksinya.
Fungsi robots.txt untuk SEO
Robots.txt paling berguna ketika website mempunyai pola URL yang berpotensi membuat crawler masuk ke halaman yang tidak penting dalam jumlah besar.
- Mengurangi crawl yang tidak perlu: halaman pencarian internal, kombinasi filter yang tidak bernilai, atau area teknis dapat menghabiskan perhatian crawler.
- Menjaga fokus pada URL utama: crawler lebih mudah menemukan halaman layanan, produk, kategori, dan artikel yang ingin diprioritaskan.
- Mendukung proses pengembangan: area tertentu dapat diatur dengan hati-hati saat tidak perlu dijelajahi crawler publik.
- Mendeklarasikan lokasi sitemap: file ini dapat menjadi tempat praktis untuk memberi tahu lokasi sitemap XML.
Fungsi tersebut tidak berarti setiap URL yang tidak penting harus diblokir. Kadang solusi yang lebih tepat adalah menghapus parameter, memperbaiki navigasi, memberi canonical, atau memakai noindex, tergantung penyebabnya.
Bagian yang perlu dipahami
Aturan robots.txt tampak sederhana, tetapi dampaknya bisa luas bila ditulis tanpa memahami pola URL situs.
- User-agent: menunjukkan crawler yang menjadi target aturan, misalnya semua crawler atau crawler tertentu.
- Disallow: meminta crawler agar tidak mengakses jalur URL tertentu.
- Allow: memberi pengecualian pada jalur yang sebelumnya tercakup aturan lebih luas.
- Sitemap: mencantumkan lokasi file sitemap XML agar lebih mudah ditemukan crawler.
Aturan harus ditempatkan pada alamat domain utama, bukan di dalam folder artikel atau halaman acak. Setelah diubah, file juga perlu dapat dibuka publik. Server yang memberi error pada robots.txt dapat membuat perilaku crawler tidak sesuai harapan.
Hal yang sebaiknya tidak diandalkan pada robots.txt
Jangan memakai robots.txt untuk menyimpan rahasia. File ini bisa dilihat publik, sehingga nama folder yang ditulis di dalamnya justru dapat menarik perhatian orang ke lokasi tersebut. Halaman privat seharusnya dilindungi autentikasi atau mekanisme akses yang benar.
Robots.txt juga bukan solusi utama untuk menghilangkan halaman lama dari indeks. Jika halaman perlu benar-benar tidak tampil di hasil pencarian, pastikan Google dapat membaca instruksi noindex atau tangani URL dengan status respons yang sesuai dengan kondisi halamannya.
Kesalahan robots.txt yang sering merusak SEO
Kesalahan paling mahal biasanya terjadi karena satu aturan terlalu umum.
- Memblokir seluruh website tanpa sadar: aturan yang mencakup
/akan menutup akses crawler ke hampir semua halaman. Ini sering terjadi saat situs pindah dari staging ke production. - Memblokir aset yang dibutuhkan halaman: CSS, JavaScript, atau resource penting yang diblokir bisa membuat crawler gagal memahami tampilan dan fungsi halaman.
- Menganggap Disallow sama dengan noindex: halaman yang tidak dirayapi belum tentu hilang dari indeks.
- Memblokir URL sebelum Google membaca noindex: bila tujuan akhirnya adalah tidak diindeks, crawler perlu bisa mengakses halaman untuk membaca tag tersebut.
- Tidak mengecek ulang setelah perubahan platform: plugin, CMS, dan konfigurasi deployment dapat mengganti atau menimpa file robots tanpa disadari.
Cara mengecek robots.txt dengan aman
Mulailah dari daftar halaman bisnis yang paling penting. Pastikan URL layanan, artikel utama, kategori, dan produk tidak terkena pola blokir. Setelah itu, lihat URL yang sedang diblokir dan tanyakan apakah memang tidak ada nilai pencarian maupun nilai pengguna di sana.
Uji juga satu atau dua URL melalui inspeksi URL di Search Console. Pemeriksaan ini membantu membedakan masalah robots, noindex, canonical, atau error server. Jangan mengubah aturan hanya karena melihat banyak URL parameter; pahami dulu apakah URL itu benar-benar perlu dibatasi atau justru menandakan struktur situs yang perlu dibereskan.
Robots.txt yang baik cenderung singkat dan punya alasan jelas di setiap aturannya. Semakin rumit file ini, semakin besar risiko crawler kehilangan halaman yang sebenarnya penting.