Aturan crawler
Tentang generator robots.txt ini
Berkas robots.txt memberi petunjuk kepada crawler sebelum mereka mengunjungi situs. Berkas teks biasa ini harus berada di root, misalnya https://example.com/robots.txt. Aturan dapat mengizinkan situs, meminta crawler menghindari path tertentu, atau memblokir perayapan seluruh situs.
Aturan ini adalah permintaan untuk crawler yang patuh, bukan pengaman akses. Berkasnya bersifat publik, beberapa bot dapat mengabaikannya, dan URL yang diblokir masih bisa muncul di hasil pencarian tanpa isi halaman. Jangan gunakan robots.txt untuk melindungi kata sandi, data pelanggan, atau halaman privat.
Baris Sitemap memberi tahu lokasi peta situs XML. Ini tidak menggantikan pengiriman lewat akun mesin pencari, tetapi memberi crawler cara lain untuk menemukannya.
Arti setiap baris
Pada banyak server, huruf besar dan kecil membedakan path. Periksa berkas sebelum diterbitkan.
| Baris | Arti |
|---|---|
| User-agent: * | Aturan berikut berlaku untuk semua crawler. |
| Allow: / | Crawler boleh mengunjungi seluruh situs. |
| Disallow: /path/ | Meminta crawler tidak mengunjungi path ini dan URL di bawahnya. |
| Sitemap: | Memberikan alamat publik lengkap dari sitemap XML. |
Cara membuat berkas robots.txt
- Pilih akses crawler: Izinkan situs, tulis path, atau blokir semuanya hanya jika memang dimaksudkan.
- Tambahkan sitemap: Gunakan URL publik lengkap sitemap.xml dan periksa setiap aturan.
- Terbitkan di root: Unduh atau salin berkas lalu taruh di /robots.txt pada host yang sama.
Pertanyaan yang sering diajukan
Bisakah robots.txt menyembunyikan data privat?
Tidak. Berkas ini publik dan hanya meminta crawler tidak berkunjung. Lindungi halaman privat dengan autentikasi dan izin server yang benar.
Apakah Disallow menghapus halaman dari Google?
Tidak selalu. URL yang diblokir masih bisa terdaftar jika mendapat tautan. Untuk menghapusnya, izinkan crawler membaca noindex atau gunakan alat penghapusan mesin pencari.
Di mana robots.txt harus diunggah?
Di root protokol dan host yang tepat, misalnya https://example.com/robots.txt. Berkas di /folder/robots.txt tidak mengatur seluruh situs.
Perlukah menambahkan Crawl-delay?
Biasanya tidak. Google tidak mendukung Crawl-delay di robots.txt dan crawler lain menafsirkannya berbeda. Gunakan pengaturan mesin pencari atau kontrol server.