BerandaAlatGenerator robots.txt
Generator dan penguji robots.txt dengan crawler AI
Buat robots.txt dari templat, tutup bagian privat, tentukan crawler AI mana yang boleh mengakses situs Anda, lalu uji URL mana pun: apakah diizinkan untuk Googlebot, Bingbot atau GPTBot, serta grup dan aturan mana yang menentukannya.
—
Tanpa Crawl-delay dan Host. Google tidak mendukung Crawl-delay, dan Host adalah direktif khusus Yandex yang dihentikan pada 2018. Generator ini tidak menambahkannya.
—
Aturan grup yang diterapkan
| Baris | Aturan | Panjang | Kecocokan |
|---|
URL ini untuk berbagai crawler
| Crawler | Grup | Akses |
|---|
Pemeriksaan file
Semua dihitung di browser Anda — data yang Anda masukkan tidak dikirim ke mana pun.
Cara memakai
- Pilih templat“SaaS” menutup area aplikasi dan API; “Toko online” menutup keranjang, filter dan pengurutan. Tambahkan path Anda sendiri dan grup terpisah untuk Googlebot atau Bingbot.
- Putuskan soal crawler AIBot dikelompokkan berdasarkan tujuan: pelatihan model, pencarian dengan kutipan, dan permintaan pengguna. Anda bisa memblokir pelatihan dan tetap membuka pencarian.
- Uji URL“Uji file ini” memindahkan hasil ke tab “Uji URL”, yang menunjukkan grup dan aturan yang menentukan nasib sebuah URL untuk setiap crawler.
- Publikasikan fileSalin teksnya dan letakkan di root domain: https://example.co.id/robots.txt. Setiap subdomain dan protokol punya file sendiri.
Sintaks robots.txt: grup, aturan dan prioritas
robots.txt adalah file teks di root situs yang memberi tahu crawler mesin pencari URL mana yang boleh dirayapi. Sejak 2022 aturan pembacaannya distandarkan dalam RFC 9309; Google dan Bing mendokumentasikan prinsip dasar yang sama ditambah beberapa ekstensi sendiri.
File terdiri dari grup. Grup dimulai dengan satu atau beberapa baris User-agent, diikuti aturan Disallow dan Allow. Baris Sitemap tidak termasuk grup dan boleh diletakkan di mana saja.
Cara crawler memilih grup
Crawler mencari grup dengan tokennya — tanpa membedakan huruf besar dan kecil — dan hanya mengikuti grup itu. Jika tidak ada, crawler memakai grup *; jika grup itu juga tidak ada, semuanya diizinkan. Grup dengan token yang sama digabung. Dari sini muncul kesalahan umum: membuat grup User-agent: Googlebot terpisah dan lupa mengulang aturan dari *.
Mesin pencari mendokumentasikan grup cadangan: Googlebot-Image dan Googlebot-News memakai aturan Googlebot jika tidak punya grup sendiri.
Cara aturan dipilih
Nilai aturan dibandingkan dengan awal path, termasuk query string. * cocok dengan urutan karakter apa pun, dan $ di akhir menandai akhir URL. Jika beberapa aturan cocok, yang terpanjang menang; jika sama panjang, Allow yang menang. Urutan baris tidak berpengaruh.
Ini adalah tabel prioritas dari dokumentasi Google; alat ini memeriksanya dalam pengujian otomatis. Disallow: yang kosong tidak memblokir apa pun. Path dibandingkan dalam bentuk ternormalisasi: karakter non-ASCII dienkode UTF-8 dengan persen. Path membedakan huruf besar dan kecil: /Admin/ dan /admin/ adalah aturan yang berbeda.
robots.txt untuk Google dan Bing: apa bedanya
Di Indonesia, hampir semua pencarian melalui Google, disusul Bing; tidak ada mesin pencari lokal dengan crawler sendiri yang perlu diperhitungkan. Intinya sama: grup, Allow dan Disallow, wildcard * dan $, prioritas kecocokan terpanjang. Perbedaannya ada pada ekstensi.
- Crawl-delay. Google mengabaikannya. Bing mematuhinya, tetapi kontrol perayapan di Bing Webmaster Tools adalah tempat yang lebih baik untuk mengatur frekuensi.
- Grup cadangan. Googlebot-Image, -Video dan -News memakai grup Googlebot jika tidak punya grup sendiri.
- Ukuran. Google memproses 500 KiB pertama file dan mengabaikan sisanya.
- Host dan Clean-param. Ini direktif Yandex. Google dan Bing mengabaikannya; gunakan redirect 301 untuk host utama dan
rel="canonical"untuk parameter URL. - Noindex. Google berhenti mematuhi
Noindex:di robots.txt pada 2019. Gunakan meta tag robots atau headerX-Robots-Tag.
Untuk melihat cara mesin pencari membaca file yang sudah tayang, gunakan laporan robots.txt di Google Search Console atau penguji robots.txt di Bing Webmaster Tools. Alat ini berguna sebelum publikasi: bisa dipakai untuk teks apa pun, tidak hanya file di situs Anda.
Cara memblokir crawler AI — dan perlukah
Perusahaan AI merayapi web untuk tujuan yang berbeda, dan pemain besar memakai token terpisah untuk setiap tujuan. Putuskan berdasarkan tujuan, bukan sekadar “blokir semuanya”.
| Token | Pemilik | Tujuan |
|---|---|---|
| GPTBot | OpenAI | pelatihan model |
| OAI-SearchBot | OpenAI | pencarian ChatGPT |
| ChatGPT-User | OpenAI | permintaan pengguna |
| ClaudeBot | Anthropic | pelatihan model |
| Claude-SearchBot | Anthropic | jawaban pencarian |
| Claude-User | Anthropic | permintaan pengguna |
| PerplexityBot | Perplexity | pencarian dan kutipan |
| Perplexity-User | Perplexity | permintaan pengguna |
| Google-Extended | token: pelatihan dan grounding Gemini | |
| Applebot-Extended | Apple | token: pelatihan model Apple |
| CCBot | Common Crawl | arsip web terbuka |
| meta-externalagent | Meta | pelatihan dan produk |
| Amazonbot | Amazon | layanan Amazon dan AI |
| Bytespider | ByteDance | pengumpulan data |
Tiga kelompok, tiga keputusan
- Pelatihan model (GPTBot, ClaudeBot, CCBot dan lainnya). Memblokirnya menjauhkan halaman baru dari dataset pelatihan berikutnya. Bot ini tidak membawa trafik, jadi paling sering diblokir — terutama untuk konten berbayar dan orisinal.
- Pencarian dan jawaban bertautan (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Bot ini membawa pengunjung: situs Anda dikutip beserta tautannya. Memblokirnya berarti melepas kanal baru. Situs SaaS dan media biasanya membiarkannya terbuka.
- Permintaan pengguna (ChatGPT-User, Claude-User, Perplexity-User). Halaman dibuka karena seseorang secara eksplisit memintanya. Ini lebih mirip browser daripada crawler; beberapa perusahaan menyebut permintaan seperti ini bisa tidak mengikuti robots.txt.
Google-Extended dan Applebot-Extended bukan crawler. Halaman tetap dirayapi Googlebot atau Applebot biasa; token hanya melarang pemakaian halaman untuk melatih model. Memblokir Google-Extended tidak memengaruhi peringkat di Google Penelusuran. Memblokir Googlebot agar tidak muncul di jawaban AI Google justru akan menghapus situs Anda dari pencarian.
Yang terpenting, robots.txt adalah kesepakatan, bukan perlindungan. Perusahaan terpercaya mematuhinya, tetapi Anda tidak bisa memastikannya dari luar, dan sebagian bot mengabaikan aturan. Jika konten tidak boleh diakses, Anda memerlukan autentikasi atau pembatasan di server atau CDN.
Kesalahan umum pada robots.txt
- Memblokir CSS dan JavaScript. Aturan seperti
Disallow: /*.js$atauDisallow: /assets/membuat mesin pencari tidak bisa merender halaman, sehingga halaman bisa terlihat kosong atau tidak ramah seluler. - Menyembunyikan halaman dengan robots.txt, bukan noindex. Memblokir perayapan tidak menghapus URL dari indeks: Google bisa menampilkannya tanpa deskripsi jika halaman lain menautkannya. Untuk menghapus halaman dari hasil pencarian, izinkan perayapan dan tambahkan
<meta name="robots" content="noindex">atau headerX-Robots-Tag. - Menganggap robots.txt sebagai keamanan. File ini publik. Baris seperti
Disallow: /panel-admin-rahasia/justru mengumumkan path itu kepada siapa saja yang membacanya. Lindungi area privat dengan login;/admin/yang umum di robots.txt sudah cukup — atau tidak perlu sama sekali. - Grup khusus tanpa aturan umum. Anda menambahkan
User-agent: Googlebotuntuk satu pengecualian, lalu Googlebot tidak lagi melihat aturan*. - Aturan sebelum User-agent. Baris
Disallowdi awal file, sebelum grup pertama, diabaikan. - Sitemap relatif. Gunakan URL lengkap:
Sitemap: https://example.co.id/sitemap.xml. Disallow: /yang tertinggal dari staging. Situs staging diblokir seluruhnya, file terbawa ke produksi, dan situs hilang dari pencarian. Periksa robots.txt setelah setiap rilis.- Satu file untuk semua subdomain. robots.txt hanya berlaku untuk host dan protokolnya sendiri:
app.example.co.iddanexample.co.idpunya file terpisah.
Pengaturan umum untuk SaaS: situs marketing terbuka, area /app/ diblokir dari perayapan dan dilindungi login, halaman daftar dan masuk terbuka. Jika produk berada di subdomain terpisah, subdomain itu punya robots.txt sendiri.
Sumber
- RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
- Google Search Central. Cara Google menafsirkan spesifikasi robots.txt — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
- Google Search Central. Ringkasan crawler dan pengambil Google (user agent) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
- Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
- Bing Webmaster Guidelines dan bantuan Bing Webmaster Tools: robots.txt dan kontrol perayapan — bing.com/webmasters.
- OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
- Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
- Perplexity. Perplexity Crawlers — docs.perplexity.ai.
- Apple. About Applebot — support.apple.com/119829.
- Common Crawl. CCBot — commoncrawl.org/ccbot.
Pertanyaan umum
Bagaimana cara membuat file robots.txt?
Pilih templat di generator (situs terbuka, bagian privat, SaaS atau toko online), sesuaikan path, tambahkan sitemap dan, jika perlu, blokir crawler AI. Salin hasilnya dan simpan sebagai robots.txt di root situs agar terbuka di https://domain-anda/robots.txt.
Bagaimana mengecek apakah halaman diblokir robots.txt?
Buka tab “Uji URL”, tempel isi file dan URL halaman, lalu pilih crawler. Alat menunjukkan apakah URL diizinkan, grup mana yang diterapkan dan aturan mana yang menentukan — ditambah hasil untuk Googlebot, Bingbot dan crawler AI.
Bagaimana cara memblokir crawler AI?
Tambahkan grup dengan token mereka dan Disallow: /, misalnya User-agent: GPTBot dan User-agent: ClaudeBot. Pisahkan bot berdasarkan tujuan: bot pelatihan tidak membawa trafik, sedangkan bot pencarian seperti OAI-SearchBot dan PerplexityBot mengirim pengunjung lewat tautan di jawaban. Ingat, robots.txt dipatuhi secara sukarela.
Apakah memblokir Google-Extended menghapus situs saya dari Google?
Tidak. Google-Extended adalah token kontrol, bukan crawler: melarang pemakaian halaman untuk melatih dan grounding model Gemini, tetapi tidak memengaruhi perayapan Googlebot maupun Google Penelusuran.
Apakah saya perlu Crawl-delay atau Host?
Biasanya tidak. Google mengabaikan Crawl-delay, dan Host adalah direktif Yandex yang sudah usang. Bing mematuhi Crawl-delay, tetapi kontrol perayapan di Bing Webmaster Tools adalah pilihan yang lebih baik.
Apakah Disallow menghapus halaman dari hasil pencarian?
Tidak bisa diandalkan. Disallow memblokir perayapan, tetapi Google bisa mengindeks URL tanpa isinya jika halaman lain menautkannya. Untuk menghapus halaman dari hasil, biarkan halaman bisa dirayapi dan tambahkan meta tag robots dengan noindex.
Mana yang menang: Allow atau Disallow?
Aturan dengan pola path yang lebih panjang, apa pun urutan barisnya. Jika sama panjang, Allow yang menang. Begitulah cara kerja Google dan RFC 9309.
Di mana robots.txt harus diletakkan?
Di root setiap host: https://example.co.id/robots.txt. File di subfolder diabaikan, dan setiap subdomain serta protokol memerlukan file sendiri.
Lainnya di SEO
- Pratinjau snippet
Seperti apa judul dan deskripsi di Google, dan apakah akan terpotong?
- Generator Open Graph
Tag Open Graph apa yang dibutuhkan halaman, dan seperti apa pratinjau link-nya?
- Pemeriksa keterbacaan
Seberapa sulit teks ini dibaca, dan kalimat mana yang terlalu panjang?
- Generator hreflang
Tag hreflang apa yang menghubungkan versi bahasa sebuah halaman?
- UTM builder
Bagaimana membuat link UTM yang konsisten untuk setiap kampanye dan kanal?
- Generator QR code UTM
Booth, brosur, atau poster mana yang mendatangkan pengunjung — dan bagaimana menandai kode QR untuk masing-masing?