Clew

BerandaAlatGenerator robots.txt

Generator dan penguji robots.txt dengan crawler AI

Buat robots.txt dari templat, tutup bagian privat, tentukan crawler AI mana yang boleh mengakses situs Anda, lalu uji URL mana pun: apakah diizinkan untuk Googlebot, Bingbot atau GPTBot, serta grup dan aturan mana yang menentukannya.

● Gratis, tanpa daftarDiperbarui:

Templat
Templat mengganti semua grup; setelah itu sunting secara manual.

Crawler hanya mengikuti satu grup — grupnya sendiri atau, jika tidak ada, grup *. Karena itu grup Googlebot atau Bingbot harus mengulang aturan umum.

Crawler AI: blokir akses

Pelatihan model

Pencarian dan jawaban bertautan

Permintaan pengguna

robots.txt adalah permintaan, bukan kunci. Perusahaan terpercaya mematuhinya, tetapi sebagian bot mengabaikannya. Hanya kontrol di server — autentikasi atau blokir berdasarkan IP dan user agent — yang benar-benar membatasi akses.

URL sitemap lengkap, satu per baris.

—

 

    Tanpa Crawl-delay dan Host. Google tidak mendukung Crawl-delay, dan Host adalah direktif khusus Yandex yang dihentikan pada 2018. Generator ini tidak menambahkannya.

    Semua dihitung di browser Anda — data yang Anda masukkan tidak dikirim ke mana pun.

    Cara memakai

    1. Pilih templat“SaaS” menutup area aplikasi dan API; “Toko online” menutup keranjang, filter dan pengurutan. Tambahkan path Anda sendiri dan grup terpisah untuk Googlebot atau Bingbot.
    2. Putuskan soal crawler AIBot dikelompokkan berdasarkan tujuan: pelatihan model, pencarian dengan kutipan, dan permintaan pengguna. Anda bisa memblokir pelatihan dan tetap membuka pencarian.
    3. Uji URL“Uji file ini” memindahkan hasil ke tab “Uji URL”, yang menunjukkan grup dan aturan yang menentukan nasib sebuah URL untuk setiap crawler.
    4. Publikasikan fileSalin teksnya dan letakkan di root domain: https://example.co.id/robots.txt. Setiap subdomain dan protokol punya file sendiri.

    Sintaks robots.txt: grup, aturan dan prioritas

    robots.txt adalah file teks di root situs yang memberi tahu crawler mesin pencari URL mana yang boleh dirayapi. Sejak 2022 aturan pembacaannya distandarkan dalam RFC 9309; Google dan Bing mendokumentasikan prinsip dasar yang sama ditambah beberapa ekstensi sendiri.

    File terdiri dari grup. Grup dimulai dengan satu atau beberapa baris User-agent, diikuti aturan Disallow dan Allow. Baris Sitemap tidak termasuk grup dan boleh diletakkan di mana saja.

    User-agent: * # grup untuk semua crawler Disallow: /app/ # blokir semua yang diawali /app/ Allow: /app/daftar # kecuali halaman pendaftaran User-agent: GPTBot # dua baris User-agent — User-agent: CCBot # satu grup bersama Disallow: / Sitemap: https://example.co.id/sitemap.xml

    Cara crawler memilih grup

    Crawler mencari grup dengan tokennya — tanpa membedakan huruf besar dan kecil — dan hanya mengikuti grup itu. Jika tidak ada, crawler memakai grup *; jika grup itu juga tidak ada, semuanya diizinkan. Grup dengan token yang sama digabung. Dari sini muncul kesalahan umum: membuat grup User-agent: Googlebot terpisah dan lupa mengulang aturan dari *.

    Mesin pencari mendokumentasikan grup cadangan: Googlebot-Image dan Googlebot-News memakai aturan Googlebot jika tidak punya grup sendiri.

    Cara aturan dipilih

    Nilai aturan dibandingkan dengan awal path, termasuk query string. * cocok dengan urutan karakter apa pun, dan $ di akhir menandai akhir URL. Jika beberapa aturan cocok, yang terpanjang menang; jika sama panjang, Allow yang menang. Urutan baris tidak berpengaruh.

    Allow: /p + Disallow: / → /page diizinkan (2 karakter mengalahkan 1) Allow: /folder + Disallow: /folder → /folder/page diizinkan (sama panjang, Allow menang) Allow: /page + Disallow: /*.htm → /page.htm diblokir (6 karakter mengalahkan 5) Allow: /$ + Disallow: / → / diizinkan; /page.htm diblokir

    Ini adalah tabel prioritas dari dokumentasi Google; alat ini memeriksanya dalam pengujian otomatis. Disallow: yang kosong tidak memblokir apa pun. Path dibandingkan dalam bentuk ternormalisasi: karakter non-ASCII dienkode UTF-8 dengan persen. Path membedakan huruf besar dan kecil: /Admin/ dan /admin/ adalah aturan yang berbeda.

    robots.txt untuk Google dan Bing: apa bedanya

    Di Indonesia, hampir semua pencarian melalui Google, disusul Bing; tidak ada mesin pencari lokal dengan crawler sendiri yang perlu diperhitungkan. Intinya sama: grup, Allow dan Disallow, wildcard * dan $, prioritas kecocokan terpanjang. Perbedaannya ada pada ekstensi.

    • Crawl-delay. Google mengabaikannya. Bing mematuhinya, tetapi kontrol perayapan di Bing Webmaster Tools adalah tempat yang lebih baik untuk mengatur frekuensi.
    • Grup cadangan. Googlebot-Image, -Video dan -News memakai grup Googlebot jika tidak punya grup sendiri.
    • Ukuran. Google memproses 500 KiB pertama file dan mengabaikan sisanya.
    • Host dan Clean-param. Ini direktif Yandex. Google dan Bing mengabaikannya; gunakan redirect 301 untuk host utama dan rel="canonical" untuk parameter URL.
    • Noindex. Google berhenti mematuhi Noindex: di robots.txt pada 2019. Gunakan meta tag robots atau header X-Robots-Tag.

    Untuk melihat cara mesin pencari membaca file yang sudah tayang, gunakan laporan robots.txt di Google Search Console atau penguji robots.txt di Bing Webmaster Tools. Alat ini berguna sebelum publikasi: bisa dipakai untuk teks apa pun, tidak hanya file di situs Anda.

    Cara memblokir crawler AI — dan perlukah

    Perusahaan AI merayapi web untuk tujuan yang berbeda, dan pemain besar memakai token terpisah untuk setiap tujuan. Putuskan berdasarkan tujuan, bukan sekadar “blokir semuanya”.

    Crawler AI berdasarkan tujuan
    TokenPemilikTujuan
    GPTBotOpenAIpelatihan model
    OAI-SearchBotOpenAIpencarian ChatGPT
    ChatGPT-UserOpenAIpermintaan pengguna
    ClaudeBotAnthropicpelatihan model
    Claude-SearchBotAnthropicjawaban pencarian
    Claude-UserAnthropicpermintaan pengguna
    PerplexityBotPerplexitypencarian dan kutipan
    Perplexity-UserPerplexitypermintaan pengguna
    Google-ExtendedGoogletoken: pelatihan dan grounding Gemini
    Applebot-ExtendedAppletoken: pelatihan model Apple
    CCBotCommon Crawlarsip web terbuka
    meta-externalagentMetapelatihan dan produk
    AmazonbotAmazonlayanan Amazon dan AI
    BytespiderByteDancepengumpulan data

    Tiga kelompok, tiga keputusan

    • Pelatihan model (GPTBot, ClaudeBot, CCBot dan lainnya). Memblokirnya menjauhkan halaman baru dari dataset pelatihan berikutnya. Bot ini tidak membawa trafik, jadi paling sering diblokir — terutama untuk konten berbayar dan orisinal.
    • Pencarian dan jawaban bertautan (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Bot ini membawa pengunjung: situs Anda dikutip beserta tautannya. Memblokirnya berarti melepas kanal baru. Situs SaaS dan media biasanya membiarkannya terbuka.
    • Permintaan pengguna (ChatGPT-User, Claude-User, Perplexity-User). Halaman dibuka karena seseorang secara eksplisit memintanya. Ini lebih mirip browser daripada crawler; beberapa perusahaan menyebut permintaan seperti ini bisa tidak mengikuti robots.txt.

    Google-Extended dan Applebot-Extended bukan crawler. Halaman tetap dirayapi Googlebot atau Applebot biasa; token hanya melarang pemakaian halaman untuk melatih model. Memblokir Google-Extended tidak memengaruhi peringkat di Google Penelusuran. Memblokir Googlebot agar tidak muncul di jawaban AI Google justru akan menghapus situs Anda dari pencarian.

    Yang terpenting, robots.txt adalah kesepakatan, bukan perlindungan. Perusahaan terpercaya mematuhinya, tetapi Anda tidak bisa memastikannya dari luar, dan sebagian bot mengabaikan aturan. Jika konten tidak boleh diakses, Anda memerlukan autentikasi atau pembatasan di server atau CDN.

    Kesalahan umum pada robots.txt

    • Memblokir CSS dan JavaScript. Aturan seperti Disallow: /*.js$ atau Disallow: /assets/ membuat mesin pencari tidak bisa merender halaman, sehingga halaman bisa terlihat kosong atau tidak ramah seluler.
    • Menyembunyikan halaman dengan robots.txt, bukan noindex. Memblokir perayapan tidak menghapus URL dari indeks: Google bisa menampilkannya tanpa deskripsi jika halaman lain menautkannya. Untuk menghapus halaman dari hasil pencarian, izinkan perayapan dan tambahkan <meta name="robots" content="noindex"> atau header X-Robots-Tag.
    • Menganggap robots.txt sebagai keamanan. File ini publik. Baris seperti Disallow: /panel-admin-rahasia/ justru mengumumkan path itu kepada siapa saja yang membacanya. Lindungi area privat dengan login; /admin/ yang umum di robots.txt sudah cukup — atau tidak perlu sama sekali.
    • Grup khusus tanpa aturan umum. Anda menambahkan User-agent: Googlebot untuk satu pengecualian, lalu Googlebot tidak lagi melihat aturan *.
    • Aturan sebelum User-agent. Baris Disallow di awal file, sebelum grup pertama, diabaikan.
    • Sitemap relatif. Gunakan URL lengkap: Sitemap: https://example.co.id/sitemap.xml.
    • Disallow: / yang tertinggal dari staging. Situs staging diblokir seluruhnya, file terbawa ke produksi, dan situs hilang dari pencarian. Periksa robots.txt setelah setiap rilis.
    • Satu file untuk semua subdomain. robots.txt hanya berlaku untuk host dan protokolnya sendiri: app.example.co.id dan example.co.id punya file terpisah.

    Pengaturan umum untuk SaaS: situs marketing terbuka, area /app/ diblokir dari perayapan dan dilindungi login, halaman daftar dan masuk terbuka. Jika produk berada di subdomain terpisah, subdomain itu punya robots.txt sendiri.

    Sumber

    1. RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
    2. Google Search Central. Cara Google menafsirkan spesifikasi robots.txt — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
    3. Google Search Central. Ringkasan crawler dan pengambil Google (user agent) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
    4. Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
    5. Bing Webmaster Guidelines dan bantuan Bing Webmaster Tools: robots.txt dan kontrol perayapan — bing.com/webmasters.
    6. OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
    7. Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
    8. Perplexity. Perplexity Crawlers — docs.perplexity.ai.
    9. Apple. About Applebot — support.apple.com/119829.
    10. Common Crawl. CCBot — commoncrawl.org/ccbot.

    Pertanyaan umum

    Bagaimana cara membuat file robots.txt?

    Pilih templat di generator (situs terbuka, bagian privat, SaaS atau toko online), sesuaikan path, tambahkan sitemap dan, jika perlu, blokir crawler AI. Salin hasilnya dan simpan sebagai robots.txt di root situs agar terbuka di https://domain-anda/robots.txt.

    Bagaimana mengecek apakah halaman diblokir robots.txt?

    Buka tab “Uji URL”, tempel isi file dan URL halaman, lalu pilih crawler. Alat menunjukkan apakah URL diizinkan, grup mana yang diterapkan dan aturan mana yang menentukan — ditambah hasil untuk Googlebot, Bingbot dan crawler AI.

    Bagaimana cara memblokir crawler AI?

    Tambahkan grup dengan token mereka dan Disallow: /, misalnya User-agent: GPTBot dan User-agent: ClaudeBot. Pisahkan bot berdasarkan tujuan: bot pelatihan tidak membawa trafik, sedangkan bot pencarian seperti OAI-SearchBot dan PerplexityBot mengirim pengunjung lewat tautan di jawaban. Ingat, robots.txt dipatuhi secara sukarela.

    Apakah memblokir Google-Extended menghapus situs saya dari Google?

    Tidak. Google-Extended adalah token kontrol, bukan crawler: melarang pemakaian halaman untuk melatih dan grounding model Gemini, tetapi tidak memengaruhi perayapan Googlebot maupun Google Penelusuran.

    Apakah saya perlu Crawl-delay atau Host?

    Biasanya tidak. Google mengabaikan Crawl-delay, dan Host adalah direktif Yandex yang sudah usang. Bing mematuhi Crawl-delay, tetapi kontrol perayapan di Bing Webmaster Tools adalah pilihan yang lebih baik.

    Apakah Disallow menghapus halaman dari hasil pencarian?

    Tidak bisa diandalkan. Disallow memblokir perayapan, tetapi Google bisa mengindeks URL tanpa isinya jika halaman lain menautkannya. Untuk menghapus halaman dari hasil, biarkan halaman bisa dirayapi dan tambahkan meta tag robots dengan noindex.

    Mana yang menang: Allow atau Disallow?

    Aturan dengan pola path yang lebih panjang, apa pun urutan barisnya. Jika sama panjang, Allow yang menang. Begitulah cara kerja Google dan RFC 9309.

    Di mana robots.txt harus diletakkan?

    Di root setiap host: https://example.co.id/robots.txt. File di subfolder diabaikan, dan setiap subdomain serta protokol memerlukan file sendiri.

    Lainnya di SEO

    • Pratinjau snippet

      Seperti apa judul dan deskripsi di Google, dan apakah akan terpotong?

    • Generator Open Graph

      Tag Open Graph apa yang dibutuhkan halaman, dan seperti apa pratinjau link-nya?

    • Pemeriksa keterbacaan

      Seberapa sulit teks ini dibaca, dan kalimat mana yang terlalu panjang?

    • Generator hreflang

      Tag hreflang apa yang menghubungkan versi bahasa sebuah halaman?

    • UTM builder

      Bagaimana membuat link UTM yang konsisten untuk setiap kampanye dan kanal?

    • Generator QR code UTM

      Booth, brosur, atau poster mana yang mendatangkan pengunjung — dan bagaimana menandai kode QR untuk masing-masing?

    Tur, tooltip, dan checklist yang dampaknya terlihat di angka.

    Coba Clew gratisCara kerjanyaPaket gratis selamanya · tanpa kartu kredit

    Product tour, popup, dan onboarding di era AI

    7 pola lengkap dengan jumlah langkah, aturan teks, dan metrik, apa yang diubah AI, serta checklist sebelum terbit. PDF, 2 halaman. Isi panduan →

    Panduannya dalam bahasa Inggris.