Clew

HomeMga toolrobots.txt generator

robots.txt generator at tester na may AI crawler

Bumuo ng robots.txt mula template, i-block ang mga private na seksyon, piliin kung anong AI crawler ay may access sa inyong site, at subukan ang anumang URL: pinapayagan ba para sa Googlebot, Bingbot o GPTBot, at anong group at rule ang nagpasya.

● Libre, walang sign-upNa-update:

Template
Pinapalitan ng template ang mga group; pagkatapos ay i-edit nang manual.

Ang crawler ay sumusunod sa isang group lamang — sariling group o, kung wala, ang *. Kaya dapat ulitin ng Googlebot o Bingbot group ang mga shared na rule.

AI crawler: i-block ang access

Pag-train ng model

Search at mga sagot na may link

Mga request ng user

Ang robots.txt ay pakiusap, hindi kandado. Sinusunod ito ng mga kumpanyang mapagkakatiwalaan, ngunit may mga bot na binabalewala ito. Tanging server-side na kontrol — authentication o pag-block ayon sa IP at user agent — ang tunay na naglilimita sa access.

Buong URL ng sitemap, isa bawat linya.

—

 

    Walang Crawl-delay o Host. Hindi sinusuportahan ng Google ang Crawl-delay, at ang Host ay directive ng Yandex lamang na itinigil noong 2018. Hindi idinaragdag ng generator ang mga ito.

    Kinakalkula ang lahat sa inyong browser — hindi ipinapadala kahit saan ang inyong inilagay.

    Paano gamitin

    1. Pumili ng templateBina-block ng “SaaS” ang app area at API; ng “E-commerce” ang cart, filter at sorting. Magdagdag ng sariling path at hiwalay na group para sa Googlebot o Bingbot.
    2. Magpasya sa AI crawlerNakagrupo ang mga bot ayon sa layunin: pag-train ng model, search na may citation, at request ng user. Maaaring i-block ang training at panatilihin ang search.
    3. Subukan ang mga URLInililipat ng “Subukan ang file na ito” ang resulta sa tab na “Subukan ang URL”, na nagpapakita ng group at rule na nagpapasya sa bawat URL para sa bawat crawler.
    4. I-publish ang fileKopyahin ang teksto at ilagay sa root ng domain: https://example.com.ph/robots.txt. Ang bawat subdomain at protocol ay may sariling file.

    Syntax ng robots.txt: group, rule at precedence

    Ang robots.txt ay text file sa root ng site na nagsasabi sa mga search crawler kung anong URL ay maaaring i-crawl. Mula 2022, ang mga rule sa pagbasa ay na-standardize sa RFC 9309; dokumentado ng Google at Bing ang parehong batayang prinsipyo at ilang sariling extension.

    Binubuo ang file ng mga group. Ang group ay nagsisimula sa isa o higit na linyang User-agent, na sinusundan ng mga rule na Disallow at Allow. Ang mga linyang Sitemap ay hindi kabilang sa group at maaaring ilagay kahit saan.

    User-agent: * # group para sa lahat ng crawler Disallow: /app/ # i-block ang lahat na nagsisimula sa /app/ Allow: /app/signup # maliban sa signup page User-agent: GPTBot # dalawang User-agent na linya — User-agent: CCBot # isang shared group Disallow: / Sitemap: https://example.com.ph/sitemap.xml

    Paano pumipili ng group ang crawler

    Hinahanap ng crawler ang group na may token nito — case-insensitive — at sinusunod ang group na iyon lamang. Kung wala, gumagamit ng * group; kung wala rin, ang lahat ay pinapayagan. Pinagsasama ang mga group na may parehong token. Mula rito ang karaniwang pagkakamali: paglikha ng hiwalay na User-agent: Googlebot group at paglimot na ulitin ang mga rule ng *.

    Dokumentado ng mga search engine ang fallback group: gumagamit ang Googlebot-Image at Googlebot-News ng mga rule ng Googlebot kung walang sariling group.

    Paano pinipili ang rule

    Inihahambing ang value ng rule sa simula ng path, kasama ang query string. Tumutugma ang * sa anumang sequence ng character, at ang $ sa dulo ay nagmamarka ng dulo ng URL. Kung maraming rule ay tumutugma, nananalo ang pinakamahaba; kung pantay, nananalo ang Allow. Hindi mahalaga ang ayos ng mga linya.

    Allow: /p + Disallow: / → /page pinapayagan (2 character ay nananalo sa 1) Allow: /folder + Disallow: /folder → /folder/page pinapayagan (pantay na haba, nananalo ang Allow) Allow: /page + Disallow: /*.htm → /page.htm naka-block (6 character ay nananalo sa 5) Allow: /$ + Disallow: / → / pinapayagan; /page.htm naka-block

    Ito ang precedence table mula dokumentasyon ng Google; sinusuri ito ng tool sa mga automated test. Hindi nag-block ng anuman ang walang lamang Disallow:. Inihahambing ang mga path sa normalized na anyo: ang non-ASCII na character ay UTF-8 percent-encoded. Case-sensitive ang mga path: ang /Admin/ at /admin/ ay magkaibang rule.

    robots.txt para sa Google at Bing: ano ang pagkakaiba

    Sa Pilipinas, dumaraan sa Google ang halos lahat ng paghahanap, sinusundan ng Bing; walang lokal na search engine na may sariling crawler na kailangang isaalang-alang. Magkapareho ang core: group, Allow at Disallow, ang * at $ wildcard, longest-match precedence. Nasa extension ang pagkakaiba.

    • Crawl-delay. Binabalewala ng Google. Sinusunod ng Bing, ngunit ang crawl control ng Bing Webmaster Tools ay mas mahusay na lugar para sa crawl rate.
    • Fallback group. Ang Googlebot-Image, -Video at -News ay gumagamit ng Googlebot group kung walang sariling group.
    • Laki. Pinoproseso ng Google ang unang 500 KiB ng file at binabalewala ang natitira.
    • Host at Clean-param. Mga directive ng Yandex. Binabalewala ng Google at Bing; gumamit ng 301 redirect para sa pangunahing host at rel="canonical" para sa mga URL parameter.
    • Noindex. Itinigil ng Google ang pagsunod sa Noindex: sa robots.txt noong 2019. Gamitin ang robots meta tag o X-Robots-Tag header.

    Para makita kung paano binabasa ng search engine ang live na file, gamitin ang robots.txt report sa Google Search Console o ang robots.txt tester sa Bing Webmaster Tools. Kapaki-pakinabang ang tool na ito bago i-publish: gumagana sa anumang teksto, hindi sa file ng inyong site lamang.

    Paano i-block ang AI crawler — at kailangan ba

    Nag-crawl ang mga AI company sa web para sa iba't ibang layunin, at ang mga pangunahing player ay gumagamit ng hiwalay na token para sa bawat isa. Magpasya ayon sa layunin, hindi “i-block ang lahat”.

    Mga AI crawler ayon sa layunin
    TokenMay-ariLayunin
    GPTBotOpenAIpag-train ng model
    OAI-SearchBotOpenAIChatGPT search
    ChatGPT-UserOpenAIrequest ng user
    ClaudeBotAnthropicpag-train ng model
    Claude-SearchBotAnthropicsearch answer
    Claude-UserAnthropicrequest ng user
    PerplexityBotPerplexitysearch at citation
    Perplexity-UserPerplexityrequest ng user
    Google-ExtendedGoogletoken: training at grounding ng Gemini
    Applebot-ExtendedAppletoken: training ng Apple model
    CCBotCommon Crawlopen web archive
    meta-externalagentMetatraining at produkto
    AmazonbotAmazonAmazon service at AI
    BytespiderByteDancepangongolekta ng data

    Tatlong grupo, tatlong pasya

    • Pag-train ng model (GPTBot, ClaudeBot, CCBot at iba pa). Ang pag-block ay naglalayo sa mga bagong page mula sa mga susunod na training set. Hindi naghahatid ng traffic ang mga bot na ito, kaya pinakamadalas na bina-block — lalo na para sa paid at original na content.
    • Search at mga sagot na may link (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Naghahatid ng bisita ang mga bot na ito: sinisipi ang inyong site na may link. Ang pag-block ay pagtalikod sa bagong channel. Karaniwang bukas ang mga ito sa SaaS at media site.
    • Request ng user (ChatGPT-User, Claude-User, Perplexity-User). Binubuksan ang page dahil tahasang hiniling ng tao. Mas malapit sa browser kaysa crawler; ayon sa ilang kumpanya, maaaring hindi sumusunod sa robots.txt ang mga request na ito.

    Hindi crawler ang Google-Extended at Applebot-Extended. Patuloy na nag-crawl ang karaniwang Googlebot o Applebot; ipinagbabawal ng token ang paggamit sa pag-train ng model lamang. Walang epekto sa ranking sa Google Search ang pag-block ng Google-Extended. Ang pag-block ng Googlebot para hindi lumabas sa AI answer ng Google ay mag-aalis sa inyo sa search.

    Higit sa lahat, ang robots.txt ay kasunduan, hindi proteksyon. Sinusunod ng mga mapagkakatiwalaang kumpanya, ngunit hindi mapatunayan mula sa labas, at may mga bot na binabalewala ang mga rule. Kung ang content ay hindi dapat i-serve, kailangan ng authentication o restriction sa server o CDN.

    Mga karaniwang pagkakamali sa robots.txt

    • Pag-block ng CSS at JavaScript. Pinipigilan ng mga rule tulad ng Disallow: /*.js$ o Disallow: /assets/ ang pag-render ng search engine, kaya ang page ay maaaring mukhang walang laman o hindi mobile-friendly.
    • Pagtago ng page gamit ang robots.txt sa halip ng noindex. Hindi inaalis ng pag-block ng crawling ang URL mula index: maaaring ipakita ng Google nang walang description kung may ibang page na nag-link. Para alisin ang page mula search, payagan ang crawling at magdagdag ng <meta name="robots" content="noindex"> o X-Robots-Tag header.
    • Pagturing sa robots.txt bilang security. Public ang file. Ang linyang Disallow: /secret-admin-panel/ ay ipinapaalam ang path sa sinumang nagbasa. Protektahan ang private area gamit ang login; sapat ang generic na /admin/ — o wala.
    • Hiwalay na group nang walang shared na rule. Nagdagdag ng User-agent: Googlebot para sa isang exception, at hindi na nakikita ng Googlebot ang mga rule ng *.
    • Rule bago User-agent. Binabalewala ang mga linyang Disallow sa itaas ng file, bago ang unang group.
    • Relative na Sitemap. Gumamit ng buong URL: Sitemap: https://example.com.ph/sitemap.xml.
    • Naiwang Disallow: / mula staging. Naka-block ang buong staging, dinala ang file sa production, at nawala ang site sa search. Suriin ang robots.txt pagkatapos ng bawat release.
    • Isang file para sa lahat ng subdomain. Nalalapat ang robots.txt sa sariling host at protocol lamang: app.example.com.ph at example.com.ph ay may hiwalay na file.

    Karaniwang setup para sa SaaS: bukas ang marketing site, naka-block sa crawling at protektado ng login ang /app/ area, bukas ang signup at login page. Kung ang produkto ay nasa hiwalay na subdomain, may sariling robots.txt.

    Mga sanggunian

    1. RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
    2. Google Search Central. How Google interprets the robots.txt specification — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
    3. Google Search Central. Overview of Google crawlers and fetchers (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
    4. Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
    5. Bing Webmaster Guidelines at Bing Webmaster Tools Help: robots.txt at crawl control — bing.com/webmasters.
    6. OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
    7. Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
    8. Perplexity. Perplexity Crawlers — docs.perplexity.ai.
    9. Apple. About Applebot — support.apple.com/119829.
    10. Common Crawl. CCBot — commoncrawl.org/ccbot.

    Mga madalas na tanong

    Paano gumawa ng robots.txt file?

    Pumili ng template sa generator (bukas na site, private na seksyon, SaaS o e-commerce), ayusin ang mga path, idagdag ang sitemap at, kung nais, i-block ang AI crawler. Kopyahin ang resulta at i-save bilang robots.txt sa root ng site para bumukas sa https://inyong-domain/robots.txt.

    Paano suriin kung naka-block ng robots.txt ang isang page?

    Buksan ang tab na “Subukan ang URL”, i-paste ang nilalaman ng file at ang URL ng page, at pumili ng crawler. Ipinapakita ng tool kung pinapayagan ang URL, anong group ay inilapat at anong rule ay nagpasya — pati ang resulta para sa Googlebot, Bingbot at AI crawler.

    Paano i-block ang AI crawler?

    Magdagdag ng group na may kanilang token at Disallow: /, halimbawa User-agent: GPTBot at User-agent: ClaudeBot. Paghiwalayin ang mga bot ayon sa layunin: ang training bot ay hindi naghahatid ng traffic, habang ang search bot tulad ng OAI-SearchBot at PerplexityBot ay nagpapadala ng bisita sa pamamagitan ng link sa sagot. Tandaan na boluntaryo ang pagsunod sa robots.txt.

    Inaalis ba ng pag-block ng Google-Extended ang aking site mula Google?

    Hindi. Ang Google-Extended ay control token, hindi crawler: ipinagbabawal ang paggamit ng page sa pag-train at grounding ng Gemini model, ngunit walang epekto sa crawling ng Googlebot o Google Search.

    Kailangan ba ang Crawl-delay o Host?

    Karaniwang hindi. Binabalewala ng Google ang Crawl-delay, at ang Host ay lipas na directive ng Yandex. Sinusunod ng Bing ang Crawl-delay, ngunit ang crawl control ng Bing Webmaster Tools ay mas mahusay na opsyon.

    Inaalis ba ng Disallow ang page mula search result?

    Hindi tiyak. Bina-block ng Disallow ang crawling, ngunit maaaring i-index ng Google ang URL nang walang content kung may ibang page na nag-link. Para alisin ang page mula result, hayaang i-crawl at magdagdag ng robots meta tag na may noindex.

    Ano ang nananalo: Allow o Disallow?

    Ang rule na may mas mahabang path pattern, anuman ang ayos ng linya. Kung pantay ang haba, nananalo ang Allow. Ganoon ang Google at RFC 9309.

    Saan dapat ilagay ang robots.txt?

    Sa root ng bawat host: https://example.com.ph/robots.txt. Binabalewala ang file sa subfolder, at ang bawat subdomain at protocol ay nangangailangan ng sariling file.

    Higit pa sa SEO

    • SERP snippet preview

      Paano lalabas ang title at description sa Google, at mapuputol ba ang mga ito?

    • Open Graph generator

      Aling Open Graph tag ang kailangan ng page, at paano lalabas ang preview ng link?

    • Readability checker

      Gaano mahirap basahin ang text na ito, at aling pangungusap ang sobrang haba?

    • hreflang generator

      Aling hreflang tag ang nag-uugnay sa mga bersiyon ng page sa iba't ibang wika?

    • UTM builder

      Paano gumawa ng magkakatugmang UTM link para sa bawat campaign at channel?

    • UTM QR code generator

      Aling booth, flyer o poster ang nagdala ng bisita — at paano lagyan ng tag ang QR code ng bawat isa?

    Mga tour, tooltip at checklist na makikita ang epekto sa mga numero.

    Subukan ang Clew nang librePaano ito gumaganaFree plan habambuhay · walang credit card

    Product tours, popups at onboarding sa panahon ng AI

    7 pattern na may bilang ng hakbang, tuntunin sa copy at dapat sukatin, ang binabago ng AI, at checklist bago mag-publish. PDF, 2 pahina. Ano ang laman →

    Nasa English ang gabay.