HomeMga toolrobots.txt generator
robots.txt generator at tester na may AI crawler
Bumuo ng robots.txt mula template, i-block ang mga private na seksyon, piliin kung anong AI crawler ay may access sa inyong site, at subukan ang anumang URL: pinapayagan ba para sa Googlebot, Bingbot o GPTBot, at anong group at rule ang nagpasya.
—
Walang Crawl-delay o Host. Hindi sinusuportahan ng Google ang Crawl-delay, at ang Host ay directive ng Yandex lamang na itinigil noong 2018. Hindi idinaragdag ng generator ang mga ito.
—
Mga rule ng inilapat na group
| Linya | Rule | Haba | Tugma |
|---|
Ang URL na ito para sa iba't ibang crawler
| Crawler | Group | Access |
|---|
Pagsusuri ng file
Kinakalkula ang lahat sa inyong browser — hindi ipinapadala kahit saan ang inyong inilagay.
Paano gamitin
- Pumili ng templateBina-block ng “SaaS” ang app area at API; ng “E-commerce” ang cart, filter at sorting. Magdagdag ng sariling path at hiwalay na group para sa Googlebot o Bingbot.
- Magpasya sa AI crawlerNakagrupo ang mga bot ayon sa layunin: pag-train ng model, search na may citation, at request ng user. Maaaring i-block ang training at panatilihin ang search.
- Subukan ang mga URLInililipat ng “Subukan ang file na ito” ang resulta sa tab na “Subukan ang URL”, na nagpapakita ng group at rule na nagpapasya sa bawat URL para sa bawat crawler.
- I-publish ang fileKopyahin ang teksto at ilagay sa root ng domain: https://example.com.ph/robots.txt. Ang bawat subdomain at protocol ay may sariling file.
Syntax ng robots.txt: group, rule at precedence
Ang robots.txt ay text file sa root ng site na nagsasabi sa mga search crawler kung anong URL ay maaaring i-crawl. Mula 2022, ang mga rule sa pagbasa ay na-standardize sa RFC 9309; dokumentado ng Google at Bing ang parehong batayang prinsipyo at ilang sariling extension.
Binubuo ang file ng mga group. Ang group ay nagsisimula sa isa o higit na linyang User-agent, na sinusundan ng mga rule na Disallow at Allow. Ang mga linyang Sitemap ay hindi kabilang sa group at maaaring ilagay kahit saan.
Paano pumipili ng group ang crawler
Hinahanap ng crawler ang group na may token nito — case-insensitive — at sinusunod ang group na iyon lamang. Kung wala, gumagamit ng * group; kung wala rin, ang lahat ay pinapayagan. Pinagsasama ang mga group na may parehong token. Mula rito ang karaniwang pagkakamali: paglikha ng hiwalay na User-agent: Googlebot group at paglimot na ulitin ang mga rule ng *.
Dokumentado ng mga search engine ang fallback group: gumagamit ang Googlebot-Image at Googlebot-News ng mga rule ng Googlebot kung walang sariling group.
Paano pinipili ang rule
Inihahambing ang value ng rule sa simula ng path, kasama ang query string. Tumutugma ang * sa anumang sequence ng character, at ang $ sa dulo ay nagmamarka ng dulo ng URL. Kung maraming rule ay tumutugma, nananalo ang pinakamahaba; kung pantay, nananalo ang Allow. Hindi mahalaga ang ayos ng mga linya.
Ito ang precedence table mula dokumentasyon ng Google; sinusuri ito ng tool sa mga automated test. Hindi nag-block ng anuman ang walang lamang Disallow:. Inihahambing ang mga path sa normalized na anyo: ang non-ASCII na character ay UTF-8 percent-encoded. Case-sensitive ang mga path: ang /Admin/ at /admin/ ay magkaibang rule.
robots.txt para sa Google at Bing: ano ang pagkakaiba
Sa Pilipinas, dumaraan sa Google ang halos lahat ng paghahanap, sinusundan ng Bing; walang lokal na search engine na may sariling crawler na kailangang isaalang-alang. Magkapareho ang core: group, Allow at Disallow, ang * at $ wildcard, longest-match precedence. Nasa extension ang pagkakaiba.
- Crawl-delay. Binabalewala ng Google. Sinusunod ng Bing, ngunit ang crawl control ng Bing Webmaster Tools ay mas mahusay na lugar para sa crawl rate.
- Fallback group. Ang Googlebot-Image, -Video at -News ay gumagamit ng Googlebot group kung walang sariling group.
- Laki. Pinoproseso ng Google ang unang 500 KiB ng file at binabalewala ang natitira.
- Host at Clean-param. Mga directive ng Yandex. Binabalewala ng Google at Bing; gumamit ng 301 redirect para sa pangunahing host at
rel="canonical"para sa mga URL parameter. - Noindex. Itinigil ng Google ang pagsunod sa
Noindex:sa robots.txt noong 2019. Gamitin ang robots meta tag oX-Robots-Tagheader.
Para makita kung paano binabasa ng search engine ang live na file, gamitin ang robots.txt report sa Google Search Console o ang robots.txt tester sa Bing Webmaster Tools. Kapaki-pakinabang ang tool na ito bago i-publish: gumagana sa anumang teksto, hindi sa file ng inyong site lamang.
Paano i-block ang AI crawler — at kailangan ba
Nag-crawl ang mga AI company sa web para sa iba't ibang layunin, at ang mga pangunahing player ay gumagamit ng hiwalay na token para sa bawat isa. Magpasya ayon sa layunin, hindi “i-block ang lahat”.
| Token | May-ari | Layunin |
|---|---|---|
| GPTBot | OpenAI | pag-train ng model |
| OAI-SearchBot | OpenAI | ChatGPT search |
| ChatGPT-User | OpenAI | request ng user |
| ClaudeBot | Anthropic | pag-train ng model |
| Claude-SearchBot | Anthropic | search answer |
| Claude-User | Anthropic | request ng user |
| PerplexityBot | Perplexity | search at citation |
| Perplexity-User | Perplexity | request ng user |
| Google-Extended | token: training at grounding ng Gemini | |
| Applebot-Extended | Apple | token: training ng Apple model |
| CCBot | Common Crawl | open web archive |
| meta-externalagent | Meta | training at produkto |
| Amazonbot | Amazon | Amazon service at AI |
| Bytespider | ByteDance | pangongolekta ng data |
Tatlong grupo, tatlong pasya
- Pag-train ng model (GPTBot, ClaudeBot, CCBot at iba pa). Ang pag-block ay naglalayo sa mga bagong page mula sa mga susunod na training set. Hindi naghahatid ng traffic ang mga bot na ito, kaya pinakamadalas na bina-block — lalo na para sa paid at original na content.
- Search at mga sagot na may link (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Naghahatid ng bisita ang mga bot na ito: sinisipi ang inyong site na may link. Ang pag-block ay pagtalikod sa bagong channel. Karaniwang bukas ang mga ito sa SaaS at media site.
- Request ng user (ChatGPT-User, Claude-User, Perplexity-User). Binubuksan ang page dahil tahasang hiniling ng tao. Mas malapit sa browser kaysa crawler; ayon sa ilang kumpanya, maaaring hindi sumusunod sa robots.txt ang mga request na ito.
Hindi crawler ang Google-Extended at Applebot-Extended. Patuloy na nag-crawl ang karaniwang Googlebot o Applebot; ipinagbabawal ng token ang paggamit sa pag-train ng model lamang. Walang epekto sa ranking sa Google Search ang pag-block ng Google-Extended. Ang pag-block ng Googlebot para hindi lumabas sa AI answer ng Google ay mag-aalis sa inyo sa search.
Higit sa lahat, ang robots.txt ay kasunduan, hindi proteksyon. Sinusunod ng mga mapagkakatiwalaang kumpanya, ngunit hindi mapatunayan mula sa labas, at may mga bot na binabalewala ang mga rule. Kung ang content ay hindi dapat i-serve, kailangan ng authentication o restriction sa server o CDN.
Mga karaniwang pagkakamali sa robots.txt
- Pag-block ng CSS at JavaScript. Pinipigilan ng mga rule tulad ng
Disallow: /*.js$oDisallow: /assets/ang pag-render ng search engine, kaya ang page ay maaaring mukhang walang laman o hindi mobile-friendly. - Pagtago ng page gamit ang robots.txt sa halip ng noindex. Hindi inaalis ng pag-block ng crawling ang URL mula index: maaaring ipakita ng Google nang walang description kung may ibang page na nag-link. Para alisin ang page mula search, payagan ang crawling at magdagdag ng
<meta name="robots" content="noindex">oX-Robots-Tagheader. - Pagturing sa robots.txt bilang security. Public ang file. Ang linyang
Disallow: /secret-admin-panel/ay ipinapaalam ang path sa sinumang nagbasa. Protektahan ang private area gamit ang login; sapat ang generic na/admin/— o wala. - Hiwalay na group nang walang shared na rule. Nagdagdag ng
User-agent: Googlebotpara sa isang exception, at hindi na nakikita ng Googlebot ang mga rule ng*. - Rule bago User-agent. Binabalewala ang mga linyang
Disallowsa itaas ng file, bago ang unang group. - Relative na Sitemap. Gumamit ng buong URL:
Sitemap: https://example.com.ph/sitemap.xml. - Naiwang
Disallow: /mula staging. Naka-block ang buong staging, dinala ang file sa production, at nawala ang site sa search. Suriin ang robots.txt pagkatapos ng bawat release. - Isang file para sa lahat ng subdomain. Nalalapat ang robots.txt sa sariling host at protocol lamang:
app.example.com.phatexample.com.phay may hiwalay na file.
Karaniwang setup para sa SaaS: bukas ang marketing site, naka-block sa crawling at protektado ng login ang /app/ area, bukas ang signup at login page. Kung ang produkto ay nasa hiwalay na subdomain, may sariling robots.txt.
Mga sanggunian
- RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
- Google Search Central. How Google interprets the robots.txt specification — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
- Google Search Central. Overview of Google crawlers and fetchers (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
- Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
- Bing Webmaster Guidelines at Bing Webmaster Tools Help: robots.txt at crawl control — bing.com/webmasters.
- OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
- Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
- Perplexity. Perplexity Crawlers — docs.perplexity.ai.
- Apple. About Applebot — support.apple.com/119829.
- Common Crawl. CCBot — commoncrawl.org/ccbot.
Mga madalas na tanong
Paano gumawa ng robots.txt file?
Pumili ng template sa generator (bukas na site, private na seksyon, SaaS o e-commerce), ayusin ang mga path, idagdag ang sitemap at, kung nais, i-block ang AI crawler. Kopyahin ang resulta at i-save bilang robots.txt sa root ng site para bumukas sa https://inyong-domain/robots.txt.
Paano suriin kung naka-block ng robots.txt ang isang page?
Buksan ang tab na “Subukan ang URL”, i-paste ang nilalaman ng file at ang URL ng page, at pumili ng crawler. Ipinapakita ng tool kung pinapayagan ang URL, anong group ay inilapat at anong rule ay nagpasya — pati ang resulta para sa Googlebot, Bingbot at AI crawler.
Paano i-block ang AI crawler?
Magdagdag ng group na may kanilang token at Disallow: /, halimbawa User-agent: GPTBot at User-agent: ClaudeBot. Paghiwalayin ang mga bot ayon sa layunin: ang training bot ay hindi naghahatid ng traffic, habang ang search bot tulad ng OAI-SearchBot at PerplexityBot ay nagpapadala ng bisita sa pamamagitan ng link sa sagot. Tandaan na boluntaryo ang pagsunod sa robots.txt.
Inaalis ba ng pag-block ng Google-Extended ang aking site mula Google?
Hindi. Ang Google-Extended ay control token, hindi crawler: ipinagbabawal ang paggamit ng page sa pag-train at grounding ng Gemini model, ngunit walang epekto sa crawling ng Googlebot o Google Search.
Kailangan ba ang Crawl-delay o Host?
Karaniwang hindi. Binabalewala ng Google ang Crawl-delay, at ang Host ay lipas na directive ng Yandex. Sinusunod ng Bing ang Crawl-delay, ngunit ang crawl control ng Bing Webmaster Tools ay mas mahusay na opsyon.
Inaalis ba ng Disallow ang page mula search result?
Hindi tiyak. Bina-block ng Disallow ang crawling, ngunit maaaring i-index ng Google ang URL nang walang content kung may ibang page na nag-link. Para alisin ang page mula result, hayaang i-crawl at magdagdag ng robots meta tag na may noindex.
Ano ang nananalo: Allow o Disallow?
Ang rule na may mas mahabang path pattern, anuman ang ayos ng linya. Kung pantay ang haba, nananalo ang Allow. Ganoon ang Google at RFC 9309.
Saan dapat ilagay ang robots.txt?
Sa root ng bawat host: https://example.com.ph/robots.txt. Binabalewala ang file sa subfolder, at ang bawat subdomain at protocol ay nangangailangan ng sariling file.
Higit pa sa SEO
- SERP snippet preview
Paano lalabas ang title at description sa Google, at mapuputol ba ang mga ito?
- Open Graph generator
Aling Open Graph tag ang kailangan ng page, at paano lalabas ang preview ng link?
- Readability checker
Gaano mahirap basahin ang text na ito, at aling pangungusap ang sobrang haba?
- hreflang generator
Aling hreflang tag ang nag-uugnay sa mga bersiyon ng page sa iba't ibang wika?
- UTM builder
Paano gumawa ng magkakatugmang UTM link para sa bawat campaign at channel?
- UTM QR code generator
Aling booth, flyer o poster ang nagdala ng bisita — at paano lagyan ng tag ang QR code ng bawat isa?