Басты бетҚұралдарrobots.txt генераторы
robots.txt генераторы және тексерушісі AI роботтарымен
Үлгіден robots.txt құрастырыңыз, жабық бөлімдерді жабыңыз, қай AI роботтары сайтқа кіре алатынын шешіңіз және кез келген URL-ді тексеріңіз: ол Googlebot, YandexBot немесе GPTBot үшін рұқсат етілген бе, мұны қай топ пен қай ереже шешті.
—
Crawl-delay және Host жоқ. Google Crawl-delay-ді қолдамайды, ал Host — 2018 жылы тоқтатылған Яндекс директивасы. Генератор оларды қоспайды. Яндекске Clean-param керек болса, оны файлға қолмен қосыңыз — тексеруші синтаксисін тексереді.
—
Қолданылған топтың ережелері
| Жол | Ереже | Ұзындық | Сәйкестік |
|---|
Бұл URL әртүрлі роботтар үшін
| Робот | Топ | Кіру |
|---|
Файлды тексеру
Барлығы браузеріңізде есептеледі — енгізген деректеріңіз ешқайда жіберілмейді.
Қалай пайдалану керек
- Үлгіні таңдаңыз«SaaS» қосымша аймағы мен API-ді жабады; «Интернет-дүкен» себетті, сүзгілерді және сұрыптауды жабады. Өз жолдарыңызды және Googlebot немесе Bingbot үшін жеке топтарды қосыңыз.
- AI роботтары туралы шешіңізБоттар мақсаты бойынша топтастырылған: модельдерді оқыту, дәйексөзі бар іздеу және пайдаланушы сұраулары. Оқытуды жауып, іздеуді ашық қалдыруға болады.
- URL-дерді тексеріңіз«Бұл файлды тексеру» нәтижені «URL тексеру» қойындысына ауыстырады, онда әр робот үшін URL тағдырын шешетін топ пен ереже көрсетіледі.
- Файлды жариялаңызМәтінді көшіріп, домен түбіріне орналастырыңыз: https://example.kz/robots.txt. Әр субдомен мен хаттаманың өз файлы болады.
robots.txt синтаксисі: топтар, ережелер және басымдық
robots.txt — сайт түбіріндегі мәтіндік файл, ол іздеу роботтарына қай URL-дерді аралауға болатынын айтады. 2022 жылдан бастап оқу ережелері RFC 9309 стандартында бекітілген; Google, Bing және Яндекс сол негізгі қағидаттарды және өздерінің бірнеше кеңейтуін құжаттайды.
Файл топтардан тұрады. Топ бір немесе бірнеше User-agent жолынан басталады, одан кейін Disallow және Allow ережелері келеді. Sitemap жолдары топқа жатпайды және кез келген жерде тұра алады.
Робот топты қалай таңдайды
Робот өз токені бар топты — әріп регистріне қарамай — іздейді және тек сол топты ұстанады. Ондай топ болмаса, * тобын қолданады; ол да болмаса, бәріне рұқсат. Бірдей токені бар топтар біріктіріледі. Осыдан жиі қате туады: бөлек User-agent: Googlebot тобын құрып, оған * ережелерін қайталауды ұмыту.
Іздеу жүйелері резервтік топтарды құжаттайды: Googlebot-Image мен Googlebot-News өз тобы болмаса, Googlebot ережелерін қолданады.
Ереже қалай таңдалады
Ереже мәні жолдың басымен, сұрау жолын қоса, салыстырылады. * кез келген таңбалар тізбегіне сәйкес келеді, соңындағы $ URL соңын білдіреді. Бірнеше ереже сәйкес келсе, ең ұзыны жеңеді; тең болса, Allow жеңеді. Жолдардың реті маңызды емес.
Бұл — Google құжаттамасындағы басымдық кестесі; құрал оны автоматты тесттерде тексереді. Бос Disallow: ештеңені жаппайды. Жолдар қалыпты түрде салыстырылады: ASCII емес таңбалар UTF-8 пайыздық кодтауға келтіріледі, сондықтан /каталог/ пен оның кодталған нұсқасы бірдей. Жолдар регистрге сезімтал: /Admin/ пен /admin/ — әртүрлі ережелер.
Google, Яндекс және Bing үшін robots.txt: айырмашылық неде
Қазақстанда іздеудің көп бөлігі Google арқылы өтеді, бірақ Яндекс те айтарлықтай үлесті сақтайды, сондықтан YandexBot құралдың тізімінде бар. Негізі ортақ: топтар, Allow және Disallow, * пен $ таңбалары, ең ұзын сәйкестік басымдығы. Айырмашылық кеңейтулерде.
- Crawl-delay. Google елемейді. Bing ескереді; Яндекс 2018 жылдан бері бұл директиваны ескермейді, аралау жылдамдығы Яндекс Вебмастерде бапталады.
- Clean-param. Тек Яндекс түсінеді: UTM белгілері сияқты мазмұнға әсер етпейтін параметрлерді елемеуді сұрайды. Google мен Bing үшін URL параметрлеріне
rel="canonical"қолданыңыз. - Host. Ескірген Яндекс директивасы; басты айна 301 бағыттаумен көрсетіледі. Google оны ешқашан қолдамаған.
- Резервтік топтар. Googlebot-Image, -Video және -News өз тобы болмаса, Googlebot тобын қолданады.
- Көлем. Google файлдың алғашқы 500 КиБ-ын өңдейді, қалғанын елемейді.
- Noindex. Google 2019 жылдан бастап robots.txt ішіндегі
Noindex:директивасын ескермейді. robots мета тегін немесеX-Robots-Tagтақырыбын қолданыңыз.
Іздеу жүйесі жарияланған файлды қалай оқитынын көру үшін Google Search Console-дағы robots.txt есебін, Яндекс Вебмастердегі robots.txt талдауын немесе Bing Webmaster Tools тексерушісін қолданыңыз. Бұл құрал жарияламас бұрын ыңғайлы: сайттағы файлмен ғана емес, кез келген мәтінмен жұмыс істейді.
AI роботтарын қалай жабуға болады және жабу керек пе
AI компаниялары интернетті әртүрлі мақсатпен аралайды, ірі ойыншылар әр мақсатқа бөлек токен қолданады. «Бәрін жабу» емес, мақсатына қарай шешім қабылдаңыз.
| Токен | Иесі | Мақсаты |
|---|---|---|
| GPTBot | OpenAI | модельдерді оқыту |
| OAI-SearchBot | OpenAI | ChatGPT іздеуі |
| ChatGPT-User | OpenAI | пайдаланушы сұрауы |
| ClaudeBot | Anthropic | модельдерді оқыту |
| Claude-SearchBot | Anthropic | іздеу жауаптары |
| Claude-User | Anthropic | пайдаланушы сұрауы |
| PerplexityBot | Perplexity | іздеу және дәйексөздер |
| Perplexity-User | Perplexity | пайдаланушы сұрауы |
| Google-Extended | токен: Gemini оқыту және grounding | |
| Applebot-Extended | Apple | токен: Apple модельдерін оқыту |
| CCBot | Common Crawl | ашық веб-мұрағат |
| meta-externalagent | Meta | оқыту және өнімдер |
| Amazonbot | Amazon | Amazon сервистері және AI |
| Bytespider | ByteDance | деректер жинау |
Үш топ — үш шешім
- Модельдерді оқыту (GPTBot, ClaudeBot, CCBot және басқалары). Жабу жаңа беттерді болашақ оқыту жиынтықтарынан тыс қалдырады. Бұл боттар трафик әкелмейді, сондықтан оларды жиі жабады — әсіресе ақылы және төл контентте.
- Іздеу және сілтемесі бар жауаптар (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Бұл боттар келушілер әкеледі: сайтыңыз сілтемемен келтіріледі. Оларды жабу — жаңа арнадан бас тарту. SaaS және медиа сайттар әдетте оларды ашық қалдырады.
- Пайдаланушы сұраулары (ChatGPT-User, Claude-User, Perplexity-User). Бетті адам тікелей сұрағандықтан ашады. Бұл роботтан гөрі браузерге жақын; кейбір компаниялар мұндай сұраулар robots.txt-ті ұстанбауы мүмкін екенін айтады.
Google-Extended пен Applebot-Extended — робот емес. Беттерді кәдімгі Googlebot немесе Applebot аралай береді; токен тек оларды модельдерді оқытуға пайдалануға тыйым салады. Google-Extended-ті жабу Google іздеуіндегі позицияға әсер етпейді. Google-дың AI жауаптарына түспеу үшін Googlebot-ты жапсаңыз, іздеуден де шығып қаласыз.
Ең бастысы, robots.txt — қорғаныс емес, келісім. Сенімді компаниялар оны сақтайды, бірақ мұны сырттан тексере алмайсыз, ал кейбір боттар ережелерді елемейді. Контент берілмеуі керек болса, авторизация немесе сервер не CDN деңгейінде шектеу қажет.
robots.txt-тегі жиі қателер
- CSS пен JavaScript-ті жабу.
Disallow: /*.js$немесеDisallow: /assets/сияқты ережелер іздеу жүйелеріне бетті көрсетуге кедергі келтіреді, бет бос немесе мобильді құрылғыға бейімделмеген болып көрінуі мүмкін. - Беттерді noindex орнына robots.txt арқылы жасыру. Аралауды жабу URL-ді индекстен шығармайды: басқа беттер сілтейтін болса, Google оны сипаттамасыз көрсетуі мүмкін. Бетті іздеуден шығару үшін аралауға рұқсат беріп,
<meta name="robots" content="noindex">немесеX-Robots-Tagтақырыбын қосыңыз. - robots.txt-ті қауіпсіздік құралы деп санау. Файл ашық.
Disallow: /secret-admin-panel/сияқты жол оны оқыған кез келген адамға жолды жариялайды. Жабық аймақтарды логинмен қорғаңыз; robots.txt-те жалпы/admin/жеткілікті — немесе ештеңе керек емес. - Ортақ ережелерсіз жеке топ. Бір ерекшелік үшін
User-agent: Googlebotқосасыз, ал Googlebot*ережелерін көрмей қалады. - User-agent алдындағы ережелер. Файлдың басындағы, бірінші топқа дейінгі
Disallowжолдары еленбейді. - Салыстырмалы Sitemap. Толық URL қолданыңыз:
Sitemap: https://example.kz/sitemap.xml. - Тест ортасынан қалған
Disallow: /. Staging толық жабылған еді, файл продакшенге өтіп, сайт іздеуден жоғалады. Әр релизден кейін robots.txt-ті тексеріңіз. - Барлық субдоменге бір файл. robots.txt тек өз хосты мен хаттамасына қолданылады:
app.example.kzменexample.kzфайлдары бөлек.
SaaS үшін әдеттегі баптау: маркетинг сайты ашық, /app/ аймағы аралауға жабық және логинмен қорғалған, тіркелу мен кіру беттері ашық. Өнім бөлек субдоменде болса, оның өз robots.txt файлы бар.
Дереккөздер
- RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
- Google Search Central. How Google interprets the robots.txt specification — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
- Google Search Central. Overview of Google crawlers and fetchers (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
- Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
- Яндекс Вебмастер анықтамасы: robots.txt, Clean-param директивасы — yandex.ru/support/webmaster.
- Bing Webmaster Guidelines және Bing Webmaster Tools анықтамасы: robots.txt және аралау бақылауы — bing.com/webmasters.
- OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
- Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
- Perplexity. Perplexity Crawlers — docs.perplexity.ai.
- Apple. About Applebot — support.apple.com/119829.
- Common Crawl. CCBot — commoncrawl.org/ccbot.
Жиі қойылатын сұрақтар
robots.txt файлын қалай жасауға болады?
Генераторда үлгіні таңдаңыз (ашық сайт, жабық бөлімдер, SaaS немесе интернет-дүкен), жолдарды реттеңіз, sitemap қосыңыз және қаласаңыз, AI роботтарын жабыңыз. Нәтижені көшіріп, https://домен/robots.txt мекенжайында ашылатындай етіп, сайт түбіріне robots.txt деп сақтаңыз.
Бетті robots.txt жауып тұрғанын қалай тексеруге болады?
«URL тексеру» қойындысын ашып, файл мазмұны мен бет URL-ін қойып, роботты таңдаңыз. Құрал URL-ге рұқсат бар-жоғын, қай топ қолданылғанын және қай ереже шешкенін, сондай-ақ Googlebot, YandexBot және AI роботтары үшін нәтижені көрсетеді.
AI роботтарын қалай жабуға болады?
Олардың токендері бар топтар мен Disallow: / қосыңыз, мысалы User-agent: GPTBot және User-agent: ClaudeBot. Боттарды мақсаты бойынша бөліңіз: оқыту боттары трафик әкелмейді, ал OAI-SearchBot пен PerplexityBot сияқты іздеу боттары жауаптардағы сілтемелер арқылы келушілер жібереді. robots.txt ерікті түрде сақталатынын ұмытпаңыз.
Google-Extended-ті жабу сайтымды Google-дан шығара ма?
Жоқ. Google-Extended — робот емес, басқару токені: ол беттерді Gemini модельдерін оқытуға және grounding-ке пайдалануға тыйым салады, бірақ Googlebot аралауына және Google іздеуіне әсер етпейді.
Яндекс үшін Clean-param немесе Host керек пе?
Host керек емес: Яндекс 2018 жылы оны тоқтатып, басты айнаны 301 бағыттаумен анықтайды. Clean-param Яндекс үшін әлі де пайдалы — UTM сияқты параметрлері бар дубльдер көп болса. Генератор оны қоспайды, бірақ файлға қолмен қоссаңыз, тексеруші синтаксисін тексереді. Google мен Bing Clean-param-ды елемейді.
Disallow бетті іздеу нәтижелерінен алып тастай ма?
Сенімді түрде емес. Disallow аралауды жабады, бірақ басқа беттер сілтейтін болса, Google URL-ді мазмұнсыз индекстеуі мүмкін. Бетті нәтижелерден шығару үшін оны аралауға ашық қалдырып, noindex бар robots мета тегін қосыңыз.
Қайсысы жеңеді: Allow ма, Disallow ма?
Жолдар ретіне қарамастан, жол үлгісі ұзынырақ ереже. Ұзындықтары тең болса, Allow жеңеді. Google мен RFC 9309 осылай жұмыс істейді.
robots.txt қайда орналасуы керек?
Әр хосттың түбірінде: https://example.kz/robots.txt. Ішкі папкадағы файл еленбейді, ал әр субдомен мен хаттамаға өз файлы керек.
«SEO» бөлімінде тағы
- Сниппетті алдын ала қарау
Тақырып пен сипаттама Google-да қалай көрінеді және қысқартыла ма?
- Open Graph генераторы
Бетке қандай Open Graph тегтері керек және сілтеме алдын ала көрінісі қандай болады?
- Мәтіннің оқылуын тексеру
Бұл мәтінді оқу қаншалықты қиын және қай сөйлемдер тым ұзын?
- hreflang генераторы
Беттің тілдік нұсқаларын қандай hreflang тегтері байланыстырады?
- UTM генераторы
Әр науқан мен арнаға бірізді UTM сілтемелерін қалай жасауға болады?
- UTM-белгілі QR-кодтар
Қай стенд, парақша немесе постер келушілер әкелді — және әрқайсысына QR-кодты қалай белгілеуге болады?