Clew

Басты бетҚұралдарrobots.txt генераторы

robots.txt генераторы және тексерушісі AI роботтарымен

Үлгіден robots.txt құрастырыңыз, жабық бөлімдерді жабыңыз, қай AI роботтары сайтқа кіре алатынын шешіңіз және кез келген URL-ді тексеріңіз: ол Googlebot, YandexBot немесе GPTBot үшін рұқсат етілген бе, мұны қай топ пен қай ереже шешті.

● Тегін, тіркелусізЖаңартылды:

Үлгі
Үлгі топтарды ауыстырады; кейін қолмен түзетіңіз.

Робот тек бір топты ұстанады — өз тобын немесе, ол болмаса, * тобын. Сондықтан Googlebot немесе Bingbot тобы ортақ ережелерді қайталауы керек.

AI роботтары: кіруді жабу

Модельдерді оқыту

Іздеу және сілтемесі бар жауаптар

Пайдаланушы сұраулары

robots.txt — құлып емес, өтініш. Сенімді компаниялар оны сақтайды, бірақ кейбір боттар елемейді. Кіруді тек сервердегі бақылау — авторизация немесе IP мен user agent бойынша бұғаттау — шын шектейді.

Sitemap-тардың толық URL-дері, әр жолға біреуден.

—

 

    Crawl-delay және Host жоқ. Google Crawl-delay-ді қолдамайды, ал Host — 2018 жылы тоқтатылған Яндекс директивасы. Генератор оларды қоспайды. Яндекске Clean-param керек болса, оны файлға қолмен қосыңыз — тексеруші синтаксисін тексереді.

    Барлығы браузеріңізде есептеледі — енгізген деректеріңіз ешқайда жіберілмейді.

    Қалай пайдалану керек

    1. Үлгіні таңдаңыз«SaaS» қосымша аймағы мен API-ді жабады; «Интернет-дүкен» себетті, сүзгілерді және сұрыптауды жабады. Өз жолдарыңызды және Googlebot немесе Bingbot үшін жеке топтарды қосыңыз.
    2. AI роботтары туралы шешіңізБоттар мақсаты бойынша топтастырылған: модельдерді оқыту, дәйексөзі бар іздеу және пайдаланушы сұраулары. Оқытуды жауып, іздеуді ашық қалдыруға болады.
    3. URL-дерді тексеріңіз«Бұл файлды тексеру» нәтижені «URL тексеру» қойындысына ауыстырады, онда әр робот үшін URL тағдырын шешетін топ пен ереже көрсетіледі.
    4. Файлды жариялаңызМәтінді көшіріп, домен түбіріне орналастырыңыз: https://example.kz/robots.txt. Әр субдомен мен хаттаманың өз файлы болады.

    robots.txt синтаксисі: топтар, ережелер және басымдық

    robots.txt — сайт түбіріндегі мәтіндік файл, ол іздеу роботтарына қай URL-дерді аралауға болатынын айтады. 2022 жылдан бастап оқу ережелері RFC 9309 стандартында бекітілген; Google, Bing және Яндекс сол негізгі қағидаттарды және өздерінің бірнеше кеңейтуін құжаттайды.

    Файл топтардан тұрады. Топ бір немесе бірнеше User-agent жолынан басталады, одан кейін Disallow және Allow ережелері келеді. Sitemap жолдары топқа жатпайды және кез келген жерде тұра алады.

    User-agent: * # барлық роботтарға арналған топ Disallow: /app/ # /app/ басталатынның бәрін жабу Allow: /app/signup # тіркелу бетінен басқасын User-agent: GPTBot # екі User-agent жолы — User-agent: CCBot # бір ортақ топ Disallow: / Sitemap: https://example.kz/sitemap.xml

    Робот топты қалай таңдайды

    Робот өз токені бар топты — әріп регистріне қарамай — іздейді және тек сол топты ұстанады. Ондай топ болмаса, * тобын қолданады; ол да болмаса, бәріне рұқсат. Бірдей токені бар топтар біріктіріледі. Осыдан жиі қате туады: бөлек User-agent: Googlebot тобын құрып, оған * ережелерін қайталауды ұмыту.

    Іздеу жүйелері резервтік топтарды құжаттайды: Googlebot-Image мен Googlebot-News өз тобы болмаса, Googlebot ережелерін қолданады.

    Ереже қалай таңдалады

    Ереже мәні жолдың басымен, сұрау жолын қоса, салыстырылады. * кез келген таңбалар тізбегіне сәйкес келеді, соңындағы $ URL соңын білдіреді. Бірнеше ереже сәйкес келсе, ең ұзыны жеңеді; тең болса, Allow жеңеді. Жолдардың реті маңызды емес.

    Allow: /p + Disallow: / → /page рұқсат (2 таңба 1-ден ұзын) Allow: /folder + Disallow: /folder → /folder/page рұқсат (тең ұзындық, Allow жеңеді) Allow: /page + Disallow: /*.htm → /page.htm тыйым (6 таңба 5-тен ұзын) Allow: /$ + Disallow: / → / рұқсат; /page.htm тыйым

    Бұл — Google құжаттамасындағы басымдық кестесі; құрал оны автоматты тесттерде тексереді. Бос Disallow: ештеңені жаппайды. Жолдар қалыпты түрде салыстырылады: ASCII емес таңбалар UTF-8 пайыздық кодтауға келтіріледі, сондықтан /каталог/ пен оның кодталған нұсқасы бірдей. Жолдар регистрге сезімтал: /Admin/ пен /admin/ — әртүрлі ережелер.

    Google, Яндекс және Bing үшін robots.txt: айырмашылық неде

    Қазақстанда іздеудің көп бөлігі Google арқылы өтеді, бірақ Яндекс те айтарлықтай үлесті сақтайды, сондықтан YandexBot құралдың тізімінде бар. Негізі ортақ: топтар, Allow және Disallow, * пен $ таңбалары, ең ұзын сәйкестік басымдығы. Айырмашылық кеңейтулерде.

    • Crawl-delay. Google елемейді. Bing ескереді; Яндекс 2018 жылдан бері бұл директиваны ескермейді, аралау жылдамдығы Яндекс Вебмастерде бапталады.
    • Clean-param. Тек Яндекс түсінеді: UTM белгілері сияқты мазмұнға әсер етпейтін параметрлерді елемеуді сұрайды. Google мен Bing үшін URL параметрлеріне rel="canonical" қолданыңыз.
    • Host. Ескірген Яндекс директивасы; басты айна 301 бағыттаумен көрсетіледі. Google оны ешқашан қолдамаған.
    • Резервтік топтар. Googlebot-Image, -Video және -News өз тобы болмаса, Googlebot тобын қолданады.
    • Көлем. Google файлдың алғашқы 500 КиБ-ын өңдейді, қалғанын елемейді.
    • Noindex. Google 2019 жылдан бастап robots.txt ішіндегі Noindex: директивасын ескермейді. robots мета тегін немесе X-Robots-Tag тақырыбын қолданыңыз.

    Іздеу жүйесі жарияланған файлды қалай оқитынын көру үшін Google Search Console-дағы robots.txt есебін, Яндекс Вебмастердегі robots.txt талдауын немесе Bing Webmaster Tools тексерушісін қолданыңыз. Бұл құрал жарияламас бұрын ыңғайлы: сайттағы файлмен ғана емес, кез келген мәтінмен жұмыс істейді.

    AI роботтарын қалай жабуға болады және жабу керек пе

    AI компаниялары интернетті әртүрлі мақсатпен аралайды, ірі ойыншылар әр мақсатқа бөлек токен қолданады. «Бәрін жабу» емес, мақсатына қарай шешім қабылдаңыз.

    Мақсаты бойынша AI роботтары
    ТокенИесіМақсаты
    GPTBotOpenAIмодельдерді оқыту
    OAI-SearchBotOpenAIChatGPT іздеуі
    ChatGPT-UserOpenAIпайдаланушы сұрауы
    ClaudeBotAnthropicмодельдерді оқыту
    Claude-SearchBotAnthropicіздеу жауаптары
    Claude-UserAnthropicпайдаланушы сұрауы
    PerplexityBotPerplexityіздеу және дәйексөздер
    Perplexity-UserPerplexityпайдаланушы сұрауы
    Google-ExtendedGoogleтокен: Gemini оқыту және grounding
    Applebot-ExtendedAppleтокен: Apple модельдерін оқыту
    CCBotCommon Crawlашық веб-мұрағат
    meta-externalagentMetaоқыту және өнімдер
    AmazonbotAmazonAmazon сервистері және AI
    BytespiderByteDanceдеректер жинау

    Үш топ — үш шешім

    • Модельдерді оқыту (GPTBot, ClaudeBot, CCBot және басқалары). Жабу жаңа беттерді болашақ оқыту жиынтықтарынан тыс қалдырады. Бұл боттар трафик әкелмейді, сондықтан оларды жиі жабады — әсіресе ақылы және төл контентте.
    • Іздеу және сілтемесі бар жауаптар (OAI-SearchBot, Claude-SearchBot, PerplexityBot). Бұл боттар келушілер әкеледі: сайтыңыз сілтемемен келтіріледі. Оларды жабу — жаңа арнадан бас тарту. SaaS және медиа сайттар әдетте оларды ашық қалдырады.
    • Пайдаланушы сұраулары (ChatGPT-User, Claude-User, Perplexity-User). Бетті адам тікелей сұрағандықтан ашады. Бұл роботтан гөрі браузерге жақын; кейбір компаниялар мұндай сұраулар robots.txt-ті ұстанбауы мүмкін екенін айтады.

    Google-Extended пен Applebot-Extended — робот емес. Беттерді кәдімгі Googlebot немесе Applebot аралай береді; токен тек оларды модельдерді оқытуға пайдалануға тыйым салады. Google-Extended-ті жабу Google іздеуіндегі позицияға әсер етпейді. Google-дың AI жауаптарына түспеу үшін Googlebot-ты жапсаңыз, іздеуден де шығып қаласыз.

    Ең бастысы, robots.txt — қорғаныс емес, келісім. Сенімді компаниялар оны сақтайды, бірақ мұны сырттан тексере алмайсыз, ал кейбір боттар ережелерді елемейді. Контент берілмеуі керек болса, авторизация немесе сервер не CDN деңгейінде шектеу қажет.

    robots.txt-тегі жиі қателер

    • CSS пен JavaScript-ті жабу. Disallow: /*.js$ немесе Disallow: /assets/ сияқты ережелер іздеу жүйелеріне бетті көрсетуге кедергі келтіреді, бет бос немесе мобильді құрылғыға бейімделмеген болып көрінуі мүмкін.
    • Беттерді noindex орнына robots.txt арқылы жасыру. Аралауды жабу URL-ді индекстен шығармайды: басқа беттер сілтейтін болса, Google оны сипаттамасыз көрсетуі мүмкін. Бетті іздеуден шығару үшін аралауға рұқсат беріп, <meta name="robots" content="noindex"> немесе X-Robots-Tag тақырыбын қосыңыз.
    • robots.txt-ті қауіпсіздік құралы деп санау. Файл ашық. Disallow: /secret-admin-panel/ сияқты жол оны оқыған кез келген адамға жолды жариялайды. Жабық аймақтарды логинмен қорғаңыз; robots.txt-те жалпы /admin/ жеткілікті — немесе ештеңе керек емес.
    • Ортақ ережелерсіз жеке топ. Бір ерекшелік үшін User-agent: Googlebot қосасыз, ал Googlebot * ережелерін көрмей қалады.
    • User-agent алдындағы ережелер. Файлдың басындағы, бірінші топқа дейінгі Disallow жолдары еленбейді.
    • Салыстырмалы Sitemap. Толық URL қолданыңыз: Sitemap: https://example.kz/sitemap.xml.
    • Тест ортасынан қалған Disallow: /. Staging толық жабылған еді, файл продакшенге өтіп, сайт іздеуден жоғалады. Әр релизден кейін robots.txt-ті тексеріңіз.
    • Барлық субдоменге бір файл. robots.txt тек өз хосты мен хаттамасына қолданылады: app.example.kz мен example.kz файлдары бөлек.

    SaaS үшін әдеттегі баптау: маркетинг сайты ашық, /app/ аймағы аралауға жабық және логинмен қорғалған, тіркелу мен кіру беттері ашық. Өнім бөлек субдоменде болса, оның өз robots.txt файлы бар.

    Дереккөздер

    1. RFC 9309. Robots Exclusion Protocol. IETF, 2022 — rfc-editor.org/rfc/rfc9309.
    2. Google Search Central. How Google interprets the robots.txt specification — developers.google.com/search/docs/crawling-indexing/robots/robots_txt.
    3. Google Search Central. Overview of Google crawlers and fetchers (user agents) — developers.google.com/search/docs/crawling-indexing/overview-google-crawlers.
    4. Google Search Central Blog. A note on unsupported rules in robots.txt, 2019.
    5. Яндекс Вебмастер анықтамасы: robots.txt, Clean-param директивасы — yandex.ru/support/webmaster.
    6. Bing Webmaster Guidelines және Bing Webmaster Tools анықтамасы: robots.txt және аралау бақылауы — bing.com/webmasters.
    7. OpenAI. Overview of OpenAI Crawlers — platform.openai.com/docs/bots.
    8. Anthropic. Does Anthropic crawl data from the web, and how can site owners block the crawler? — support.claude.com.
    9. Perplexity. Perplexity Crawlers — docs.perplexity.ai.
    10. Apple. About Applebot — support.apple.com/119829.
    11. Common Crawl. CCBot — commoncrawl.org/ccbot.

    Жиі қойылатын сұрақтар

    robots.txt файлын қалай жасауға болады?

    Генераторда үлгіні таңдаңыз (ашық сайт, жабық бөлімдер, SaaS немесе интернет-дүкен), жолдарды реттеңіз, sitemap қосыңыз және қаласаңыз, AI роботтарын жабыңыз. Нәтижені көшіріп, https://домен/robots.txt мекенжайында ашылатындай етіп, сайт түбіріне robots.txt деп сақтаңыз.

    Бетті robots.txt жауып тұрғанын қалай тексеруге болады?

    «URL тексеру» қойындысын ашып, файл мазмұны мен бет URL-ін қойып, роботты таңдаңыз. Құрал URL-ге рұқсат бар-жоғын, қай топ қолданылғанын және қай ереже шешкенін, сондай-ақ Googlebot, YandexBot және AI роботтары үшін нәтижені көрсетеді.

    AI роботтарын қалай жабуға болады?

    Олардың токендері бар топтар мен Disallow: / қосыңыз, мысалы User-agent: GPTBot және User-agent: ClaudeBot. Боттарды мақсаты бойынша бөліңіз: оқыту боттары трафик әкелмейді, ал OAI-SearchBot пен PerplexityBot сияқты іздеу боттары жауаптардағы сілтемелер арқылы келушілер жібереді. robots.txt ерікті түрде сақталатынын ұмытпаңыз.

    Google-Extended-ті жабу сайтымды Google-дан шығара ма?

    Жоқ. Google-Extended — робот емес, басқару токені: ол беттерді Gemini модельдерін оқытуға және grounding-ке пайдалануға тыйым салады, бірақ Googlebot аралауына және Google іздеуіне әсер етпейді.

    Яндекс үшін Clean-param немесе Host керек пе?

    Host керек емес: Яндекс 2018 жылы оны тоқтатып, басты айнаны 301 бағыттаумен анықтайды. Clean-param Яндекс үшін әлі де пайдалы — UTM сияқты параметрлері бар дубльдер көп болса. Генератор оны қоспайды, бірақ файлға қолмен қоссаңыз, тексеруші синтаксисін тексереді. Google мен Bing Clean-param-ды елемейді.

    Disallow бетті іздеу нәтижелерінен алып тастай ма?

    Сенімді түрде емес. Disallow аралауды жабады, бірақ басқа беттер сілтейтін болса, Google URL-ді мазмұнсыз индекстеуі мүмкін. Бетті нәтижелерден шығару үшін оны аралауға ашық қалдырып, noindex бар robots мета тегін қосыңыз.

    Қайсысы жеңеді: Allow ма, Disallow ма?

    Жолдар ретіне қарамастан, жол үлгісі ұзынырақ ереже. Ұзындықтары тең болса, Allow жеңеді. Google мен RFC 9309 осылай жұмыс істейді.

    robots.txt қайда орналасуы керек?

    Әр хосттың түбірінде: https://example.kz/robots.txt. Ішкі папкадағы файл еленбейді, ал әр субдомен мен хаттамаға өз файлы керек.

    «SEO» бөлімінде тағы

    Әсері сандардан көрінетін турлар, тултиптер мен чек-парақтар.

    Clew-ды тегін байқап көруҚалай жұмыс істейдіМәңгі тегін тариф · банк картасы қажет емес

    Турлар, попаптар және ЖИ дәуіріндегі онбординг

    Қадам саны, мәтін ережелері мен метрикалары бар 7 паттерн, ЖИ нені өзгертеді және жариялау алдындағы чек-лист. PDF, 2 бет. Ішінде не бар →

    Нұсқаулық ағылшын тілінде.