Проверка robots.txt
Проверим robots.txt всего сайта — или отдельную страницу: закрыта ли она от индексации, каким именно правилом и пускает ли сайт AI-ботов ChatGPT, Gemini, Perplexity
Зачем нужен robots.txt
Это текстовый файл в корне сайта — site.ru/robots.txt. В нём вы говорите поисковым и AI-роботам, какие разделы обходить, а какие пропускать: служебные страницы, корзину, результаты поиска, персональные ссылки. Файл управляет обходом, но не защищает от посторонних: закрытая в нём страница остаётся доступной по прямой ссылке, а если на неё ведут ссылки с других сайтов — может попасть в выдачу. Чтобы убрать страницу из результатов поиска, нужен мета-тег noindex на самой странице.
Из чего состоят правила
User-agent:- Кому адресован блок правил.
*— всем роботам,YandexBotилиGPTBot— конкретному. Disallow:- Что не обходить.
Disallow: /cart/— раздел,Disallow: /— весь сайт целиком. Allow:- Исключение внутри запрета: открыть один подраздел там, где закрыт весь родительский.
Sitemap:- Полный адрес карты сайта —
https://site.ru/sitemap.xml. Указывается один раз, вне блоков. *- Любая последовательность символов:
Disallow: /*?sort=закроет все URL с этим параметром. $- Конец адреса:
Disallow: /catalog$закроет саму страницу, но не вложенные в неё. #- Комментарий — робот игнорирует всё до конца строки.
Про пустые строки. Пустую строку ставят перед каждым блоком User-agent — так рекомендует Яндекс. Внутри блока её лучше не оставлять: Google такой разрыв игнорирует и правила ниже применит, но парсеры, следующие старому стандарту, посчитают блок законченным — и запрет перестанет работать ровно там, где он вам нужен.