Бесплатно · без регистрации

Проверка robots.txt

Проверим robots.txt всего сайта — или отдельную страницу: закрыта ли она от индексации, каким именно правилом и пускает ли сайт AI-ботов ChatGPT, Gemini, Perplexity

Зачем нужен robots.txt

Это текстовый файл в корне сайта — site.ru/robots.txt. В нём вы говорите поисковым и AI-роботам, какие разделы обходить, а какие пропускать: служебные страницы, корзину, результаты поиска, персональные ссылки. Файл управляет обходом, но не защищает от посторонних: закрытая в нём страница остаётся доступной по прямой ссылке, а если на неё ведут ссылки с других сайтов — может попасть в выдачу. Чтобы убрать страницу из результатов поиска, нужен мета-тег noindex на самой странице.

Из чего состоят правила

User-agent:
Кому адресован блок правил. * — всем роботам, YandexBot или GPTBot — конкретному.
Disallow:
Что не обходить. Disallow: /cart/ — раздел, Disallow: / — весь сайт целиком.
Allow:
Исключение внутри запрета: открыть один подраздел там, где закрыт весь родительский.
Sitemap:
Полный адрес карты сайта — https://site.ru/sitemap.xml. Указывается один раз, вне блоков.
*
Любая последовательность символов: Disallow: /*?sort= закроет все URL с этим параметром.
$
Конец адреса: Disallow: /catalog$ закроет саму страницу, но не вложенные в неё.
#
Комментарий — робот игнорирует всё до конца строки.

Про пустые строки. Пустую строку ставят перед каждым блоком User-agent — так рекомендует Яндекс. Внутри блока её лучше не оставлять: Google такой разрыв игнорирует и правила ниже применит, но парсеры, следующие старому стандарту, посчитают блок законченным — и запрет перестанет работать ровно там, где он вам нужен.