Robots.txt
Также: роботс, файл robots
Текстовый файл в корне сайта с указаниями для поисковых роботов: какие разделы обходить, какие пропускать и где лежит карта сайта. Это рекомендация, а не защита — закрытая в нём страница остаётся доступной по прямой ссылке.
Что обычно закрывают
- Служебные разделы: корзину, личный кабинет, страницы поиска по сайту.
- Технические копии страниц, которые дублируют содержимое.
Директива Clean-param
Яндекс понимает Clean-param — список параметров, которые не меняют содержимое страницы: utm-метки, идентификаторы рекламных кликов. Без него каждый переход из рекламы выглядит для робота как отдельный адрес, и обход уходит в бесконечный список дублей вместо реальных страниц.
Пример строк, которые закрывают рекламные метки: `Clean-param: utm_source&utm_medium&utm_campaign` и отдельной строкой `Clean-param: yclid&etext&gclid`. Метка `etext` уникальна на каждый клик, поэтому без этой директивы робот уходит в бесконечный список одинаковых страниц.
Чего robots.txt не делает
- Не защищает: закрытая страница остаётся доступной по прямой ссылке любому.
- Не убирает из поиска: страницу, найденную по внешней ссылке, поисковик может показать даже при запрете обхода.
- Не ускоряет индексацию: он только ограничивает, а не приглашает.
Частые вопросы
Что будет, если robots.txt нет вообще?
Роботы будут обходить всё подряд. Для маленького сайта это не страшно, но рекламные метки и служебные разделы начнут попадать в обход.
Нужно ли закрывать ИИ-краулеров?
Если хотите, чтобы ассистенты называли ваш сайт в ответах, — не нужно. Закрытие GPTBot, ClaudeBot и подобных делает сайт невидимым для них.
Как проверить, что файл работает?
Откройте `https://ваш-сайт/robots.txt` в браузере и проверьте его в Яндекс Вебмастере — там есть инструмент анализа с проверкой конкретных адресов.