robots.txt управляет обходом, а не индексацией — и это различие стоит большинства ошибок. Разбираем синтаксис, что реально закрывать, чем закрытие отличается от noindex и как настроить доступ ботам ИИ-поиска, не отдав данные на обучение.
- robots.txt запрещает обход, но не гарантирует отсутствие страницы в выдаче.
- Чтобы страницы точно не было в поиске, нужен noindex — и доступ к странице открытым.
- Директива Host устарела, склейка зеркал делается 301 и настройкой в Вебмастере.
- Боты ИИ-поиска делятся на retrieval и training: первых пускают, вторых закрывают по решению владельца.
- Закрытие CSS и скриптов ломает рендеринг страницы для робота — так делать нельзя.
Что robots.txt делает и чего не делает
Управляет обходом
Файл говорит роботу, какие адреса не нужно скачивать. Это экономит краулинговый бюджет и защищает от нагрузки — служебные разделы, результаты поиска по сайту, корзину.
Не управляет индексацией
Закрытая в robots.txt страница может попасть в выдачу — например, если на неё ведут внешние ссылки. Поиск не видел содержимого, поэтому покажет адрес без описания. Это классическая ситуация «закрыл, а оно в поиске».
Как убрать страницу из поиска правильно
Оставить её доступной для обхода и поставить мета-тег noindex. Робот должен увидеть указание — а если вы закрыли страницу в robots.txt, он его не прочитает. Два запрета одновременно работают хуже, чем один правильный.
Синтаксис без лишнего
Базовая структура
Блок начинается с User-agent — для кого правила. Дальше Disallow — что закрыть, Allow — исключения из закрытого. Пустой Disallow означает «можно всё». Правила из блока для конкретного робота отменяют правила из общего блока для него.
Порядок и приоритет
Робот выбирает один подходящий ему блок — самый специфичный. Если есть блок для его имени, общий блок он не читает вообще. Это частая причина неожиданного поведения: правила добавили в общий блок, а для нужного робота они не действуют.
Спецсимволы
Звёздочка заменяет любую последовательность, знак доллара обозначает конец адреса. Закрывая параметры, помните, что закрытие всех адресов со знаком вопроса может задеть нужные страницы.
Что указывать обязательно
Адрес карты сайта отдельной строкой. Директива Host устарела и не используется — склейка зеркал делается 301-редиректом и указанием главного зеркала в Вебмастере.
Что закрывать, а что нет
Закрывать стоит
Служебные разделы админки, результаты внутреннего поиска, корзину и оформление заказа, страницы с параметрами сортировки, технические дубли, файлы, не предназначенные для людей.
Закрывать нельзя
Стили и скрипты. Робот рендерит страницу как браузер, и без CSS с JS видит сломанную вёрстку — а мобильная адаптация проверяется именно рендерингом. Это ошибка родом из середины десятых, которая до сих пор встречается.
Не нужно закрывать
Правовые страницы, контакты, политику конфиденциальности. Это признаки настоящего бизнеса, и поиску они полезны. Страницу 404 закрывать тоже не нужно — она отдаёт код ошибки и в индекс не попадает.
Отдельный случай — тестовые копии
Закрывать разработочную версию через robots.txt ненадёжно: файл могут перенести на боевой сайт вместе с остальным. Надёжнее закрыть доступ паролем на уровне сервера.
Боты ИИ-поиска: кого пускать
Раздел, которого не было в этой теме ещё пару лет назад.
Два типа ботов
Retrieval-боты приходят за ответом на конкретный вопрос пользователя и указывают источник — они приводят к упоминанию вашего сайта в генеративном ответе. Training-боты собирают данные для обучения моделей и никакой отдачи не дают.
Разумная политика
Retrieval открываем, training закрываем — если вы не хотите отдавать содержимое на обучение. Смешивать их одним правилом означает потерять либо цитируемость, либо контроль над данными.
Как проверить
Правила читаются по имени бота, поэтому важно не ошибиться в написании. Проверить доступ вместе с корректностью файла llms.txt можно нашим валидатором — он смотрит обе вещи сразу.
Связь с видимостью в нейросетях
Закрытый от retrieval-ботов сайт не попадёт в генеративный ответ никогда, независимо от качества страниц. Это первое, что проверяется в стандарте GEO.
Частые ошибки
Закрыт весь сайт
Строка Disallow со слэшем, оставшаяся с разработки. Проверяется за десять секунд и стоит месяцев потерянного времени.
Правила в неправильном блоке
Добавили запрет в общий блок, а для конкретного робота есть свой — и он общий блок не читает.
Файл отдаёт не то
Движок перехватывает адрес и возвращает HTML вместо текста. Проверяется открытием файла в браузере: там должен быть текст, а не страница сайта.
Закрыли то, что уже в индексе
Закрытие в robots.txt не удаляет страницу из поиска — она останется без описания. Правильный порядок: открыть, поставить noindex, дождаться переобхода, и только потом при желании закрывать.
Как выглядит рабочий файл
Минимальный набор, который подходит большинству сайтов услуг и магазинов.
Общий блок
Открытый доступ ко всему, кроме служебных разделов: админки, внутреннего поиска, корзины, страниц с параметрами сортировки. Стили и скрипты остаются открытыми всегда.
Адрес карты сайта
Отдельной строкой, полным адресом с протоколом. Если карт несколько или используется индекс карт — указывается именно индекс.
Блоки для ботов ИИ-поиска
Отдельные блоки с явными именами: тем, кто приходит за ответом и указывает источник, доступ открыт; тем, кто собирает данные для обучения, — по вашему решению. Имена ботов нужно писать точно, иначе правило просто не применится.
Чего в файле быть не должно
Директивы Host, закрытия CSS и JS, запрета на правовые страницы и попыток закрыть то, что уже в индексе, — последнее только законсервирует адрес в выдаче без описания.
Частые вопросы
Потому что robots.txt запрещает обход, а не индексацию. Если на страницу ведут ссылки, поиск может показать её адрес без описания — содержимое он не читал. Чтобы убрать страницу из выдачи, откройте её для обхода и поставьте мета-тег noindex.
Нет, она устарела и не учитывается. Главное зеркало определяется 301-редиректом с неглавных версий и настройкой в Вебмастере. Оставшаяся в файле строка Host не вредит, но и не работает.
Можно, правилами для конкретных ботов. Но решите заранее, что именно закрываете: боты, которые приходят за ответом и указывают источник, приносят упоминания вашего сайта в генеративных ответах. Закрыв всё подряд, вы гарантированно выпадаете из этих ответов.
Правда. Робот рендерит страницу как браузер: без стилей и скриптов он видит сломанную вёрстку и не может оценить мобильную адаптацию. Это прямо ухудшает оценку страницы, а никакой пользы от закрытия нет.
Инструментом анализа robots.txt в Вебмастере: он показывает, какие правила применяются к конкретному адресу. Плюс откройте файл в браузере и убедитесь, что отдаётся текст, а не HTML-страница — движки иногда перехватывают этот адрес.
Да, хотя бы с пустым Disallow и адресом карты сайта. Отсутствие файла даёт 404 при каждом обращении робота и лишает вас удобного места для указания карты. Файл из трёх строк — нормальная практика.