Robots.txt — это файл, в котором мы даём поисковым роботам правила: что на сайте можно обходить, а что нельзя. Через него закрывают админ-панель, служебные разделы, технические страницы — всё, что не должно попадать в поисковую базу Яндекса и Google. Если робота не ограничить, он обойдёт и добавит в индекс всё, до чего дотянется по ссылкам, — включая разделы, которые вы никогда не собирались показывать в поиске.
В этой статье разберём robots.txt по частям: как устроен файл и его директивы, что обязательно закрывать на коммерческом сайте, чем robots отличается от noindex и почему их путают даже SEO-специалисты, как управлять AI-ботами и почему настроить файл один раз — недостаточно.
- Robots.txt — файл с правилами обхода сайта для поисковых роботов. Лежит в корне:
site.ru/robots.txt, доступен всем. - Что закрывать: админку, корзину, личный кабинет, поиск по сайту, страницы с GET-параметрами и UTM-метками, технические дубли.
- Robots управляет обходом, а не индексацией. Google может показать закрытую страницу в выдаче, если на неё ведут ссылки. Гарантированный запрет индексации — тег noindex, и он работает только на страницах, открытых в robots.
- Чувствительные данные robots не защищает: файл публичный, и это, по сути, карта ваших служебных разделов. Пароли, заказы, личные кабинеты защищает только авторизация.
- Clean-param — директива Яндекса для борьбы с дублями от параметров; Google её не читает, для него параметры закрывают через Disallow.
- Один раз настроить недостаточно. Сайт меняется: новые разделы, новые типы страниц. Robots.txt нужно сверять с реальным обходом робота в Вебмастере и GSC.
- Проверка: инструмент «Анализ robots.txt» в Яндекс Вебмастере и отчёт о статусе индексирования страниц в Google Search Console.
Что такое robots.txt и как он устроен
Robots.txt — обычный текстовый файл в корне сайта. Перед обходом робот поисковика запрашивает его и читает правила: каким разделам можно уделять внимание, какие — пропустить. Синтаксис простой, директив всего несколько:
User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /search/
Disallow: /*?utm_
Allow: /catalog/
Sitemap: https://site.ru/sitemap.xml
User-agent — к какому роботу обращаемся (* — ко всем, Yandex, Googlebot — адресно). Disallow — что закрываем, Allow — исключение из запрета. Sitemap — адрес карты сайта: эти два файла работают в паре — robots говорит роботу, куда не ходить, карта — что обязательно посмотреть. Для Яндекса есть отдельная директива Clean-param: она склеивает дубли страниц с GET-параметрами; Google эту директиву не понимает и просто игнорирует.
Зачем закрывать разделы: две реальные проблемы
Первая — мусор в индексе. Классика крупных интернет-магазинов — открытый для робота поиск по сайту:
«Возьмём крупный интернет-магазин: человек заходит в поиск на сайте и начинает писать — купить холодильник, купить телефон. И все эти поисковые запросы попадают в индекс: генерируется ссылка типа search — и поисковые роботы её индексируют, тратят на неё краулинговый бюджет и создают огромное количество мусора на сайте»
Каждый запрос пользователя рождает новый URL — и таких страниц могут быть миллионы. Робот тратит на них краулинговый бюджет вместо того, чтобы обходить карточки товаров и категории, которые приносят деньги.
Вторая типовая дыра того же рода — незакрытые GET-параметры:
«Часто не закрыты GET-параметры — в индекс попадают рекламные UTM-метки и вся прочая история. Особенно если на сайте установлен Яндекс Директ: миллионы страниц могут попадать в индекс»
Каждая рекламная ссылка с меткой — для робота отдельный URL с тем же содержимым, то есть дубль. Дубли размывают позиции основной страницы и съедают бюджет обхода — как склеивать их тегом canonical, разобрано в отдельном гайде.
Вторая проблема — служебное в открытом доступе. Здесь важна легендарная история: летом 2011 года в выдаче Яндекса массово оказались страницы статусов заказов интернет-магазинов — с именами, адресами и составом покупок, а следом СМС-сообщения с сайта оператора. Причина банальна: служебные страницы никто не закрыл от индексации. С тех пор правило «закрывай служебные разделы» — не теория, а выученный рынком урок.
Что закрывать на коммерческом сайте: чек-лист
- Админ-панель и технические каталоги CMS;
- Корзину и оформление заказа — в поиске им делать нечего;
- Личный кабинет — плюс обязательная авторизация (об этом ниже);
- Поиск по сайту — все URL вида
/searchи с параметром запроса; - GET-параметры и UTM-метки — маской
Disallow: /*?utm_и аналогичными, для Яндекса — плюсClean-param; - Служебные дубли — версии для печати, сессионные параметры, сортировки.
Отдельная тема — страницы фильтров каталога: часть из них закрывают, а часть, наоборот, специально открывают под спрос. Это не про «закрыть всё», разбор — в статье какие страницы фильтров индексировать, а какие закрывать.
На Тильде файл robots.txt напрямую редактировать нельзя — правила и Clean-param прописываются в отдельных настройках панели. Сделать можно то же самое, но управление менее гибкое, чем на WordPress или Битриксе, где файл полностью в ваших руках.
Robots или noindex: где ошибаются даже SEO-специалисты
Самое важное различие, вокруг которого больше всего ошибок. Правил четыре:
1. Robots.txt управляет обходом, а не индексацией. Disallow говорит роботу «не заходи на эту страницу» — но не запрещает поисковику знать о ней. Если на закрытую страницу ведут ссылки, Google может добавить её в выдачу без содержимого — в Search Console это статус «Проиндексировано, несмотря на блокировку в файле robots.txt». Яндекс ведёт себя аккуратнее, но принцип тот же: robots — это просьба не ходить, а не запрет существовать в поиске.
2. Гарантированный запрет индексации — метатег noindex. Робот заходит на страницу, видит тег — и не берёт её в индекс.
3. Ловушка: noindex работает только на страницах, открытых в robots. Чтобы увидеть тег, робот должен зайти на страницу. Если закрыть её в robots.txt и поставить noindex — робот не зайдёт, тег не увидит, а страница может остаться в индексе по внешним ссылкам. Закрывать нужно чем-то одним, и для гарантии невидимости это noindex.
4. Чувствительные данные не защищает ни то, ни другое. Robots.txt — публичный файл: любой человек открывает site.ru/robots.txt и видит список ваших «закрытых» разделов — по сути, карту того, что вы прячете. Заказы, персональные данные, кабинеты клиентов защищаются только авторизацией. Поисковые директивы — про видимость в поиске, а не про безопасность.
Главная катастрофа: сайт закрыт целиком
Обратная сторона всех правил — случай, когда правило одно и оно убивает сайт: Disallow: / для всех роботов. Обычно это наследство разработки: сайт делали на тестовом домене, закрыли от индексации, перенесли на боевой — и забыли открыть.
«У нас была пара клиентов, которые сказали: прорабатывали SEO какое-то время — и ни заявок, ничего. Я взял сайт, начал проверять базовые вещи: просто открыл карту сайта, открыл роботс — и увидел, что сайт вообще целиком закрыт от индексации. Меня это рассмешило и очень расстроило одновременно: человек потерял время и деньги, а нерадивые SEO-специалисты даже не знали про такую базовую вещь»
Проверка занимает тридцать секунд: откройте свой robots.txt и убедитесь, что в нём нет Disallow: / без уточнений. Если сайт долго «продвигается» без результата — начинайте диагностику именно отсюда, а не с текстов и ссылок.
AI-боты: пускать или закрывать
Отдельный слой правил последних лет — краулеры нейросетей: GPTBot, ClaudeBot, PerplexityBot, боты Яндекса для Алисы. Наша позиция однозначна:
«Ботов я обязательно открываю. У нас даже есть расширение, которое проверяет, не закрыты ли AI-боты в роботсе и насколько сайт в целом оптимизирован под GEO. Установите — и посмотрите, как ваш сайт видят нейросети»
Логика простая: закрытый для AI-ботов сайт не попадает в ответы ChatGPT, Алисы и Perplexity — а это растущий канал трафика и упоминаний. Полный список ботов с готовыми конфигурациями — в статье AI-боты в robots.txt, а проверить свой сайт можно нашим бесплатным расширением для Chrome.
Robots.txt — не «настроил и забыл»
Главная системная ошибка — отношение к файлу как к разовой настройке:
«Меня бесит, когда роботс просто копируют дефолтный — и никто не настраивает его под изменения сайта. А сайт — это живой, развивающийся организм. Появляются новые разделы, которые не должны индексироваться, — их никто не закрывает, и они индексируются. Это сплошь и рядом такая проблема: люди настраивают роботс один раз и забивают на него»
Рабочий процесс против этого — регулярная сверка файла с тем, что робот реально делает на сайте:
«Мы обязательно заходим в обход поиска в Вебмастере и смотрим, какие страницы посетил поисковый робот. Там часто появляются страницы, о которых мы не знали: клиент что-то создал на сайте, а это, оказывается, нужно было закрыть. И мы оперативно меняем роботс. Это живой организм, за которым нужно очень хорошо присматривать»
Где смотреть: в Яндекс Вебмастере — «Статистика обхода» и изменения в поиске, в Google Search Console — отчёт о статусе индексирования с группами исключённых страниц. Новые URL, которых вы не ждали, — сигнал обновить правила.
Эффект от такой уборки — не абстрактная гигиена, а измеримый результат:
«Когда мы настраиваем роботс, из индекса выпадают сотни и тысячи мусорных страниц, краулинговый бюджет расходуется правильно — и робот начинает обходить те страницы, которые действительно важны с точки зрения SEO. Они начинают индексироваться и показываться выше»
Чек-лист: проверьте свой robots.txt за 10 минут
- Файл существует и открывается:
site.ru/robots.txt, код ответа 200. - В нём нет
Disallow: /— сайт не закрыт целиком. - Указана строка
Sitemap:с полным адресом карты сайта. - Закрыты: админка, корзина, кабинет, поиск по сайту, GET-параметры и UTM-дубли.
- Для Яндекса настроен
Clean-paramпо параметрам, которые не меняют содержимое. - Чувствительные разделы — за авторизацией, а не «спрятаны» в robots.
- Страницы, которых точно не должно быть в поиске, закрыты тегом noindex — и при этом открыты для обхода.
- Файл проверен в «Анализе robots.txt» Вебмастера — ошибок нет, важные страницы не попали под запрет.
Robots.txt — часть технического фундамента сайта вместе с картой сайта и корректными кодами ответа. Проверить фундамент целиком поможет технический аудит, а список работ на страницах — чек-лист внутренней оптимизации.
Вопросы и ответы
Что такое robots.txt простыми словами?
Текстовый файл в корне сайта с правилами для поисковых роботов: какие разделы можно обходить, какие нельзя. Робот читает его перед обходом и учитывает запреты — так поисковик не тратит время на служебные страницы и не тащит их в выдачу.
Обязателен ли robots.txt для сайта?
Формально сайт может жить и без него — робот просто обойдёт всё подряд. Практически он нужен любому коммерческому сайту: без правил в индекс попадают поиск по сайту, страницы с метками, корзина и прочий мусор, который размывает позиции и съедает краулинговый бюджет.
Чем robots.txt отличается от noindex?
Robots.txt запрещает роботу заходить на страницу, noindex — индексировать её. Закрытая в robots страница всё равно может попасть в выдачу по внешним ссылкам. Для гарантированного исключения ставьте noindex — и не закрывайте эту страницу в robots, иначе робот не увидит тег.
Можно ли скрыть конфиденциальные данные через robots.txt?
Нет. Файл публичный — список «закрытых» разделов увидит любой, кто откроет site.ru/robots.txt. Заказы, персональные данные и кабинеты защищаются авторизацией; robots и noindex отвечают только за видимость в поиске, а не за доступ.
Что такое Clean-param и нужен ли он?
Директива Яндекса: перечисляет GET-параметры, которые не меняют содержимое страницы (метки, сессии), — и Яндекс склеивает такие дубли в один URL. Google директиву не читает, для него параметры закрывают масками Disallow. На сайтах с рекламой и фильтрами Clean-param экономит заметную часть краулингового бюджета.
Нужно ли закрывать AI-ботов — GPTBot, ClaudeBot и другие?
Для коммерческого сайта — нет: закрытый для AI-ботов сайт не попадает в ответы ChatGPT, Алисы и Perplexity, а это растущий канал клиентов. Закрывать имеет смысл разве что уникальный платный контент. Список ботов и готовые конфигурации — в нашей отдельной статье.
Как проверить, правильно ли настроен robots.txt?
Инструмент «Анализ robots.txt» в Яндекс Вебмастере покажет ошибки синтаксиса и позволит проверить конкретные URL — закрыты они или открыты. В Google Search Console смотрите отчёт о статусе индексирования: группы «Заблокировано в robots.txt» и «Проиндексировано, несмотря на блокировку» покажут расхождения между вашими планами и реальностью.
