Содержание
- Как индексация сайта зависит от файла robots.txt
- Директивы robots.txt
- Закрывающий robots.txt
- Как правильно настраивать robots.txt
- Пример robots.txt
- Как добавить robots.txt и где он находится
- Как проводится проверка robots.txt
- Типичные ошибки в robots.txt
В процессе оптимизации сайта настройка и создание файла robots.txt — один из важных технических этапов. Если файла нет, нагрузка на ресурс со стороны поисковых краулеров может заметно увеличиться, а индексация и переиндексация будут проходить медленнее. Если файл настроен неправильно, поисковые системы могут проиндексировать лишние страницы: версии для печати, лид-формы, пользовательские разделы, служебные страницы и другие элементы, которые не должны попадать в поиск.
Разберём основные нюансы правильной настройки robots.txt.
Как индексация сайта зависит от файла robots.txt
Первое, что нужно понимать: поисковые роботы будут индексировать сайт независимо от того, есть ли у него файл robots.txt. Но если файл существует, боты учитывают прописанные в нём правила. При этом разные краулеры могут реагировать на директивы по-разному. Некоторые роботы игнорируют отдельные правила, а часть директив работает только для конкретных поисковых систем. Например, GoogleBot не использует правила Host и Crawl-Delay, YandexNews тоже перестал учитывать Crawl-Delay, а YandexVideoParser и YandexDirect не принимают во внимание общие правила robots.txt, но учитывают правила, прописанные именно для них.
Наибольшую нагрузку на сайт создают роботы, которые скачивают контент. Указывая, какие разделы можно индексировать, а какие нужно игнорировать, а также задавая интервалы обращения к сайту, можно снизить нагрузку со стороны роботов и ускорить обход важных страниц за счёт запрета обхода лишних разделов.
К таким страницам относятся json- и ajax-скрипты, элементы баннеров, капчи, всплывающие формы, корзина и этапы оформления заказа, административная панель, личный кабинет, поиск по сайту и другие служебные разделы.
Для большинства роботов желательно закрывать от индексации CSS и JS. Но есть исключения — GoogleBot и Yandex. Этим роботам такие файлы лучше оставлять доступными, поскольку они используют их при анализе удобства сайта и ранжировании.
Директивы robots.txt
Директивы — это набор правил для поисковых роботов. При этом важно учитывать, что не каждая поисковая система и не каждый бот поддерживают все директивы. Поэтому на практике полезно знать не только общий стандарт, но и то, как основные роботы реагируют на конкретные команды.
Рассмотрим их по порядку.
User-agent
Это основная директива, которая показывает, для каких роботов действуют последующие правила.
Для всех роботов:
User-agent: *
Для определённого бота:
User-agent: Yandex
Регистр символов в файле значения не имеет. То есть юзер-агент для Яндекса можно записать и так:
user-agent: yandex.
Ниже приведена таблица разных юзер-агентов поисковых систем.
| Бот | Функция |
| Googlebot | основной индексирующий робот Google |
| Googlebot-News | Google Новости |
| Googlebot-Image | Google Картинки |
| Googlebot-Video | видео |
| Mediapartners-Google | Google AdSense, Google Mobile AdSense |
| Mediapartners | Google AdSense, Google Mobile AdSense |
| AdsBot-Google | проверка качества целевой страницы |
| AdsBot-Google-Mobile-Apps | Робот Google для приложений |
Яндекс | |
| YandexBot | основной индексирующий робот Яндекса |
| YandexImages | Яндекс.Картинки |
| YandexVideo | Яндекс.Видео |
| YandexMedia | мультимедийные данные |
| YandexBlogs | робот поиска по блогам |
| YandexAddurl | робот, обращающийся к странице при добавлении ее через форму «Добавить URL» |
| YandexFavicons | робот, индексирующий пиктограммы сайтов (favicons) |
| YandexDirect | Яндекс.Директ |
| YandexMetrika | Яндекс.Метрика |
| YandexCatalog | Яндекс.Каталог |
| YandexNews | Яндекс.Новости |
| YandexImageResizer | робот мобильных сервисов |
Bing | |
| Bingbot | основной индексирующий робот Bing |
Yahoo! | |
| Slurp | основной индексирующий робот Yahoo! |
Mail.Ru | |
| Mail.Ru | основной индексирующий робот Mail.Ru |
Закрывающий robots.txt
Иногда нужно полностью закрыть сайт от индексации для всех поисковых систем. Для этого используют следующие директивы:
User-agent: *
Disallow: /
Как правильно настраивать robots.txt
Для России и стран СНГ, где доля Яндекса остаётся значимой, обычно прописывают правила для всех роботов, а также отдельно для Яндекса и Google.
Чтобы корректно настроить файл, нужно закрыть от индексации служебные и технические разделы. При настройке robots.txt можно использовать следующий алгоритм:
- Сначала закрываем административную часть сайта от индексации.
- Затем закрываем регистрацию, авторизацию и личный кабинет.
- Также закрываем корзину, оформление заказа и технические страницы, не предназначенные для поиска.
- Закрываем json- и ajax-скрипты.
- Закрываем от индексации папку cgi.
- Закрываем темы оформления, плагины, js и css для всех краулеров, кроме Google и Яндекса.
- Поисковый функционал сайта также закрываем от индексации.
- Закрываем служебные разделы, которые не несут ценности для поиска: страницы ошибок, списки авторов и другие технические элементы.
- Закрываем технические дубли страниц, на которых повторяется контент: архивы, календари и похожие разделы.
- Закрываем страницы с UTM-метками и идентификаторами сессий.
- Закрываем страницы с параметрами сортировки, сравнения и фильтров.
- Проверяем, что уже проиндексировали Яндекс и Google. Для этого используется оператор site:. В поисковой строке вводят site:sait.ru. Если в выдаче обнаружены страницы, которые нужно закрыть, их добавляют в robots.txt.
- Далее указываем host и sitemap.
- При необходимости прописываем директивы Crawl-Delay и Clean-Param.
- Проверяем корректность файла robots.txt через инструменты Яндекса или Google.
- Через несколько недель повторно проверяем выдачу и смотрим, не появились ли там страницы, которые не должны индексироваться. При необходимости корректируем файл.
Для проектов на Битрикс важно учитывать структуру служебных разделов и компонентов. Если используется готовый сайт на 1С-Битрикс, файл robots.txt всё равно нужно проверить и адаптировать под конкретное наполнение, фильтры, каталог и служебные страницы.
Пример robots.txt
# Пример файла robots.txt для настройки гипотетического сайта https://site.ru
User-agent: *
Disallow: /admin/
Disallow: /plugins/
Disallow: /search/
Disallow: /cart/
Disallow: */?s=
Disallow: *sort=
Disallow: *view=
Disallow: *utm=
Crawl-Delay: 5
User-agent: GoogleBot
Disallow: /admin/
Disallow: /plugins/
Disallow: /search/
Disallow: /cart/
Disallow: */?s=
Disallow: *sort=
Disallow: *view=
Disallow: *utm=
Allow: /plugins/*.css
Allow: /plugins/*.js
Allow: /plugins/*.png
Allow: /plugins/*.jpg
Allow: /plugins/*.gif
User-agent: Yandex
Disallow: /admin/
Disallow: /plugins/
Disallow: /search/
Disallow: /cart/
Disallow: */?s=
Disallow: *sort=
Disallow: *view=
Allow: /plugins/*.css
Allow: /plugins/*.js
Allow: /plugins/*.png
Allow: /plugins/*.jpg
Allow: /plugins/*.gif
Clean-Param: utm_source&utm_medium&utm_campaign
Crawl-Delay: 0.5
Sitemap: https://site.ru/sitemap.xml
Host: https://site.ru
Как добавить robots.txt и где он находится
После создания и настройки файл robots.txt нужно разместить в корневом каталоге сайта по адресу sait.ru/robots.txt. Поисковые системы всегда обращаются к этому файлу по стандартному URL /robots.txt.
В некоторых CMS, например в «Битриксе», есть стартовый набор для создания robots.txt. Это значит, что файл не обязательно создавать полностью с нуля: можно взять базовый вариант и адаптировать его под структуру конкретного сайта.

Как проводится проверка robots.txt
Проверить корректность файла robots.txt можно с помощью инструментов Яндекса и Google:
- В Google Search Console нужно перейти на вкладку «Сканирование» и выбрать инструмент проверки файла robots.txt.

- В Яндекс.Вебмастере нужно открыть вкладку «Инструменты» и перейти в раздел «Анализ robots.txt».

Типичные ошибки в robots.txt
В завершение перечислим распространённые ошибки, которые владельцы сайтов допускают при работе с файлом robots.txt:
- файл robots.txt отсутствует;
- сайт полностью закрыт от индексации директивой Disallow: /;
- файл настроен слишком поверхностно и содержит только базовые правила, из-за чего индексация работает некорректно;
- не закрыты страницы с UTM-метками и идентификаторами сессий;
- директива host прописана несколько раз;
- в host не указан протокол https;
- путь к Sitemap указан неправильно либо задан неверный протокол или зеркало сайта.
В файле могут быть указаны только директивы:
Allow: *.css;
Allow: *.js;
Allow: *.png;
Allow: *.jpg;
Allow: *.gif.
При этом файлы css, js, jpg и другие форматы могут быть закрыты в отдельных директориях другими правилами. Поэтому robots.txt нужно проверять не только визуально, но и через специальные инструменты.
Вот основное, что нужно знать о корректной настройке robots.txt. Грамотная техническая оптимизация сайта помогает избежать проблем с индексацией, снизить нагрузку на ресурс и направить поисковых роботов на действительно важные страницы.




