Есть официальная документация у поисковиков на тему данной директивы, но к примеру у Google данная директива не задокументирована, но и не считается ошибкой в валидаторе...
Ну что ж приступим...
Как правильно прописать host в robots txt?
Яндекс
User-Agent: *
Disallow: /forum
Disallow: /cgi-bin
Host: https://soltyk.ru
Валидатор для проверки в Яндексе
Про главное зеркало:
"Директива Host не гарантирует выбор указанного главного зеркала, тем не менее, алгоритм при принятии решения учитывает ее с высоким приоритетом."
Примечание. Для каждого файла robots.txt обрабатывается только одна директива Host. Если в файле указано несколько директив, робот использует первую.
Директива Host должна содержать:
- Протокол HTTPS, если зеркало доступно только по защищенному каналу. Если вы используете протокол HTTP, то его указывать необязательно.
- Одно корректное доменное имя, соответствующего RFC 952 и не являющегося IP-адресом.
- Номер порта, если необходимо (Host: myhost.ru:8080).
Некорректно составленные директивы Host игнорируются.
Вот как выглядит это в вебмастере (ошибок и предупреждений нет):

Про главное зеркало:
"Директивой можно указать роботу главный сайт, в том случае если вы используете сайты-зеркала. Значением в данной строке выступает доменное имя. Для поддержания формата файла robots.txt директива должна идти внутри записи, начинающейся с User-agent."
Пример:
User-agent: *
Disallow: # обязательная для каждой записи строка с директивой Disallow
Host: https://soltyk.ru
Аналогичная проверка (ошибок и предупреждений нет):

А теперь самое интересное...
Есть официальная документация, но в ней ничего не сказано про данную директиву...
Можно выделить 3 основных задокументированных факта:
- Инструкции robots.txt носят рекомендательный характер
- Каждый поисковый робот использует собственный алгоритм обработки файла robots.txt
- Страница, заблокированная для поисковых роботов, все же может быть обработана, если на других сайтах есть ссылки на нее
А вот что выдает валидатор в вебмастере Google (смотрим и делаем выводы):

Выводы, предположения и возможная польза...
Так что можно смело предположить при использовании валидатора robots от Google не возникает ни предупреждений, ни ошибок. В 2016 - начало 2017 такая картина еще наблюдалась (помечалось как ошибка). Следовательно, можно предположить, что они решили использовать данную директиву host как рекомендацию. Также проводя тесты на клиентских сайтах при переходе на https (без применения междоменного 301-редиректа), было замечено, как Гугл начинал потихоньку индексировать https версию. И к тому времени, когда Яндекс завершал склейку, в Google-вебмастере было видно, как часть индекса перетекала уже на новый хост.
Конечно это только догадки, основанные на практических тестах. Поэтому я составляю одну общую конфигурацию для всех роботов:
User-agent: *
Поэтому, если у Вас также есть опыт в определении такого стандарта для Google, то можете написать мне или в комментариях ниже.
голосов
Следующие страницы вас также могут заинтересовать:
- Настройка Cloudflare для защиты и оптимизации сайта
- Робототехника
- Калькулятор конверсии онлайн | Расчет конверсии сайта
- SEO умного фильтра Bitrix
- Сравнение Интентного кластеризатора и Key Collector
Обновлено: 27.04.2021