Содержание
За навигацию для ботов поисковых систем, сканирующих и индексирующих сайт для его появления в выдаче, отвечают два файла – sitemap.xml и robots.txt. И если xml-файл является своеобразной «картой», то в роли «навигатора» выступает именно robots. Именно он указывает роботу, на что обращать внимание при просмотре страниц. И в большинстве случаев, при падении трафика необходима срочная настройка роботс тхт.
Что такое роботс тхт?
Robots.txt, он же индексный файл представляет собой обычный текстовый документ в кодировке UTF-8, действующий на протоколах http, https, FTP, указывающий поисковым роботам на страницы и файлы, которые стоит просканировать. Если он будет содержать символы в другой кодировке, с большой долей вероятности боты не смогут воспринимать их, а следовательно – нарушится отработка.
Файл должен располагаться в корневом каталоге как обычный текстовый документ, открывающийся через «Блокнот». А также открываться через браузер по адресу
https://example.ua/robots.txt
Отдельное ограничение относительно файла для роботов установил Google – его размер не должен превышать 500кб.
Правила, перечисленные в нем действительны только по отношении хоста, протокола и номера порта сервера, где он размещен. При их отработке, боты могут получать одну из трех инструкций:
- Частичный доступ к сканированию отдельных элементов сайта;
- Полный доступ, позволяющий сканировать все, что есть на сайте;
- Абсолютный запрет на сканирование и индексацию сайта.
При работе с файлом роботы могут отдавать следующие ответы:
- 2хх – ОК, сканирование прошло удачно;
- 3хх – РЕДИРЕКТ, поисковый робот переадресовывается до тех пор, пока не получит другой ответ, отличный от 3хх;
- 4хх – робот получает доступ ко сканированию любых элементов и всего содержимого сайта;
- 5хх – сигнализирует о временных ошибках сервера или полном запрете сканирования.
Зачем нужен файл robots.txt
На любом сайте есть страницы, которые роботам лучше не посещать. В частности:
- Содержащие личные данные пользователей;
- Формы отправки информации;
- «Зеркала» сайта;
- Результаты поиска и т.д.
Правильная настройка robots.txt превращает его в надежный контрольно-пропускной пункт, указывающего на зоны с ограниченным доступом. ОДНАКО! Практике СЕО-специалистов известны случаи, когда «служебные» страницы таки оказывались в выдаче. И случалось это из-за неграмотной внутренней перелинковке или ошибок во внешней оптимизации.
Как правильно создать файл robots.txt
Поскольку он представляет собой файл в текстовом формате, для его создания понадобиться любой текстовый редактор, способный сохранять файлы в формате txt с кодировкой UTF-8. В самом же документе необходимо прописать инструкцию User-agent, основное правило Disallow, а также несколько второстепенных команд.
User-agent: что за правило и зачем нужно
С помощью юзер-агента можно указать, какие роботы могут просматривать инструкции, описанные в файле. На данный момент ваш сайт могут «прочесывать» 302 поисковых робота. И чтобы не прописывать каждый из них по отдельности, к команде можно добавить символ звездочки (*).
Вместе с тем, мы можем оставить открытым доступ только для одного бота, допустим – от Google. Для этого в правиле User-agent прописываем Googlebot. При этом все остальные будут сканировать контент на основании собственных директив по отработке пустых файлов robots.txt.
Писать про все 302 не имеет смысла, потому опишем самых «популярных» гостей:
- Mediapartners-Google – бот сервиса AdSense;
- AdsBot-Google – робот, проверяющий качество целевых страниц;
- Googlebot-Image – сканер графических изображений;
- Googlebot-Video – анализирует видеоматериалы на сайте;
- Googlebot-Mobile – бот для работы с мобильными версиями.
Для чего нужен Disallow
По сути, он выполняет функцию знака «Проезд запрещен». То есть – дает рекомендации по ограничению посещения отдельных страниц. Если таковых нет, строчку после прописанного правила можно оставить пустой.
Часто, в ходе работ над сайтом возникает необходимость закрыть его от индексации до завершения «ремонта». Сделать это можно через переменную «/». При этом по завершении доработок нужно не забыть снять это правило, т.к. без него сайт останется в индексе с теми же ошибками, что и в момент начала работы над ним.
Чтобы заблокировать доступ к отдельным страницам или файлам, достаточно прописать путь к ним, скопировав его из адресной строки браузера. Например:
Disallow: /cabinet.php
Disallow: /images/image-1.jpg.
Также роботу можно перекрыть доступ ко всем анимациям на странице через команду «/*.gif$» (актуально для любых расширений).
Для чего нужен Allow
В отличие от предыдущей, эта команда разрешает сканировать какой-либо файл, назначенную папку или страницу. Например, чтобы роботы получали доступ только к страницам, начинающимся с /catalog, игнорируя остальное содержимое сайта.
Sitemap в роботс
Указание на карту сайта сообщает роботу про то, что все URL, обязательные для индексирования, находятся по адресу xml-карты (https://example.ua/sitemap.xml). Следовательно, при очередном обходе, робот будет обращать внимания на изменения xml-файла.
Crawl-delay в robots.txt
Он же – секундомер для слабых серверов, он же – параметр, позволяющий задать периодичность загрузки страниц сайта. Актуально для проектов, размещенных на «слабых» серверах, во избежание больших задержек при обращении поисковых ботов к странцам сайта. Измеряется в секундах и выглядит как:
Crawl-delay: 5
ВАЖНО! Google официально отказались от этой директивы. Что не означает, что она не будет работать в других поисковиках. Те же Bing или Yahoo воспринимают ее по-прежнему.
Clean-param: что за параметр
В «простонародье» эту команду называют «охотником за дублирующимся контентом». Актуально для проектов с динамическими адресами на сайтах с различными вариантами сортировки каталога, id-сессиями и т.д.
К примеру, одна и та же страница доступна по нескольким адресам:
www.example.ua/catalog/get_airbuds.ua?ref=page_1&phone_id=1
www.example.ua/catalog/get_airbuds.ua?ref=page_2&phone_id=1
www.example.ua/catalog/get_airbuds.ua?ref=page_3&phone_id=1
В таких случаях, файл robots.txt нужно дополнить следующим параметром:
Clean-param: ref /catalog/get_airbuds.ua
Где «ref» указывает на то, откуда идет ссылка, потому записывается в самом начале, и лишь после него можно указывать остальную часть файла.
Основные символы в robots.txt
Их несколько:
- «*» — обозначает любую последовательность символов в файле и ставится после каждого правила;
- «/» — ограничитель, указывающий на запрет сканирования роботами поисковых систем;
- «$» — ограничивает действие знака звездочки и прописывается при необходимости запрета сканирования всего содержимого папки;
- «#» — используется для комментариев, оставляемых вебмастером для себя или других специалистов, не учитывается при сканировании сайта.
Как проверить правильность файла robots.txt
Сделать это можно через Google Webmaster Tools в соответствующем разделе. Для этого вводим исходный код файла в форму на странице сервиса, а также указываем проверяемый сайт. При наличии ошибок инструмент оповестит вас соответствующим уведомлением.
Как добавить robots txt на сайт
Файл с инструкциями, прописанными для роботов, нужно добавить в корневую папку на сервере. Если все сделано правильно, он будет доступен по ссылке:
https://example.ua/robots.txt
Какие могут быть ошибки в файле robots.txt
Практически все ошибки в «роботс.тхт» вызваны спешкой или невнимательностью вебмастера. Но чаще всего, речь идет о:
- Перепутанных инструкциях;
- Записи нескольких папок под одну команду Disallow;
- Несоблюдение регистра;
- Пустое поле в правиле User-agent;
- Лишние знаки;
- Добавление в файл страниц, которые не должны попасть в индекс.