Зміст
За навігацію для ботів пошукових систем, що сканують і індексують сайт для його появи у видачі, відповідають два файли – sitemap.xml і robots.txt. І якщо xml-файл є своєрідною «картою», то в ролі «навігатора» виступає саме robots. Адже він вказує боту, на що звертати увагу при перегляді сторінок. І в більшості випадків, при падінні трафіку необхідна термінова настройка роботс тхт.
Що таке роботс тхт?
Robots.txt, він же індексний фай, являє собою звичайний текстовий документ в кодуванні UTF-8, що діє на протоколах http, https, FTP і вказує пошуковим роботам на сторінки і файли, які варто просканувати. Якщо він буде містити символи в іншому кодуванні, з великою часткою ймовірності боти не зможуть сприймати їх, а отже – порушиться відпрацювання.
Файл повинен розташовуватися в кореневому каталозі як звичайний текстовий документ, що відкривається через «Блокнот». А також відкриватися через браузер за адресою
https://example.ua/robots.txt
Окреме обмеження щодо файлу для роботів встановив Google-його розмір не повинен перевищувати 500кб.
Правила, перераховані в ньому дійсні тільки по відношенню до хоста, протоколу і номера порту сервера, де він розміщений. При їх відпрацюванні, боти можуть отримувати одну з трьох інструкцій:
- Частковий доступ до сканування окремих елементів сайту;
- Повний доступ, що дозволяє сканувати все, що є на сайті;
- Абсолютна заборона на сканування та індексацію сайту.
При роботі з файлом роботи можуть віддавати наступні відповіді:
- 2ХХ-ОК, сканування пройшло вдало;
- 3ХХ-РЕДИРЕКТ, пошуковий робот переадресовується до тих пір, поки не отримає іншу відповідь, відмінний від 3хх;
- 4хх-робот отримує доступ до сканування будь-яких елементів і всього вмісту сайту;
- 5хх-сигналізує про тимчасові помилки сервера або повну заборону сканування.
Навіщо потрібен файл robots.txt
На будь-якому сайті є сторінки, які роботам краще не відвідувати. Зокрема:
- Ті, що містять особисті дані користувачів;
- Форми відправки інформації;
- “Дзеркала” сайту;
- Результати внутрішнього пошуку і т. д.
Правильне налаштування robots.txt перетворює його в надійний контрольно-пропускний пункт, що вказує на зони з обмеженим доступом. Однак! Практиці СЕО-фахівців відомі випадки, коли «службові» сторінки таки виявлялися у видачі. І траплялося це через неграмотне внутрішнє перелінкування або помилки у зовнішній оптимізації.
Як правильно створити файл robots.txt
Оскільки він являє собою файл в текстовому форматі, для його створення знадобитися будь-який текстовий редактор, здатний зберігати файли в форматі TXT з кодуванням UTF-8. У самому ж документі необхідно прописати інструкцію User-agent, основне правило Disallow, а також кілька другорядних команд.
User-agent: що за правило і навіщо потрібно
За допомогою юзер-агента можна вказати, які роботи можуть переглядати інструкції, описані у файлі. На даний момент ваш сайт можуть «прочісувати» 302 пошукових робота. І щоб не прописувати кожен з них окремо, до команди можна додати символ зірочки (*).
Разом з тим, ми можемо залишити відкритим доступ тільки для одного бота, припустимо – від Google. Для цього в правилі User-agent прописуємо Googlebot. При цьому всі інші будуть сканувати контент на підставі власних директив з відпрацювання порожніх файлів robots.txt.
Писати про всі 302 не має сенсу, тому опишемо найбільш «популярних» гостей:
- Mediapartners – Google-Бот сервісу AdSense;
- AdsBot – Google-робот, який перевіряє якість цільових сторінок;
- Googlebot-Image – сканер графічних зображень;
- Googlebot-Video-аналізує відеоматеріали на сайті;
- Googlebot-Mobile-бот для роботи з мобільними версіями.
Для чого потрібен Disallow
По суті, він виконує функцію знака «Проїзд заборонено». Тобто – дає рекомендації щодо обмеження відвідування окремих сторінок. Якщо таких немає, рядок після прописаного правила можна залишити порожнім.
Часто, в ході робіт над сайтом виникає необхідність закрити його від індексації до завершення «ремонту». Зробити це можна через змінну «/». При цьому по завершенні доопрацювань потрібно не забути зняти це правило, тому що без нього сайт залишиться в індексі з тими ж помилками, що і в момент початку роботи над ним.
Щоб заблокувати доступ до окремих сторінок або файлів, досить прописати шлях до них, скопіювавши його з адресного рядка браузера. Наприклад:
Disallow: /cabinet.php
Disallow: /images/image-1.jpg.
Також роботу можна перекрити доступ до всіх анімацій на сторінці через команду «/*.gif$ » (актуально для будь-яких розширень).
Для чого потрібен Allow
На відміну від попередньої, ця команда дозволяє сканувати будь-який файл, призначену папку або сторінку. Наприклад, щоб роботи отримували доступ лише до сторінок, що починаються з /catalog, ігноруючи решту вмісту сайту.
Sitemap в роботс
Вказівка на карту сайту повідомляє роботу про те, що всі URL, обов’язкові для індексування, знаходяться за адресою xml-карти (https://example.ua/sitemap.xml). отже, при черговому обході, робот буде звертати уваги на зміни xml-файлу.
Crawl-delay в robots.txt
Він же-секундомір для слабких серверів, він же-параметр, що дозволяє задати періодичність завантаження сторінок сайту. Актуально для проектів, розміщених на «слабких» серверах, щоб уникнути великих затримок при зверненні пошукових ботів до странцам сайту. Вимірюється в секундах і виглядає як:
Crawl-delay: 5
ВАЖЛИВО! Google офіційно відмовилися від цієї Директиви. Що не означає, що вона не буде працювати в інших пошукових системах. Ті ж Bing або Yahoo сприймають її як і раніше.
Clean-param: що за параметр
У «простолюдді» цю команду називають «мисливцем за дублюючим контентом». Актуально для проектів з динамічними адресами на сайтах з різними варіантами сортування каталогу, id-сесіями і т. д.
Наприклад, одна і та ж сторінка доступна за кількома адресами:
www.example.ua/catalog/get_airbuds.ua?ref=page_1&phone_id=1
www.example.ua/catalog/get_airbuds.ua?ref=page_2&phone_id=1
www.example.ua/catalog/get_airbuds.ua?ref=page_3&phone_id=1
У таких випадках, файл robots.txt потрібно доповнити наступним параметром:
Clean-param: ref /catalog/get_airbuds.ua
Де «ref» вказує на те, звідки йде посилання, тому записується на самому початку, і лише після нього можна вказувати іншу частину файлу.
Основні символи в robots.txt
Їх кілька:
- «*» – позначає будь-яку послідовність символів у файлі і ставиться після кожного правила;
- “/”- обмежувач, який вказує на заборону сканування роботами пошукових систем;
- “$” – обмежує дію знака зірочки і прописується при необхідності заборони сканування всього вмісту папки;
- “#” – використовується для коментарів, що залишаються вебмайстром для себе або інших фахівців, не враховується при скануванні сайту.
Як перевірити правильність файлу robots.txt
Зробити це можна через Google Webmaster Tools у відповідному розділі. Для цього вводимо вихідний код файлу в форму на сторінці сервісу, а також вказуємо перевіряється сайт. При наявності помилок інструмент сповістить вас відповідним повідомленням.
Як додати robots txt на сайт
Файл з інструкціями, прописаними для роботів, потрібно додати в кореневу папку на сервері. Якщо все зроблено правильно, він буде доступний за посиланням:
https://example.ua/robots.txt
Які можуть бути помилки у файлі robots.txt
Практично всі помилки в «роботс.тхт » викликані поспіхом або неуважністю вебмастера. Але найчастіше, мова йде про:
- Плутанину в інструкціях;
- Записи декількох папок під одну команду Disallow;
- Недотримання регістру;
- Порожнє поле в правилі User-agent;
- Зайві знаки;
- Додавання в файл сторінок, які не повинні потрапити в індекс.