Що таке robots.txt і навіщо він потрібен

Зміст

За навігацію для ботів пошукових систем, що сканують і індексують сайт для його появи у видачі, відповідають два файли – sitemap.xml і robots.txt. І якщо xml-файл є своєрідною «картою», то в ролі «навігатора» виступає саме robots. Адже він вказує боту, на що звертати увагу при перегляді сторінок. І в більшості випадків, при падінні трафіку необхідна термінова настройка роботс тхт.

 

Що таке роботс тхт?

Robots.txt, він же індексний фай, являє собою звичайний текстовий документ в кодуванні UTF-8, що діє на протоколах http, https, FTP і вказує пошуковим роботам на сторінки і файли, які варто просканувати. Якщо він буде містити символи в іншому кодуванні, з великою часткою ймовірності боти не зможуть сприймати їх, а отже – порушиться відпрацювання.

 

Файл повинен розташовуватися в кореневому каталозі як звичайний текстовий документ, що відкривається через «Блокнот». А також відкриватися через браузер за адресою

 

https://example.ua/robots.txt

 

Окреме обмеження щодо файлу для роботів встановив Google-його розмір не повинен перевищувати 500кб.

 

Правила, перераховані в ньому дійсні тільки по відношенню до хоста, протоколу і номера порту сервера, де він розміщений. При їх відпрацюванні, боти можуть отримувати одну з трьох інструкцій:

 

  1. Частковий доступ до сканування окремих елементів сайту;
  2. Повний доступ, що дозволяє сканувати все, що є на сайті;
  3. Абсолютна заборона на сканування та індексацію сайту.

При роботі з файлом роботи можуть віддавати наступні відповіді:

 

  • 2ХХ-ОК, сканування пройшло вдало;
  • 3ХХ-РЕДИРЕКТ, пошуковий робот переадресовується до тих пір, поки не отримає іншу відповідь, відмінний від 3хх;
  • 4хх-робот отримує доступ до сканування будь-яких елементів і всього вмісту сайту;
  • 5хх-сигналізує про тимчасові помилки сервера або повну заборону сканування.
copy
Залишились питання?
Напишіть
Наш менеджер відповість протягом 15 хвилин
Задати питання

Навіщо потрібен файл robots.txt

На будь-якому сайті є сторінки, які роботам краще не відвідувати. Зокрема:

 

  • Ті, що містять особисті дані користувачів;
  • Форми відправки інформації;
  • “Дзеркала” сайту;
  • Результати внутрішнього пошуку і т. д.

 

Правильне налаштування robots.txt перетворює його в надійний контрольно-пропускний пункт, що вказує на зони з обмеженим доступом. Однак! Практиці СЕО-фахівців відомі випадки, коли  «службові» сторінки таки виявлялися у видачі. І траплялося це через неграмотне внутрішнє перелінкування або помилки у зовнішній оптимізації.

 

Як правильно створити файл robots.txt

Оскільки він являє собою файл в текстовому форматі, для його створення знадобитися будь-який текстовий редактор, здатний зберігати файли в форматі TXT з кодуванням UTF-8. У самому ж документі необхідно прописати інструкцію User-agent, основне правило Disallow, а також кілька другорядних команд.

 

User-agent: що за правило і навіщо потрібно

 

За допомогою юзер-агента можна вказати, які роботи можуть переглядати інструкції, описані у файлі. На даний момент ваш сайт можуть «прочісувати» 302 пошукових робота. І щоб не прописувати кожен з них окремо, до команди можна додати символ зірочки (*).

 

Разом з тим, ми можемо залишити відкритим доступ тільки для одного бота, припустимо – від Google. Для цього в правилі User-agent прописуємо Googlebot. При цьому всі інші будуть сканувати контент на підставі власних директив з відпрацювання порожніх файлів robots.txt.

 

Писати про всі 302 не має сенсу, тому опишемо найбільш «популярних» гостей:

  1. Mediapartners – Google-Бот сервісу AdSense;
  2. AdsBot – Google-робот, який перевіряє якість цільових сторінок;
  3. Googlebot-Image – сканер графічних зображень;
  4. Googlebot-Video-аналізує відеоматеріали на сайті;
  5. Googlebot-Mobile-бот для роботи з мобільними версіями.

Для чого потрібен Disallow

 

По суті, він виконує функцію знака «Проїзд заборонено». Тобто – дає рекомендації щодо обмеження відвідування окремих сторінок. Якщо таких немає, рядок після прописаного правила можна залишити порожнім.

 

Часто, в ході робіт над сайтом виникає необхідність закрити його від індексації до завершення «ремонту». Зробити це можна через змінну «/». При цьому по завершенні доопрацювань потрібно не забути зняти це правило, тому що без нього сайт залишиться в індексі з тими ж помилками, що і в момент початку роботи над ним.

 

Щоб заблокувати доступ до окремих сторінок або файлів, досить прописати шлях до них, скопіювавши його з адресного рядка браузера. Наприклад:

 

Disallow: /cabinet.php

Disallow: /images/image-1.jpg.

 

Також роботу можна перекрити доступ до всіх анімацій на сторінці через команду «/*.gif$ » (актуально для будь-яких розширень).

 

Для чого потрібен Allow

 

На відміну від попередньої, ця команда дозволяє сканувати будь-який файл, призначену папку або сторінку. Наприклад, щоб роботи отримували доступ лише до сторінок, що починаються з /catalog, ігноруючи решту вмісту сайту.

 

Sitemap в роботс

 

Вказівка на карту сайту повідомляє роботу про те, що всі URL, обов’язкові для індексування, знаходяться за адресою xml-карти (https://example.ua/sitemap.xml). отже, при черговому обході, робот буде звертати уваги на зміни xml-файлу.

 

Crawl-delay в robots.txt

 

Він же-секундомір для слабких серверів, він же-параметр, що дозволяє задати періодичність завантаження сторінок сайту. Актуально для проектів, розміщених на «слабких» серверах, щоб уникнути великих затримок при зверненні пошукових ботів до странцам сайту. Вимірюється в секундах і виглядає як:

 

Crawl-delay: 5

 

ВАЖЛИВО! Google офіційно відмовилися від цієї Директиви. Що не означає, що вона не буде працювати в інших пошукових системах. Ті ж Bing або Yahoo сприймають її як і раніше.

 

Clean-param: що за параметр

 

У «простолюдді» цю команду називають «мисливцем за дублюючим контентом». Актуально для проектів з динамічними адресами на сайтах з різними варіантами сортування каталогу, id-сесіями і т. д.

 

Наприклад, одна і та ж сторінка доступна за кількома адресами:

 

www.example.ua/catalog/get_airbuds.ua?ref=page_1&phone_id=1

www.example.ua/catalog/get_airbuds.ua?ref=page_2&phone_id=1

www.example.ua/catalog/get_airbuds.ua?ref=page_3&phone_id=1

 

У таких випадках, файл robots.txt потрібно доповнити наступним параметром:

 

Clean-param: ref /catalog/get_airbuds.ua

 

Де «ref» вказує на те, звідки йде посилання, тому записується на самому початку, і лише після нього можна вказувати іншу частину файлу.

 

Основні символи в robots.txt

Їх кілька:

  1. «*» – позначає будь-яку послідовність символів у файлі і ставиться після кожного правила;
  2. “/”- обмежувач, який вказує на заборону сканування роботами пошукових систем;
  3. “$” – обмежує дію знака зірочки і прописується при необхідності заборони сканування всього вмісту папки;
  4. “#” – використовується для коментарів, що залишаються вебмайстром для себе або інших фахівців, не враховується при скануванні сайту.

Як перевірити правильність файлу robots.txt

Зробити це можна через Google Webmaster Tools у відповідному розділі. Для цього вводимо вихідний код файлу в форму на сторінці сервісу, а також вказуємо перевіряється сайт. При наявності помилок інструмент сповістить вас відповідним повідомленням.

 

Як додати robots txt на сайт

Файл з інструкціями, прописаними для роботів, потрібно додати в кореневу папку на сервері. Якщо все зроблено правильно, він буде доступний за посиланням:

 

https://example.ua/robots.txt

 

Які можуть бути помилки у файлі robots.txt

Практично всі помилки в  «роботс.тхт » викликані поспіхом або неуважністю вебмастера. Але найчастіше, мова йде про:

 

  • Плутанину в інструкціях;
  • Записи декількох папок під одну команду Disallow;
  • Недотримання регістру;
  • Порожнє поле в правилі User-agent;
  • Зайві знаки;
  • Додавання в файл сторінок, які не повинні потрапити в індекс.

Можливо вам буде цікаво

Дизайн
Скільки коштує і як запустити рекламу у блогерів в Інстаграмі

Навіть якщо ви не знаєте про те, що таке «сарафанне..

2024-11-11
Дизайн
Рекомендації зі створення бізнес-акаунта в Інстаграмі

Instagram – одна з найбільших соціальних мереж світу, що зібрала..

Дизайн
Як продавати в Instagram

Якщо спочатку Instagram розроблявся як інтернет-фотоальбом з елементами соціальної мережі,..

Дизайн
SMM просування: ефективні методи розкрутки в соціальних мережах

Життя сучасної людини складно уявити без соціальних мереж. Причому якщо..

Дизайн
Як утримати клієнта на сайті: кілька ефективних способів

У профільному середовищі маркетологів точаться активні суперечки з приводу того,..

Дизайн
Показник відмов сайту

Показник відмов – фактор, який має безпосередній вплив на ранжування..

Підпишись на наш блог

Підписка оформлена!

Підписатися на блог Показник відмов сайту — Фото 1