Как проверить роботс тхт в вебмастере яндекс
Перейти к содержимому

Как проверить роботс тхт в вебмастере яндекс

  • автор:

Гайд по robots.txt: создаём, настраиваем, проверяем

like

135

В этой статье мы рассмотрим:

  • Что такое robots.txt?
  • Все директивы файла:
    • Disallow и Allow
    • Sitemap
    • Host
    • Crawl-delay
    • Clean-param
    • WordPress
    • Joomla
    • Bitrix

    Что такое robots.txt?

    Robots.txt — это текстовый файл, который содержит в себе рекомендации для действий поисковых роботов. В этом файле находятся инструкции (директивы), с помощью которых можно ограничить доступ поисковых роботов к определённым папкам, страницам и файлам, задать скорость сканирования сайта, указать главное зеркало или адрес карты сайта.

    Обход сайта поисковыми роботами начинается с поиска файла роботс. Отсутствие файла не является критической ошибкой. В таком случае роботы считают, что ограничений для них нет и они полностью могут сканировать сайт.
    Файл должен быть размещён в корневом каталоге сайта и быть доступен по адресу https://mysite.com/robots.txt.

    Инструкции стандарта исключения для роботов носят рекомендательный характер, а не являются прямыми командами для роботов. То есть существует вероятность, что даже закрыв страницу в robots.txt, она всё равно попадёт в индекс.

    Указывать директивы в файле нужно только латиницей, использовать кириллицу запрещено. Русские доменные имена можно преобразовать с помощью кодировки Punycode.

    Если домен указан на кириллице нужно декодировать с помощью Punycode

    Что нужно закрыть от индексации в robots.txt?

    • страницы с личной информацией пользователей;
    • корзину и сравнение товаров;
    • переписку пользователей;
    • административную часть сайта;
    • скрипты.

    Как создать robots.txt?

    Составить файл можно в любом текстовом редакторе (блокнот, TextEdit и др.). Можно создать файл robots.txt для сайта онлайн, воспользовавшись генератором файла, например, инструментом сервиса Seolib.

    Сервис для создания файла robot.txt

    Нужен ли robots.txt?

    Прописав правильные инструкции, боты не будут тратить краулинговый бюджет (количество URL, которое может обойти поисковый робот за один обход) на сканирование бесполезных страниц, а проиндексируют только нужные для поиска страницы. В дополнение, не будет перегружаться работа сервера.

    Директивы robots.txt

    Файл роботс состоит из основных директив: User-agent и Disallow и дополнительных: Allow, Sitemap, Host, Crawl-delay, Clean-param. Ниже мы разберём все правила, для чего они нужны и как их правильно прописать.

    User-agent — приветствие с роботом

    Существует множество роботов, которые могут сканировать сайт. Наиболее популярными являются боты поисковых систем Google и Яндекса.

    • Googlebot;
    • Googlebot-Video;
    • Googlebot-News;
    • Googlebot-Image.
    • YandexBot;
    • YandexDirect;
    • YandexDirectDyn;
    • YandexMedia;
    • YandexImages;
    • YaDirectFetcher;
    • YandexBlogs;
    • YandexNews;
    • YandexPagechecker;
    • YandexMetrika;
    • YandexMarket;
    • YandexCalendar.

    В директиве User-agent указывают, к какому роботу обращены инструкции.
    Для обращения ко всем роботам достаточно прописать следующую строку в файле:

    Обращение ко всем роботам в файле robot.txt

    Для обращения к определённому роботу, например, к Google, нужно прописать в этой строке его имя:

    Обращение к роботу Google в файле robot.txt

    В отличие от Google, дабы не прописывать правила для каждого робота Яндекса, в User-agent можно указать следующее:

    Обращение к роботу Яндекса в файле robot.txt

    В Рунете принято прописывать инструкции для двух User-agent: для всех и отдельно для Яндекса.

    Директивы Disallow и Allow

    Чтобы запретить роботу доступ к сайту, каталогу или странице, используйте Disallow.

    Как применять правило Disallow в различных ситуациях

    Закрыть от индексации весь сайт : используйте слеш (/), чтобы заблокировать доступ ко всему сайту.

    Использование слеша (/), чтобы заблокировать доступ ко всему сайту

    Полностью закрывать доступ роботам стоит на ранних этапах работы с сайтом, чтобы в поисковой выдачи он появился уже готовым.

    Закрыть доступ к папке и её содержимому : используйте слеш после названия папки.

    Закрытие доступа к определенной папке

    Закрыть определённую страницу или файл : укажите URL без хоста.

    Закрытие определенного URl

    Открыть доступ к странице из закрытой папки : после Disallow используйте правило Allow.

    Открытие страницы из закрытой папки

    Запретить доступ к файлам одного типа: чтобы запретить к обходу однотипные файлы, воспользуйтесь специальными символами * и $.

    Использование спец символов для запрета обхода

    Адрес Sitemap в robots.txt

    Если на сайте есть файл Sitemap, укажите в соответствующей директиве адрес к нему. Если же карт сайта несколько, пропишите все.

    Указание пути к карте сайта

    Это правило учитывается роботами независимо от его месторасположения.

    Директива Host для Яндекса

    UPD: 20 марта Яндекс официально объявил об отмене директивы Host. Подробнее об этом можно прочитать в блоге Яндекса для вебмастеров.Что теперь делать с директивой Host:

    • удалить из robots.txt;
    • оставить — робот будет игнорировать её.

    В обоих случаях нужно настроить 301 редирект.

    Роботы Яндекса поддерживают robots.txt с расширенными возможностями. Инструкция Host является одной из них. Она указывает главное зеркало сайта.

    Указание главного зеркала сайта через инструкцию HOST

    • 1. использовать www (если так начинается адрес сайта);
    • 2. использовать HTTPS (если сайт на защищённом протоколе, если нет — HTTP можно не прописывать).

    Как и с Sitemap, месторасположение правила не влияет на работу робота, оно может быть указано как в начале файла, так и в конце.

    Некорректно прописанная директива Host игнорируется роботом.

    Crawl-delay

    UPD: ПС Яндекс также отказалась от учёта Crawl-delay. Подробнее в блоге Яндекса для вебмастеров.

    Вместо директивы Crawl-delay можно настроить скорость обхода в Яндекс.Вебмастере.

    Директива Crawl-delay указывает время, которое роботы должны выдерживать между загрузкой двух страниц. Эта инструкция значительно снизит нагрузку на сервер, если у него есть проблемы с обработкой запросов.

    Использование директивы Crawl-delay

    Строка с Crawl-delay должна находиться после всех директив с Allow и Disallow.

    Так как Google это правило не учитывает, для гуглбота есть другой метод изменения скорости сканирования.

    Clean-param

    Для исключения страниц сайта, которые содержат динамические (GET) параметры (например, сортировка товара или идентификаторы сессий), используйте директиву Clean-param.

    Например, есть следующие страницы:

    Использование директивы Clean-param

    Используя данные из Clean-param, робот не будет перезагружать дублирующуюся информацию.

    Спецсимволы $, *, /, #

    Спецсимвол * (звёздочка) означает любую последовательность символов. То есть, используя звёздочку, вы запретите доступ ко всем URL, содержащим слово «obmanki».

    Спецсимвол * запрещает доступ ко всем URL, содержащим слово

    Этот спецсимвол проставляется по умолчанию в конце каждой строки.

    Спецсимвол * по умолчанию проставляется в конце каждой строки

    Чтобы отменить *, в конце правила нужно указать спецсимвол $ (знак доллара).

    Чтобы отменить *, в конце правила нужно указать спецсимвол $ (знак доллара).

    Спецсимвол / (слеш) используется в каждой директиве Allow и Disallow. С помощью слеша можно запретить доступ к папке и её содержимому /category/ или ко всем страницам, которые начинаются с /category.

    С помощью слеша можно запретить доступ к папке и её содержимому

    Спецсимвол # (решётка) используется для комментариев в файле для себя.

    Спецсимвол # (решётка).
    Используется для комментариев в файле для себя, пользователей, или других веб-мастеров. Поисковые роботы эту информацию не учитывают.

    Проблемы с трафиком или позициями? Пройди бесплатную диагностику сайта и найди причину самостоятельно

    Проверка работы файла

    Чтобы проверить файл robots.txt на наличие ошибок, можно воспользоваться инструментами от Google и/или Яндекса.

    Как проверить robots.txt в Google Search Console?

    Перейдите к инструменту проверки файла. Ошибки и предупреждения будут выделены в содержании роботс.тхт, а общее количество указано под окном редактирования.

    Проверка файла robot.txt на предмет ошибок

    Чтобы проверить, доступна ли страница роботу, в соответствующем окне введите URL страницы и нажмите кнопку «проверить». После проверки инструмент покажет статус страницы: доступен или недоступен.

    Инструкция по проверке доступности страницы роботу

    Как проверить robots.txt в Яндекс.Вебмастер?

    Для проверки файла нужно перейти в «Инструменты» — «Анализ robots.txt».

    Проверка файла robot.txt на предмет ошибок в Яндекс.Вебмастере

    Список ошибок, возникающих при анализе роботс.

    Чтобы проверить, разрешён ли доступ к странице, в соответствующем окне введите URL страницы и нажмите кнопку «проверить». После проверки инструмент покажет статус страницы: знак галочки (разрешён) или будет выведена директива, запрещающая доступ.

    Проверка индексации URL в Яндекс.Вебсмастер

    Распространённые ошибки

      • неправильное имя файла;
        Файл должен называться robots.txt. Ошибки, допускаемые в названии файла: robot.txt, Robots.txt, ROBOTS.TXT.
      • незаполненная строка в User-agent;

      Незаполненная строка в User-agent

        • перепутанные инструкции или неправильный порядок директив;

        Перепутанные инструкции в файле robot.txt

        Ошибка в написании файла robot.txt

        или

          • пробелы, расставленные в разных местах;

          Лишние пробелы в файле robot.txt

            • использование больших букв;

            Ошибка использования больших букв в файле robot.txt

            Ошибка использования директивы Allow для индексации

              • Allow для индексации;
                Она нужна только для переопределения директивы Disallow в том же файле robots.txt.
              • после доработок весь сайт остаётся закрытым от индексации;

            Не корректно проработан файл robot.txt

              • закрыты от индексации CSS и JavaScript.
                Часто встречаются сайты, у которых в robots.txt закрыты стили. По итогу роботы видят страницу следующим образом:

              В файле robot.txt закрыты от индексации CSS и JavaScript

              Поисковые системы не рекомендуют закрывать эти файлы от роботов.

              Необходимые рекомендации Яндекса

              Необходимые рекомендации Google

              Robots.txt для различных CMS

              Ниже мы предлагаем рассмотреть часто используемые директивы для различных CMS. Это не конечный вариант файла robots.txt. Этот набор правил редактируется под каждый сайт отдельно и зависит от того, что нужно закрыть, а что — оставить открытым.

              Robots.txt для WordPress

              Пример файла под Вордпресс:

              User-Agent: * Disallow: /wp-login.php Disallow: /wp-register.php Disallow: /xmlrpc.php Disallow: /template.html Disallow: /wp-admin Disallow: /wp-includes Disallow: /wp-content Allow: /wp-content/uploads/ Disallow: /tag Disallow: /category Disallow: /archive Disallow: */trackback/ Disallow: */feed/ Disallow: */comments/ Disallow: /?feed= Disallow: /?s= Allow: /wp-content/*.css* Allow: /wp-content/*.jpg Allow: /wp-content/*.gif Allow: /wp-content/*.png Allow: /wp-content/*.js* Allow: /wp-includes/js/ Host: mysite.com Sitemap: http://mysite.com/sitemap.xml

              Robots.txt для Joomla

              Пример роботс для Джумла:

              User-agent: * Disallow: /administrator/ Disallow: /cache/ Disallow: /components/ Disallow: /images/ Disallow: /includes/ Disallow: /installation/ Disallow: /language/ Disallow: /libraries/ Disallow: /media/ Disallow: /modules/ Disallow: /plugins/ Disallow: /templates/ Disallow: /tmp/ Disallow: /xmlrpc/ Allow: /templates/*.css Allow: /templates/*.js Allow: /media/*.png Allow: /media/*.js Allow: /modules/*.css Allow: /modules/*.js Host: mysite.com Sitemap: http://mysite.com/sitemap.xml

              Robots.txt для Bitrix

              Пример файла для Битрикса:

              User-agent: * Disallow: /*index.php$ Disallow: /bitrix/ Disallow: /auth/ Disallow: /personal/ Disallow: /upload/ Disallow: /search/ Disallow: /*/search/ Disallow: /*/slide_show/ Disallow: /*/gallery/*order=* Disallow: /*?* Disallow: /*&print= Disallow: /*register= Disallow: /*forgot_password= Disallow: /*change_password= Disallow: /*login= Disallow: /*logout= Disallow: /*auth= Disallow: /*action=* Disallow: /*bitrix_*= Disallow: /*backurl=* Disallow: /*BACKURL=* Disallow: /*back_url=* Disallow: /*BACK_URL=* Disallow: /*back_url_admin=* Disallow: /*print_course=Y Disallow: /*COURSE_ID= Allow: /bitrix/*.css Allow: /bitrix/*.js Host: mysite.com Sitemap: http://mysite.com/sitemap.xml

              Заключение

              Файл Robots.txt — полезный инструмент в формировании взаимоотношений между поисковыми роботами и вашим сайтом. При правильном использовании он может оказать положительное влияние на ранжирование и сделать сайт более удобным для сканирования. Используйте это руководство, чтобы понять, как работает robots.txt, как он устроен и как его использовать.

              P.S. В знак благодарности, что дочитали статью до конца, мы подготовили подборку неожиданных находок в файлах robots.txt.

              Неожиданная находка в файле robot.txt

              Площадка для обмена знаниями, учебниками и ГДЗ

              Неожиданная находка в файле robot.txt

              Приглашение на работу от известного SEO-сервиса

              В файле robot.txt приглашение на работу

              Ещё одно приглашение, но уже в файле humans.txt

              В файле robot.txt приглашение на работу

              После 2166 запрещающих, направляющих и разрешающих директив, в конце файла можно обнаружить рисуночек

              Прикол в файле robot.txt

              Хотите узнать, нет ли ошибок в robots.txt на вашем сайте, — мы можем провести технический аудит, в котором проанализируем файл и напишем инструкции по исправлению недоработок!

              Подписаться на рассылку

              • Что необходимо закрывать от индексации на сайте Что такое индексация сайта Что следует закрывать на сайте Размещённый контент Страницы Весь сайт Какие данные закрывать не стоит Как закрывать от индексации контент, страницу.
              • Инструменты для анализа отображения сайта на разных устройствах Поисковые системы учитывают поведенческие факторы как в десктопной версии, так и на мобильных устройствах, поэтому необходимо учитывать этот факт при разработке сайта (или при его.
              • Обзор CMS-систем — какой движок выбрать? Часть 1 При создании сайта мы часто делаем выбор в пользу CMS. Давай попробуем разобраться, чем же обусловлен наш выбор, и как определиться с подходящим инструментом. Предисловие.
              • 6 плагинов для ускорения сайта на WordPress Плагины, которые мы рассмотрим в этой статье, необходимо использовать для того, чтобы ускорить работу сайта и, как следствие, сделать его более удобным /привлекательным для пользователей.
              • Как сделать редизайн и переезд сайта без потерь позиций и трафика Вступление Делая редизайн сайта, вы, конечно же, надеетесь на улучшение позиций, трафика. Вряд ли кто-то рассчитывает увидеть после доработок такой график: На практике ситуация с.

              За два года от стажера до тимлида.

              Google меня любит.

              Множко катаю на сапборде.

              Девиз: Либо делай качественно, либо делай качественно.

              Как проверить файл robots.txt в Яндекс и Google: пошаговая инструкция

              Первым делом необходимо проверить доступность файла robots.txt. Переходим и смотрим его визуально https://robotstxt.ru/robots.txt, открывается ли он.

              Дальше нам необходимо проверить его техническую доступность, заходим в сервис проверки ответа сервера Яндекса.

              Вводим путь к вашему файлу robots.txt и нажимаем проверить.

              Как проверить файл robots.txt в Яндекс и Google: пошаговая инструкция

              Должен отображаться ответ сервера 200. Если вы видите другие цифры, то значит robots.txt не доступен и поисковая система не сможет его прочитать.

              Содержание

              Как проверить в Яндекс?

              Как проверить в Google?

              Благодаря данному инструменту любой вебмастер и оптимизатор может посмотреть, открыты ли в robots.txt конкретные URL и файлы для индексирования роботами поисковой системы Google?

              Допустим, на вашем сайте есть картинка, которую вы не желаете видеть в результатах выдачи Гугла по картинкам. В инструменте Robots Testing Tool вы узнаете, закрыт ли доступ к изображению боту Googlebot-Image.

              Здесь нужно прописать URL-адрес, по которому располагается изображение. Далее инструмент обработает robots.txt таким же способом, что и робот Гугла по картинкам, чтобы выяснить, запрещен ли указанный УРЛ для индексирования.

              Инструкция по проверке

              1. Зайдите в Google Search Console и укажите свой сайт.
              2. Выберите инструмент проверки и проверьте инструкции, прописанные в файле Robots. Любые логические и синтаксические ошибки будут подчеркнуты, а их общее количество можно узнать внизу окна редактирования.
              3. В самом низу страницы найдите поле, предназначенное для указания необходимого URL-адреса.
              4. В меню, которое откроется справа, выберите бота.
              5. Кликните “Проверить”.
              6. После проверки инструмент покажет статус адреса: “Доступен” либо “Недоступен”. Если статус “Доступен”, значит роботам Гугла не запрещено включать в поиск изображение, а если “Недоступен”, то картинка не будет участвовать в поиске.
              7. Если нужно, сделайте необходимые исправления в меню и проверьте роботс снова. Имейте ввиду, что все изменения не вносятся в файл robots.txt вашего веб-ресурса автоматически.
              8. Сделайте копию измененного содержания и вставьте ее в robots на вашем сервере.

              Что нужно знать

              1. Никакие изменения в редакторе не сохраняются на сервере в автоматическом режиме. Нужно скопировать измененный код и внести его в файл роботс.
              2. Инструмент для проверки Robots показывает результаты только для юзер-агентов Google и роботов данной поисковой системы. При этом сотрудники компании не могут давать никаких гарантий, что роботы других поисковиков будут учитывать содержание файла так же, как и Гугл.

              Как отправить измененный robots.txt в Google?

              В инструменте проверки роботса есть кнопка “Проверить”, благодаря которой ускоряется обход и включение в индекс нового robots.txt. Для передачи его в поисковую систему Google необходимо:

              1. В правом нижнем углу редактора файла Robots кликнуть на кнопку “Проверить”. Так вы откроете диалоговое окно передачи.

              2. Для выгрузки из инструмента кода файла, который был изменен, нажмите кнопку “Загрузить”.

              3. Загрузите новый Robots в корневую папку сайта. Необходимо, чтобы URL файла выглядел следующим образом: /robots.txt.

              На заметку. Если у вас нет доступа к админке, из-за чего нет возможности загружать файлы в корневой каталог домена, свяжитесь с его администратором.

              Допустим, главная страница вашего веб-ресурса находится по адресу subdomain.site.ru/site/example. Тогда есть вероятность, что вы не сможете обновить файл robots, расположенный по адресу subdomain.site.ru/robots.txt. Тогда напишите владельцу домена с просьбой изменить файл.

              4. Нажмите “Проверить”. Так вы узнаете, применяется ли новая версия Robots, которую вы хотите, чтобы роботы просканировали.

              5. Кликните “Отправить в Google” для отправки поисковой машине сигнала, что файл был изменен и его необходимо проверить.

              6. Удостоверьтесь в том, что измененный файл был успешно проверен роботами. Для этого необходимо обновить страницу “Инструмент проверки файла robots.txt”. После этого обновится окно редактирование, где отобразится новый код файла. В меню, открывающемся над текстовым редактором, вы узнаете, когда Googlebot первый раз увидел актуальную версию роботса.

              Проверка с помощью Google Robots.txt Parser и Matcher Library

              На Github доступен официальный парсер Robots.txt от Google. В 2019 году Google предоставил к нему доступ после того, как Robots Exclusion Protocol (REP) был объявлен официальным стандартом.

              Эту библиотеку использует и сама компания Google для парсинга файла robots.txt на сайтах и сопоставления правил в нем. Поэтому, если вы знакомы с программированием, то сможете самостоятельно установить ее к себе и протестировать свой robots.txt на наличие ошибок.

              Заключение

              Следуя инструкциям выше, вы будете уверены в том, что настроили Robots.txt правильно и поисковые системы сканируют файл так, как вам нужно.

              Я всегда стараюсь следить за актуальностью информации на сайте, но могу пропустить ошибки, поэтому буду благодарен, если вы на них укажете. Если вы нашли ошибку или опечатку в тексте, пожалуйста, выделите фрагмент текста и нажмите Ctrl+Enter.

              Как проверить роботс тхт в вебмастере яндекс

              • Комплексное продвижение
              • Таргетинговая реклама
              • Управление репутацией
              • Продвижение магазина
              • Продвижение нового сайта
              • Международное продвижение
              • Анализ конкурентов
              • Контент маркетинг блога
              • СЕО аудит

              Robots.txt: полное руководство по настройке

              обновлено: 13.01.2020 1567520449

              Александр Коваленко , CEO/founder агентства Advermedia.ua, опыт в SEO более 10 лет. Канал автора в телеграм: @seomnenie

              • View Larger Image

              В данной статьей мы подготовили максимальной развернутое руководство по предназначению, созданию и настройке файла robots.txt для управления индексацией вашего сайта. Данный FAQ будет полезен собственникам сайтов, вебмастерам для своих проектов, а также SEO-специалистам, как начинающим (вникнуть и разобраться), так и опытным (освежить знания и все актуальные обновления).

              Содержание статьи

              1. Что такое robots.txt и зачем он нужен
              2. Что такое поисковый робот и как он работает
              3. Из чего состоит файл robots.txt
              4. Требования к самому файлу robots.txt
                4.1. Месторасположение файла robots.txt
              1. Директивы файла robots.txt
                5.1 Директива User-agent
                5.2 Директива Allow
                5.3 Директива Disallow
                5.4 Директива Host
                5.5 Директива Sitemap
                5.6 Директива Clean-param
                5.7 Директива Crawl-Delay
              1. Как составить файл robots.txt
                6.1. Составляем файл робот вручную
                6.2. С помощью онлайн-генератора
              1. Как проверить robots.txt
              2. Файл robots.txt для популярных CMS
                8.1. Создание файла robots в WordPress
                8.2. Создание файла robots в Битрикс
                8.3. Создание файла robots в Joomla
              1. Примеры файлов robots.txt известных сайтов
              2. Важность управления индексацией сайта через robots.txt
                10.1. Какие страницы нужно закрывать от индексации
                10.2. Что лучше использовать robots.txt или meta-noindex
                10.3. Для чего robots.txt НЕ нужно использовать
              1. Заключение

              1. Что такое файл robots.txt и зачем он нужен

              Файл robots.txt – это системный файл, который представляет собой текстовый документ (.txt) и соответствует стандарту исключений для роботов поисковых систем.

              Для чего нужен файл роботс:

              Роботс тхт включает одно или несколько правил, каждое из которых запрещает или разрешает тому или иному поисковому роботу доступ к определенному пути на сайте.

              Как работает файл robots.txt:

              Метод заключается в создание файла на сервере, который определяет правила доступа к данным сервера для роботов. Данное решение легко реализуемо на любом WWW-сервере, а сам робот получает набор правил доступа с помощью одного извлечения файла.

              Это интересно знать:

              1. Стандарт robots.txt появился в 30 января 1994 году, был принят на консорциумоме W3C .
              2. Создал стандарт Мартин Костер , после того как роботы положили его сайт. Почему стандарт появился в общем: в 1993-1994 году поисковые роботы посещали сервера, где их совсем не ждали или это было ненужно (завал запросами роботов к серверу, обход непригодных частей сервера (глубокие виртуальные деревья, дублированная информация и т.д.)). Появилась необходимость в механизме, который позволял бы указать роботам части сервера, которые недоступны для сканирования.
              3. Почему выбрали именно именно текстовый документ и название файла “robots” (в переводе – роботы)? Расширение файла не должно требовать дополнительных настроек сервера. Имя файла должно быть легко запоминаемым и иметь низкую вероятность сходства с другими файлами.
              4. 1 июля 2019 Google объявил , что ведется работа над превращением протокола robots.txt в стандарт интернета .
              5. В 1996 году был предложен расширенный стандарт robots.txt , с директивами Request-rate и Visit-time.

              2. Что такое поисковый робот и как он работает

              Поисковый робот это робот, который автоматически сканирует сайт путем рекурсивного доступа к известным URL-адресам (страницам, которые доступны через браузер). Если робот обнаружил новый URL-адрес через карту сайта или ссылку на сайте – робот также выполняет сканирование этого адреса.

              У поисковиков есть разные поисковые роботы, каждый из которых имеет свое предназначение.

              Какие задачи выполняют поисковые роботы:

              • обработку запросов извлечение документов с сервера;
              • проверку ссылок;
              • проверку доступности сайта/сервера;
              • мониторинг изменений и обновлений документов;
              • анализ контента страниц для размещения контекстной рекламы (если сайт добавлен в систему контекстной рекламы).

              Как поисковый робот ведет себя вашем на сайте:

              • Запрашивает файл robots.txt. Это происходит при обращение к серверу (другими словами, представим, что робот приходит в ресторан и запрашивает меню). Важно отметить, что поисковый робот обращается к файлу роботс не при каждом обращение к серверу.
              • Выборочно скачивает документы. Робот указывает конкретные типы данных, которые необходимы для обработки. Основные роботы поисковиков первоочередно делают запрос на текстовые документы (без учета стиля оформления CSS), изображения, видео, а также файлы в других расширениях PDF, Rich Text, MS Word, MS Excel и др.
              • Предсказать путь поискового робота по сайту, как правило – невозможно;
              • Робот делает запросы с определенным интервалом, чтобы не перегрузить сервер.

              3. Из чего состоит файл robots.txt

              Давайте разберемся, что должно быть в файле robots.txt. Текстовый документ роботс состоит из записей, которые разделяют одна или более пустых строк (с помощью символов CR, CR/LF или LF) .

              Запись – это непустая строка со структурой:

              Где — это наименование директивы, а — это конкретное значение указанной директивы. Пробелы не обязательны, при этом Google рекомендует использовать их для удобства чтения файла.

              Мы разобрались с полями и значениями, давайте разберемся со структурой

              Файл робот состоит из групп, каждая из которых может содержать разный набор правил (директив) в формате 1 правило – 1 строка.

              Каждая группа состоит из:

              • указания робота, для которого будут применены директивы;
              • к каким каталогам и файлам у робота будет доступ;
              • к каким каталогам и файлам у робота доступа не будет.
              • Комментарии можно размещать в любом месте файла, обозначая их символом # в начале строки ;
              • Пробельные символы в начале и конце строки игнорируются ;
              • Регистр до двоеточия не учитывается, т.е. можно указать User-agent или USER-AGENT – это не имеет значения. А вот регистр после двоеточия учитывается, к примеру Url.html и url.html – будут разными адресами;

              Для Яндекса. Недопустимо наличие пустых переводов строки между директивами User-agent , Disallow и Allow .

              4. Требования к самому файлу robots.txt

              Поисковые системы Google и Яндекс описывают четкие требования для файла robots.txt в своих инструкциях ( инструкция Google , инструкция Яндекс ).

              Мы собрали общий набор требований, которые необходимо соблюдать для обоих поисковых систем:

              • название файла или как правильно написать название файла: исключительно “robots”
              • файл должен содержать текст в кодировке UTF-8 (включает коды символов ASCII), другие наборы символов запрещены;
              • строки должны разделяться одной или несколькими пустыми строками;
              • максимальный размер файла, установленный Google, составляет 500 КБ, тем не менее ограничение у Яндекса 32 КБ (если больше – робот считает доступ к содержимому сайту открытым);
              • размещение файла – только корневая директория;
              • использование кириллицы запрещено, используйте Punycode для указания адресов в кириллице (в кириллице допускается указание адреса сайта в директиве Sitemap (к примеру: вашсайт.ру/sitemap.xml));
              • для каждого поддомена (субдомена) добавляется свой файл robots.txt.

              4.1. Месторасположение файла robots.txt

              Разберемся где должен находиться файл robots txt обязательно должен находиться в корневой директории вашего сайта.

              Корневая директория – это место размещение всех файлов вашего сайта. Папка, в которой размещены файлы на хостинге или сервере может называться www или public_html.

              Т.е. если стоит вопрос как посмотреть роботс сайта, просто добавьте к адресу сайта /robots.txt

              5. Директивы файла robots.txt

              Мы уже разобрались в структуре файла роботс, месте его размещения, теперь давайте разберемся как правильно настроить файл robots.txt, а именно с основными директивами, которые необходимо знать для корректной настройки.

              5.1 Директива User-agent

              В директиве User-agent указывается робот, который должен следовать указанным ниже инструкциям ИЛИ * (звездочка), которая указывает, что указанные правила действуют для всех роботов.

              User-agent : *

              или укажем поискового робота Google:

              User-agent : Googlebot

              Примечания:

              • Если есть конкретное указание робота поисковой системы, к примеру User-agent: Yandex, то строка User-agent: * не учитывается.
              • Если обнаружены директивы для конкретного робота, директивы User-agent: Yandex и User-agent: * не используются.

              Чтобы составить правильный файл robots.txt для Google и Яндекс, нужно знать основных поисковых роботов.

              Основные поисковые роботы Яндекса:

              • YandexBot — основной индексирующий робот;
              • YandexDirect — скачивает информацию о контенте сайтов-партнеров Рекламной сети, чтобы уточнить их тематику для подбора релевантной рекламы, особым образом интерпретирует robots.txt ;
              • YaDirectFetcher — робот Яндекс.Директа , особым образом интерпретирует robots.txt ;
              • YandexImages — индексатор Яндекс.Картинок ;
              • YandexMarket— робот Яндекс.Маркета ;
              • YandexMedia — робот, индексирующий мультимедийные данные;
              • YandexMetrika — робот Яндекс.Метрики ;
              • YandexNews — робот Яндекс.Новостей ;
              • YandexPagechecker — валидатор микроразметки .

              Основные поисковые роботы Google:

              • Googlebot – основной индексирующий робот;
              • Googlebot-Video – робот, индексирующий видео
              • Googlebot-News – робот индексирующий новости
              • Googlebot-Image – робот индексирующий картинки

              Рекомендации:

              • Если вам нужно указать общие инструкции для всех роботов, используйте * (звездочку)
              • Если вам нужно указать инструкции для каждого робота отдельно, используйте несколько User-agent , пример:
                User-agent: yandex
                Disallow: /category-2
                User-agent: Googlebot
                Disallow: /category-2
                User-agent: Googlebot-Image
                Disallow: /uploads

              5.2 Директива Allow

              Директива allow в robots.txt определяет разделы или страницы сайта, которые должны быть доступны указанным поисковым роботам для индексации.

              Пример использования директивы Allow:

              User-agent: Googlebot-Image
              Аllow: /images
              Disallow: /
              # комментарий: запрещаем индексировать ВЕСЬ сайт, но
              # позволяет индексировать все страницы, которые начинаются
              # с /images для робота Googlebot-Image

              Рассмотрим пример совместного использования директивы Allow и Disallow:

              User-agent: *
              Аllow: /about-us.html
              Allow: /catalog/*.html$
              Disallow: /
              # запрет индексации всех страниц кроме /about-us.html, а также все файлы .html, которые идут через путь /catalog/

              Важные примечания из справки Яндекс:

              1. При конфликте между двумя директивами с префиксами одинаковой длины приоритет отдается директиве Allow .
              2. Директивы сортируются по длине URL от самого короткого до самого длинного, применение директив происходит последовательно.
              3. Порядок следования директив в файле robots.txt не влияет на использование их роботом;
              4. Если раздел или страница не указана, она игнорируется:
                Allow:

              Рассмотрим пример сортировки строк по длине (т.е. какой будет порядок обработки), стандартный вариант:

              User-agent: yandex
              Disallow: /category
              Disallow: /category-2
              Disallow: /img
              Disallow: /admin

              Который будет обработан в следующей последовательности:

              User-agent: yandex
              Disallow: /img
              Disallow: /admin
              Disallow: /category
              Disallow: /category-2

              5.3 Директива Disallow

              Что значит директива Disallow в robots.txt

              Директива Disallow используется для закрытия от индексации нужных каталогов, файлов или страниц сайта. По умолчанию, если доступ не закрыт с помощью Disallow – робот может обрабатывать такие страницы.

              Начинаем разбираться как запретить индексацию robots.txt. Начать стоит с того, для каких страниц или разделов сайта необходимо использовать данную директиву:

              • страницы с параметрами (для Яндекса);
              • страницы результатов поиска;
              • страницы с персональной информацией пользователей;
              • системные страницы: авторизация, регистрация, формы.

              Давайте разберем примеры использования директивы Disallow:

              Важно: значения директивы чувствительны к регистру!

              Как закрыть сайт от индексирования всеми поисковыми системами целиком:

              User-agent: *
              Disallow: /

              Как закрыть от индексации весь сайт кроме главной страницы сайта (полностью сайт от индексации):

              User-agent: *
              Allow: /$
              Disallow: /

              Как запретить индексацию определенной страницы:

              User-agent: *
              Disallow: /catalog/razdel.html

              Как закрыть раздел от индексации (а также всего его содержимого):

              User-agent: *
              Disallow: /catalog/razdel/

              User-agent: *
              Disallow: /catalog/razdel$

              Как запретить индексацию всех страниц, которые начинаются с определенного раздела:

              User-agent: *
              Disallow: /catalog/razdel
              #без слеша в конце, запрещает /catalog/razdel, а также /catalog/razdel.html

              Как запретить индексацию параметров страницы:

              Используем ? после значения в директиве Disallow

              User-agent: *
              Disallow: /catalog/razdel?

              User-agent: *
              Disallow: /add.php?*user=
              # Запрещает все скрипты ‘add.php?’ с параметром ‘user’

              Давайте разберемся со спецсимволами в robots.txt:

              • * обозначает 0 или более экземпляров любого действительного символа;
              • $ обозначает конец URL.

              Как запретить индексацию всех страниц с определенным расширением (например .html), по определенному пути:

              Используем * перед значением в директиве Disallow.

              User-agent: *
              Disallow: /catalog/*.php*
              # запрещает все страницы с .php по любому пути, который начинается с /catalog/

              Как запретить индексацию всех одинаковых каталогов по одному пути:

              User-agent: *
              Disallow: /catalog/*razdel
              # запрещает раздел /catalog/razdel, а также /catalog/category/razdel

              Используем ? после значения в директиве Disallow.

              Зачем? По умолчанию в конце каждой директивы и ее значения приписывается спецсимвол *.

              User-agent: *
              Disallow: /catalog*
              # тоже самое, что и Disallow: /catalog

              Спецсимвол $ используется для отмены правила *, например:

              User-agent: *
              Disallow: /page$
              # запрещает /catalog, но не запрещает /page.html

              При этом, спецсимвол $ не запрещает указанный * на конце:

              User-agent: *
              Disallow: /page$ # запретит только /page
              Disallow: /page*$ # аналогичен Disallow: /page,
              # и запрещает /page и /page.html

              Как запретить индексацию конкретного файла:

              User-agent: *
              Disallow: /catalog/razdel/file.xls

              Как запретить индексацию всех файлов определенного типа (например .xls):

              User-agent: *
              Disallow: /*.xls$

              Как запретить индексацию всем разделам, которые содержат по пути определенную категорию

              User-agent: *
              Disallow: /*/category-1/
              # Запрещает все урлы, которые содержат /category-1/

              Частые ошибки использования директивы Disallow:

              Пример 1. Ошибка комбинации 2 директив:

              User-agent: *
              Allow: /
              Disallow: /
              # все разрешено!

              Пример 2. Ошибка комбинации 2 агентов (директива означает: для всех роботов закрыт для индексации, для яндекса – открыт):

              User-agent: *
              Disallow: /
              User-agent: Yandex
              Allow: /
              Пример 3. Если в директиве Disallow нет значения, то робот учитывает данные как в директиве Allow:/, пример:
              User-agent: *
              Disallow:
              Если сайт не в индексе поисковой системы и стоит вопрос как вернуть сайт в индекс Google и Яндекс – для начала проверьте директивы Disallow.

              5.4 Директива Host

              Директива Host – директива, с помощью которой задается главное зеркало сайта. Как правило указывается в конце списка директив в файле robots.txt

              Host : yousite.com

              • 12 марта 2018 года Яндекс отказался от использования директивы Host, на замену пришел 301 редирект;
              • Google не поддерживает директиву Host.

              Поэтому, директива HOST для Google и Яндекс не актуальна и на сегодня ее использовать не нужно.

              5.5 Директива Sitemap

              Чтобы указать роботу ссылку на карту сайта, необходимо добавить в файл роботс. Если вы добавили карту сайта в консоль Google и Яндекс Вебмастер – это не обязательно. Тем не менее, мы рекомендуем добавлять ссылку на карту сайта в файл robots.txt.

              Правильное указание ссылки на карту сайта:

              sitemap : yousite.com/sitemap.xml

              Если у вас несколько карт, которые не объединены одной общей картой – укажите все:

              sitemap : yousite.com/sitemap-1.xml
              sitemap : yousite.com/sitemap-2.xml

              Примечание:

              • Директива sitemap является межсекционной, поэтому она будет использоваться роботом вне зависимости от строки ее размещения в файле роботс

              Стоит ли добавить sitemap в robots.tx? Это не обязательно, если карта сайта добавлена через вебмастера, тем не менее это рекомендуется сделать.

              Рекомендации Яндекса по указанию ссылки на sitemap.xml в файле robots.txt:

              Рекомендации Google по указанию ссылки на sitemap.xml в файле robots.txt:

              5.6 Директива Clean-param

              Директива применяется только для Яндекса , Google не поддерживает Clean-param . Используется если URL страниц сайта содержат GET-параметры, например:

              И вы хотите ограничить доступ робота к таким страницам. Таким образом робот Яндекса не будет многократно перезагружать дубли информации.

              Что такое GET-параметры?

              GET-запрос — это метод передачи данных от клиента к серверу. Цель – получение информации, которая указана с помощью GET-параметров. Эта параметры являются публичными данными, их можно посмотреть повторно, задав тот же URL адрес. GET-параметры можно использовать в том случае, когда информация является статичной и не меняется.

              Из чего состоят GET-параметры:

              • из домена;
              • адреса страницы;
              • самих параметров, после знака “?”.

              http: //yousite.com/page.php?»ключ=объяснение»&»ключ=объяснение»

              Давайте вернемся к первому примеру:

              http: //yousite.com/page.php?name= Иванов

              Предположим, что таких страниц может быть несколько тысяч, теперь, если мы укажем директиву Clean-param в роботсе следующим образом:

              User-agent: yandex
              Disallow:
              Clean-param: name / page.php

              Робот Яндекса сведет все страницы такого типа к одной:

              http: //yousite.com/page.php

              Это правило будет действовать для всех страниц, которые начинаются с /page.php

              При этом, если параметр указывается в нескольких урлах, например:

              http: //yousite.com/page.php?name= Иванов
              http: //yousite.com/page-2.php?name= Иванов

              Указываем в роботсе:

              User-agent: yandex
              Disallow:
              Clean-param: name / page.php
              Clean-param: name / page-2.php

              Если параметров несколько, наприме:

              http: //yousite.com/page.php?name= Иванов &surname= Иванов

              Указываем в роботсе:

              User-agent: yandex
              Disallow:
              Clean-param: name&surname / page.php

              Настройка параметров в Google:

              В Гугл есть готовый инструмент «Параметры URL» в старой версии Google Search Console.

              Какие проблемы для SEO создают параметры в URL-адресах:

              • дублирование информации;
              • расход краулингового бюджета;
              • снижают кликабельность урлов.

              Как решить проблемы с дублированием:

              • удаление параметров;
              • изменение динамических страниц параметров на статические;
              • устранение дублей путем установки rel=”canonical” на страницы с параметрами;
              • Директива noindex в мета-теге robots;
              • Директива Disallow в файле robots.txt.
              • Директива Clean-Param является межсекционной, ее можно указать в любом месте файла;
              • В префиксе можно использовать символы только A-Za-z0-9.-/*_;
              • Регистр учитывается;
              • Длина правила максимум 500 символов;
              • Если директив указано несколько, все они будут учтены роботом.

              5.7 Директива Crawl-Delay

              Если сервер не успевает обрабатывать запросы роботов – можно воспользоваться директивой Crawl-Delay.

              Пример указания директивы Crawl-Delay в файле роботс:

              User-agent: yandex
              Crawl-Deley: 1.0 # задает тайм-аут в 1 секунду

              Какие функции выполняет данная директива?

              Директива Crawl-Delay задает минимальный период времени между загрузкой страниц в секундах, таким образом сервер будет успевать “отдышаться”.

              Как правило, о сложностях сервера вы можете узнать 3-мя базовыми способами:

              • сайт периодически перестает работать;
              • с помощью вебмастера Яндекс и консоли Google;
              • вопрос о недостаточности ресурсов сервера поднимет ваш хостер или системный администратор вашего сервера.

              Перед тем, как задавать ограничения для робота в файле robots.txt, необходимо провести проверку страниц, к которым чаще всего обращаются роботы:

              • Проанализируйте логи сервера;
              • Проанализируйте какие страницы посещает робот в Яндекс.Вебмастере (Посмотрите список URL на странице Индексирование → Статистика обхода в Яндекс.Вебмастере (установите переключатель в положение Все страницы), а также в консоли Google.

              Таким образом вы сможете определить, обращается ли робот к системным/служебным файлам сайта, к которым не должен. Если вы обнаружите их – закройте их через директиву Disallow.

              – Директива Crawl-Delay для Яндекс

              Поисковая система Яндекс – поддерживает директиву Crawl-Delay, кроме робота который обходит RSS-канал для формирования турбо-страниц.

              Рекомендации и информация Яндекса:

              • Если в файле robots.txt содержатся директивы Disallow и Allow , директиву Crawl-Delay необходимо добавить после них
              • Поисковый робот Яндекса поддерживает дробные значения Crawl-delay (0.1, 0.2), при этом максимальная скорость, которую можно задать в директиве равна 0.2

              Как задать скорость обхода в Яндекс.Вебмастере:

              Перейдите в Индексирование → Скорость обхода:

              – Директива Crawl-Delay для Google

              Поисковая система Google – НЕ поддерживает директиву Crawl-Delay. Скорость обхода сайта можно задать в Google вебмастере:

              6. Как составить файл robots.txt

              Есть 2 основных способа составления файла роботс:

              6.1. Создаем файл робот вручную

              Самый простой способ – создать файл робот тхт вручную. Создаем текстовый файл TXT, это можно сделать через текстовый редактор или Notepad, TextEdit.

              • Создайте текстовый файл с названием robots.txt;
              • Заполните файл;
              • Сохраните;
              • Получаем на выходе:
              • После этого вам необходимо зайти на FTP сайта, проще всего это сделать через бесплатную программу FileZilla ;
              • Перейдите в папку public_html или www;
              • Загрузить файл;
              • Открыть его и проверить, что он доступен.

              Также загрузить файл robots txt для WordPress можно через файловый менеджер на хостинге или через плагин WP файловый менеджер .

              6.2. С помощью онлайн генератора

              Файл robots txt онлайн можно создать с помощью генератора. В интернете достаточно много сервисов, позволяющие это сделать – десятки.

              Мы собрали 5 наиболее удобных и полных генераторов файла robots txt для Google, Яндекс и других поисковых роботов. Все приведенные генераторы являются БЕСПЛАТНЫМИ.

              Сервис 1. Генератор robots txt онлайн от PR-CY

              Сервис 2. Генератор robots txt онлайн от Seolib

              Сервис 3. Генератор robots txt онлайн от Smallseotools

              Сервис 4. Генератор robots txt онлайн от Seoptimer

              Сервис 5. Генератор robots txt онлайн от Lxrmarketplace

              7. Как проверить robots.txt

              Итак, проводим анализ роботс тхт. Необходимо зайти в Google Search Console (вы должны быть авторизованы в своем аккаунте, а также вам сайт должен быть подтвержден), если ваш сайт не добавлен в вебмастер Google, воспользуйтесь инструкцией: Добавление сайта в поисковые системы: пошаговая инструкция

              Пошаговая инструкция:

              1. Зайдите в вебмастер
              2. Перейдите по ссылке в старую версию вебмастера
              3. Перейдите в раздел Сканирование – Инструмент проверки файла robots.txt
              4. Тут выполняется проверка робот, вы сможете увидеть данные по наличию ошибок:

              В Яндекс Вебмастер проверка robots.txt выполняется с помощью специальной формы, в которой можно ввести адрес сайта и получить результат проверки.

              Как это работает:
              При проверке файла роботс через Яндекс.Вебмастер все достаточно просто:

              1. Перейдите по ссылке на анализатор Яндекса:
              2. Введите адрес своего сайта
              3. Получите результаты

              Помимо этого, Яндекс дает возможность проверки списка конкретных страниц, закрыты ли они от индексации:

              8. Файл robots.txt для популярных CMS

              Рассмотрим процесс создания файла роботс для 3 популярных систем управления, в каждой из которых есть свои, пусть и небольшие особенности.

              8.1. Создание файла robots в WordPress

              Создаем robots в СMS Вордпресс, для этого сначала нужно разобраться в особенностях самой системы управления в плане управления данным файлом.

              Где находиться файл robots.txt в WordPress

              Файл робот в CMS Вордпресс создается автоматически и располагается в корневом каталоге на вашем сервере.

              К примеру, адрес вашего сайта: mysitewp.com.ua

              Файл будет доступен по ссылке: mysitewp.com.ua/robots.txt

              Что содержит стандартный файл robots.txt в WordPress:

              User-agent: *
              Disallow: /wp-admin/
              Disallow: /wp-includes/

              Базовый файл robots WordPress содержит следующие правила:

              User-agent: – определяет поисковых роботов, для которых будут действовать указанные в файле правила, где * (звездочка) означает – все поисковые боты, то есть это правило будет действовать для всех поисковиков.

              Disallow: – запрет индексирования

              В которых указаны каталоги/папки на сайте wp-admin и wp-includes , что говорит о том, владелец сайта запрещает индексировать поисковым роботам данные системные каталоги.

              Данный стандартный файл роботс тхт – это виртуальный файл, то есть вы не найдете его в корневом каталоге сайта.

              Если вам необходимо добавить свой файл robots txt для WordPress – просто загрузите новый файл в корневую директорию сайта (часто она называеться public_html или www ).

              Что обязательно нужно закрывать через robots.txt в WordPress

              Ничего. Старайтесь использовать мета-теги для запрета от индексации.

              Тем не менее, если говорить о классическом виде файла robots – двух правил стандартного файла, в большинстве случаев работы с сайтом – недостаточно, минимально необходимо добавить 2 дополнительных правила, а также ссылку на карту сайта:

              User-agent: *
              Allow: /wp-content/uploads/
              Disallow: /wp-admin/
              Disallow: /wp-includes/
              Disallow: /wp-content/plugins/
              Sitemap: https://yousite.com/sitemap.xml

              Где мы добавили:

              Аllow: – разрешает для индексирования раздел с файлами и картинками

              Disallow: для /wp-content/plugins/, что запрещает индексацию системных файлов плагинов

              А также Sitemap: ссылка на карту сайта для поисковиков (это не обязательно, при добавление карты сайта в консоль вебмастера Google, а также вебмастер Яндекса).

              Естественно, ваш файл robots txt для wordpress может выглядеть иначе, необходимо исходить из индивидуальных потребностей сайта, к примеру, если ваш сайт на этапе разработке и стоит вопрос как закрыть сайт от индексации WordPress:

              User-agent: *
              Disallow: /

              Как быстро создать файл robots txt для WordPress

              Итак, перед вами задача – настройка robots.txt в WordPress. Разберем 2 простых способа создания файла.

              Способ 1. Создаем файл robots txt для WordPress вручную

              Не останавливаемся на данном способе, он расписан выше в статье.

              Способ 2. Создаем файл robots txt для WordPress с помощью SEO плагинов

              Если стоит вопрос как изменить robots txt в WordPress – 2 наиболее популярных плагина, которые решают этот вопрос:

              Переходим в редактор:

              И сразу попадаем в область редактирования файла robots:

              С помощью этого плагина выполняется удобная настройка индексации WordPress.

              Перейти в раздел:

              Теперь вы можете настроить файл роботс вордпресс

              8.2. Создание файла robots в Битрикс

              Перейдите в Сервисы – Поисковая оптимизация – Настройка robots.txt

              Далее необходимо выбрать Общие правила для всех роботов или Яндекс, Гугл

              Нажмите на кнопку Стартовый набор справа, после чего нужно будет ввести адрес главного зеркала сайта.

              Далее Битрикс сам предложит стартовый директив:

              По ссылкам справа вы можете выбирать папки для открытия и закрытия от индексации:

              Осталось сохранить файл – все готово. Видео-инструкция по созданию файла robots в Битрикс

              8.3. Создание файла robots в Джумла

              Создайте новый файл:

              С типовым набором директив Joomla:

              User-agent: Yandex
              Disallow: /administrator/
              Disallow: /cache/
              Disallow: /includes/
              Disallow: /installation/
              Disallow: /language/
              Disallow: /libraries/
              Disallow: /modules/
              Disallow: /plugins/
              Disallow: /tmp/
              Disallow: /layouts/
              Disallow: /cli/
              Disallow: /bin/
              Disallow: /logs/
              Disallow: /components/
              Disallow: /component/
              Disallow: /component/tags*
              Disallow: /*mailto/
              Disallow: /*.pdf
              Disallow: /*%
              Disallow: /index.php
              User-agent: *
              Allow: /*.css?*$
              Allow: /*.js?*$
              Allow: /*.jpg?*$
              Allow: /*.png?*$
              Disallow: /administrator/
              Disallow: /cache/
              Disallow: /includes/
              Disallow: /installation/
              Disallow: /language/
              Disallow: /libraries/
              Disallow: /modules/
              Disallow: /plugins/
              Disallow: /tmp/
              Disallow: /layouts/
              Disallow: /cli/
              Disallow: /bin/
              Disallow: /logs/
              Disallow: /components/
              Disallow: /component/
              Disallow: /*mailto/
              Disallow: /*.pdf
              Disallow: /*%
              Disallow: /index.php
              Sitemap: https://domen.ru/sitemap.xml

              Естественно настройки файла robots необходимо адаптировать под особенности и задачи вашего сайта.

              9. Примеры файлов robots.txt известных сайтов

              Мы собрали 5 примеров настройки robots.txt популярных сайтов в Украине и в мире. Местами можно “подсмотреть” интересные решения. Так или иначе, речь идет о стандарте, который использует и сам Google.

              Еще один хороший пример файла robots в Пром.юа:
              http://prom.ua/robots.txt

              Другие интересные примеры:

              10. Важность закрытия ненужных страниц от индексации

              Простая математика. Предположим, у вас есть интернет-магазин, у которого 100 категорий, 700-800 товаров, другие страницы, около 1000 страниц.

              Если на сайте есть дубли, страницы сгенерированные CMS и тд, реальных страниц может быть и 2000 – 3000.

              Робот обращается к серверу, попадает на эти страницы и начинает их обходить. При этом он может не доходить до части нужных страниц в принципе.

              Почему нужно закрывать ненужные страницы от индексации?

              • ненужные страницы, например дубли могут индексироваться и попадать в индекс и результаты поиска;
              • неэффективно расходуется краулинговый бюджет сайта.

              Краулинговый бюджет – это определенный объем страниц, который готов просканировать робот по вашему сайту. У каждого сайта свой краулинговый бюджет.

              Если сайт небольшой, шансов получить сложности для продвижения – минимум, а вот большим сайтам нужно побеспокоиться.

              10.1. Какие страницы нужно закрывать от индексации:

              Следующие типы страниц необходимо закрывать от индексации ВСЕГДА:

              • дублированный контент (дубли страниц);
              • динамические страницы с параметрами;
              • страницы, которые на стадии разработки;
              • пустые страницы;
              • версии страниц для печати;
              • пользовательские формы (формы заказа, страница регистрации, страница авторизации, корзина и т.д.);
              • сравнения товаров;
              • личный кабинет;
              • технические страницы сайта;
              • страницы сортировки;
              • списки желаний;
              • страницы с персональными данными.

              А также страницы, которые необходимо закрывать от индексации, но не как правило (бывают случае, когда эти страницы уместно сотавить в индексе):

              • страницы пагинации;
              • страницы поиска;
              • страницы пользователей.

              10.2. Что лучше использовать robots.txt или meta noindex

              Для Яндекса файл robots.txt – обязательная директива, для Google – рекомендация. К тому же, робот может обращаться к файлу robots не при каждом обращение к серверу.

              По возможности – удалите ненужные страницы. Если это невозможно с технической точки зрения – установите мета-тег

              Если речь идет о дублированном контенте, вы также можете установить тег rel=”canonical” на страницы дубли, с указанием ссылки на основную страницу.

              Также вы можете воспользоваться тегом X-ROBOTS

              Если данные решения невозможно внедрить с технической точки зрения – используйте директиву Disallow в файле роботс.

              Так все же все таки разница?

              Директива Disallow в файле роботс. Файл robots.txt указывает поисковым системам не сканировать определенный URL на веб-сайте, другими словами НЕ смотреть, но если они знают об этой странице – она будет проиндексирована. Т.е. знают? К примеру вы прописали в роботсе запрет на индексацию конкретного урла, НО робот:

              • мог сканировать ее ранее, а теперь вы сказали не сканировать;
              • на этот урл могут вести ссылки с вашего сайта или других сайтов.

              Другими словами – робот знает знает. Что бывает в таком случае, когда робот знает о странице, а вы говорите сканировать нельзя:

              Поэтому иногда гугл может оставлять страницы в индексе даже после запрета ее сканирования через роботс.

              Мета тег ноуиндекс. Мета-тег означает для робота, который обращается к этой странице “Не индексируй меня”, т.е. робот может сканировать этот адрес, но не может его проиндексировать.

              10.3. Для чего robots.txt НЕ нужно использовать

              В каких случаях и какие страницы закрывать через роботс не правильно :

              1. Для запрета страниц страниц пагинации
                Как правильно: используйте rel=canonical.
              2. Для запрета страниц сортировки
                Как правильно: установите мета-тег robots noindex или используйте x-robots
              3. Для запрета страниц-дублей (дублированного контента)
                Как правильно: удалите дубли (404 ответ), установите мета-тег robots noindex или используйте x-robots
              4. Для удаления страниц из индекса
                Как правильно: установите мета-тег robots noindex или используйте x-robots
              5. Для запрета страниц, которые вы не хотите индексировать
                Как правильно: установите мета-тег robots noindex или используйте x-robots

              11. Заключение

              Разобрались зачем нужен файл роботс? Подытожим.

              Файл роботс – инструмент управления индексацией сайта для вебмастера, SEO-специалиста и владельца сайта.

              Проверка и настройка данного системного файла всегда в первых рядах чек-листа любого сеошника или агентства.

              Неиспользование данного инструмента может создавать серьезные сложности для продвижения проекта, а также сервера, на котором расположен сайт.

              Поэтому, убедитесь, что у вас на сайте правильный роботс тхт. Не уверены – отправляйте сам к нам на аудит .

              Как закрыть сайт от индексации в robots.txt

              Как закрыть сайт от индексации для Яндекса, Google и других поисковых систем в robots.txt: пошаговая инструкция с примерами. Как создать файл самостоятельно. Какие данные нужно скрывать. Как проверить, корректно ли работает запрет. Как избежать ошибок.

              В статье о том, зачем и как закрыть сайт от индексации в robots.txt, что можно скрыть и как проверить, что вы всё сделали правильно.

              Эта статья — часть нашего бесплатного курса по SEO для начинающих, с ней помогал главный эксперт курса Александр Сопоев. Если хотите разобраться, как продвигать сайты в ТОП поисковых систем, заходите на курс. В конце — сертификат от Топвизора!

              Зачем закрывать сайт от индексации

              Когда поисковые роботы просканировали и проиндексировали страницы сайта, они начинают показываться в поисковых системах. Это значит, что пользователи могут находить сайт по конкретным поисковым запросам в Google, Яндексе и других поисковых системах.

              При этом сайт может состоять из множества разных страниц, и некоторые из них пользователям и поисковым системам видеть не нужно. Например, служебные страницы, дубли страниц и другой малополезный контент. Страницы с таким контентом поисковые системы могут и сами «выбрасывать» из индекса или понижать их позиции, но тогда это может отразиться на ранжировании всего сайта.

              Кроме того, стоит учитывать и краулинговый бюджет сайта — лимит на количество страниц сайта, которые поисковые роботы смогут обойти за сутки. И этот лимит может тратиться на неважные страницы сайта, в то время как важные целевые страницы могут долго быть непроиндексированными. Подробнее об этом мы писали в статье «Как оптимизировать краулинговый бюджет» .

              Что можно закрыть от индексации

              Дубль

              Это страницы сайта, которые отличаются URL‑адресом, но содержат одинаковый или практически одинаковый контент. Дубли могут привести к таким последствиям, как:

              • снижение скорости индексирования новых страниц. Индексирующий робот может медленнее доходить до новых страниц, из‑за того что будет обходить дубли;
              • поисковая система «склеит» дубли и сама выберет среди них основную страницу. При этом есть риск, что эта выбранная страница не будет вашей целевой;
              • в индексе останутся все дубли. Тогда все они могут конкурировать между собой, «моргать» в выдаче и т. д. Это может влиять на положение сайта в поиске.

              Документ для скачивания

              В некоторых случаях может быть нужно закрыть от индексации документы, например в формате pdf, docx и т. п. С помощью robots.txt это можно сделать.

              С одной стороны, когда документы можно скачать из выдачи, не переходя на сайт, это может приводить к потере трафика, с другой стороны, может, наоборот, положительно повлиять на посещаемость сайта. Исходите из стратегии и пользы для вашего проекта.

              Страницы, которые находятся в разработке

              Если на странице нет контента или есть, но он дублирует другую страницу, если на странице идёт редизайн или доработка и мы пока не хотим её выкатывать и в других подобных случаях можно запретить её индексацию.

              Если оставить такие страницы доступными для индексации, то ПС может сама понизить или исключить их из индекса, что может сказаться на оценке сайта в целом.

              Техническая страница

              Все служебные, технические страницы не содержат полезного контента для пользователей или вовсе могут быть пустыми. Поэтому их стоит закрыть от индексации.

              Такими страницами, в зависимости от конкретного сайта и особенностей проекта, могут быть: страницы регистрации, авторизации, результаты поиска по страницам сайта, Личный кабинет, Корзина, Избранное и т. д.

              Папка

              Файлы сайта обычно распределяются по папкам, например по категориям, каталогам, разделам, подразделам и т. д. Если какой‑то раздел на сайте устарел целиком, то можно скрыть от индексации всю папку, а не только отдельные страницы.

              Картинка

              Помимо закрытия страниц сайта, можно также закрыть от индексации отдельный тип контента, например все картинки определённого формата или фотографии.

              Если вы размещаете информативные и полезные изображения, закрывать их от индексации нежелательно.

              Ссылка

              С помощью robots.txt мы не можем запретить индексацию одной ссылки. Чтобы робот не переходил по ссылкам на странице, мы можем закрыть от индексации страницу, на которой размещена ссылка, или страницу, на которую она ведёт.

              Чтобы скрыть от индексирования конкретную ссылку, Яндекс рекомендует использовать атрибут rel .

              Блок на сайте

              Мы не можем закрывать в robots.txt отдельные блоки на странице.

              Запретить индексирование части текста в Яндексе можно с помощью тега noindex , но Google данный тег не поддерживает.

              Как запретить индексацию в robots.txt

              Файл robots.txt — это текстовый документ формата .txt, в котором прописаны специальные правила (директивы) для поисковых роботов. Они помогают управлять индексацией сайта.

              С помощью этих правил можно указать поисковым роботам, какие страницы и файлы сайта не должны присутствовать в поисковой выдаче, а какие, наоборот, должны.

              В файле robots.txt можно:

              • разрешить или запретить индексацию страниц или разделов сайта;
              • указать ссылку на карту сайта Sitemap.xml;
              • заблокировать показ изображений, видеороликов и аудиофайлов в результатах поиска.

              В robots.txt мы обычно закрываем страницы массово: весь каталог, конкретные типы страниц, страницы или файлы с определёнными характеристиками.

              Если у сайта есть robots.txt, то обычно он хранится он в корневой папке сайта — там, куда загружаются каталоги и другие файлы.

              Кроме того, на некоторых сайтах robots.txt можно найти по ссылке site.ru/robots.txt, где site.ru — это ваш сайт. Например, https://topvisor.com/robots.txt.

              Если файла нет, значит, скорее всего, сейчас для индексации доступны все страницы сайта и у поисковых роботов нет специальных указаний.

              Поэтому файл нужно создать самостоятельно. Сделать это можно в Блокноте или другом текстовом редакторе. В файле нужно прописать специальные директивы, о которых расскажем ниже.

              После этого сохраняем документ в формате .txt с названием robots и загружаем в корневую папку сайта.

              Основные директивы robots.txt

              • User‑Agent — обязательная директива, которая говорит, какому именно поисковому роботу адресуются указанные ниже правила. В документе эта директива может повторяться несколько раз — с неё начинается каждая новая группа правил для конкретного бота.

              В файле эта строка будет выглядеть так:

              User‑agent:

              После двоеточия мы прописываем название бота, к которому будут обращены последующие правила.

              Чаще всего используем такие:

              • * — когда обращаемся ко всем поисковым роботам;
              • Googlebot — когда обращаемся к роботам Google;
              • Yandex — когда обращаемся к роботам Яндекса.

              Записи в файле будут выглядеть так:

              User‑agent: * или: User‑agent: Yandex или: User‑agent: Googlebot

              Перед каждой новой директивой User‑agent, которую вы прописываете в документе, необходимо ставить дополнительный пропуск строки.

              Например, если бы нам нужно было закрыть весь сайт от индексации для Яндекса и Google, мы бы написали так:

              User‑agent: Googlebot Disallow: / User‑agent: Yandex Disallow: /
              • Disallow — этой директивой мы можем запретить роботу индексировать определённые разделы сайта, страницы или файлы. Здесь могут закрываться от индексации, например:
                • технические страницы: страницы регистрации, авторизации и др., у интернет‑магазинов это могут быть страницы «Корзина», «Избранное» и др.;
                • страницы сортировок, которые изменяют вид отображения информации;
                • страницы внутреннего поиска и т. д.

                Правила указания директивы такие:

                1. Сначала указываем саму директиву и двоеточие. Например: Disallow:
                2. После этого указываем раздел или страницу в корневой папке текущего сайта без указания самого домена. Например: /ru/marketing/.

                Если правило касается страницы, ставим полный относительный адрес. В начале должен идти знак «/». Например, /ru/marketing/57‑free‑seo‑tools.

                Если закрываем весь каталог, то в конце строки должен стоять слеш «/».

                Например, чтобы запретить роботам Яндекса индексацию всего раздела «Маркетинг» в Топвизор‑Журнале , мы бы написали в robots.txt так:

                User‑agent: Yandex Disallow: /ru/marketing/
                • Allow — директива указывает поисковому роботу, какие разделы сайта можно индексировать. Обычно используется для указания подправила директивы Disallow, например, когда мы хотим разрешить сканирование какой‑то страницы или каталога внутри закрытого директивой Disallow раздела.
                User‑agent: Yandex Disallow: /catalog/ Allow: /catalog/auto/ # запрещает скачивать страницы, начинающиеся с '/catalog/', # но разрешает скачивать страницы, начинающиеся с '/catalog/auto/'

                Если в документе одновременно указаны директивы Allow и Disallow для одного и того же элемента, то предпочтение отдаётся директиве Allow — элемент будет проиндексирован.

                Дополнительно

                При указании пути к разделу, странице или файлам может использоваться спецсимвол «*».

                Он означает любую (в том числе пустую) последовательность символов. Может ставиться как префикс в начале адреса или как суффикс в конце.

                Disallow: /catalog/*/shopinfo — запрещает индексацию любых страниц в разделе catalog, в URL которых есть shopinfo.

                Disallow: *shopinfo — запрещает индексацию всех страниц, содержащих в URL “shopinfo”, например: /ru/marketing/shopinfo.

                Спецсимволы работают в том числе и с директивой Allow.

                • Sitemap — в robots.txt мы можем указать путь к карте сайта (Sitemap.xml) и таким образом помочь поисковому роботу просканировать страницы сайта.

                Путь указывается через директиву Sitemap, а сам путь должен быть полным, с указанием домена, как в браузере:

                Sitemap: https://site.com/sitemaps1.xml

                Если карт сайта несколько, директиву можно повторять несколько раз с новой строки.

                Директива считается межсекционной: поисковые роботы увидят путь к карте сайта вне зависимости от места в файле robots.txt, где он указан.

                • Clean‑param для Яндекса — директива позволяет запретить поисковым роботам индексировать страницы с динамическими параметрами, например с GET‑параметрами или UTM‑метками и т. д.

                Яндекс предупреждает, что если не закрыть страницы с параметрами через Clean‑param, то в поиске могут появиться многочисленные дубли страниц, что может негативно отразиться на ранжировании.

                Синтаксис и правила оформления:

                • файл должен называться robots.txt;
                • размер файла не больше 500 КБ;
                • на сайте должен быть только один такой файл;
                • файл размещён в корневом каталоге сайта, но не в подкаталоге. Нужно вот так: https://www.example.com/robots.txt , а так нельзя: https://example.com/pages/robots.txt ;
                • файл отдаёт ответ сервера 200 OK.

                Дополнительно про файл robots.txt:

                • есть директивы, которые одни ПС воспринимают, а другие нет. Например, Clean‑param для Яндекса;
                • те страницы, которые вы запретили в файле, всё равно могут быть проиндексированы. Например, Google говорит, что страницы могут попасть в индекс, если поисковый робот нашёл их по ссылке с других сайтов или страниц. Чтобы полностью скрыть информацию от краулеров, стоит использовать другие способы, например метатег robots и HTTP‑заголовок X‑Robots‑Tag и др.

                Как проверить запрет

                После создания из загрузки файла на сайт убедитесь, что он существует, размещён в корневом каталоге сайта и без проблем открывается. Для проверки введите в строку браузера адрес сайта с указанием файла в формате https://site.ru/robots.txt.

                После этого можно проверить файл в панелях веб‑мастеров Яндекс.Вебмастер и Google Search Console.

                Яндекс.Вебмастер

                В Вебмастере открываем «Инструменты» → «Анализ robots.txt». Обычно содержимое файла сразу будет отображаться в строке. Если нет, копируем из браузера и вставляем сюда. Затем нажимаем кнопку «Проверить»:

                Проверка файла в Вебмастере

                Если в файле будут ошибки, Вебмастер подскажет, как их исправить.

                Google Search Console

                Для того чтобы проверить файл robots.txt с помощью валидатора Google, необходимо:

                1. Зайти в аккаунт Google Search Console.

                3. В открывшемся окне вы увидите уже подгруженную информацию из файла. Если нет, вставьте её из браузера.

                GSC покажет, есть ли в файле ошибки и как их исправить.

                Проверка файла в GSC

                Краткий конспект

                На сайте может быть необходимо скрыть некоторые страницы, например:

                • служебные страницы или дубли;
                • неважные, неактуальные или малополезные страницы.

                Закрывать от индексации можно как сайт полностью, так и отдельные страницы, файлы, изображения.

                В robots.txt с помощью специальных директив мы обычно закрываем страницы массово: весь каталог, конкретные типы страниц, страницы или файлы с определёнными характеристиками.

                После создания правил для индексирования сайта в robots.txt важно его проверить. Сделать это можно бесплатно в панелях веб‑мастеров Яндекс.Вебмастер и Google Search Console.

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *