1. Главная
  2. /
  3. Блог

Robots.txt: что это такое, как создать и правильно настроить файл в 2026 году

Александр Каширин

Загрузка рейтинга…
Просмотры: …

August 19, 2026

Файл robots.txt — один из базовых инструментов технического SEO. Он сообщает поисковым роботам, какие URL сайта можно сканировать, а какие лучше не обходить. Ошибка всего в одной строке способна закрыть от роботов важный раздел, а правильно настроенный файл помогает не тратить ресурсы сканирования на корзину, служебные страницы, внутренний поиск и другие URL, которые не должны активно обходиться поисковыми системами.

В этом руководстве разберём robots.txt простыми словами: где он находится, как работает, какие директивы понимают Яндекс и Google, как проверить файл и какие ошибки чаще всего мешают нормальной индексации сайта.

Важно: robots.txt управляет сканированием, но сам по себе не является надёжным способом удалить страницу из поисковой выдачи. Для запрета индексации обычно используют noindex, HTTP-заголовок X-Robots-Tag, авторизацию или другие подходящие методы.

Содержание:

Что такое robots.txt и как его настроить

Что такое robots.txt

robots.txt — обычный текстовый файл в корне сайта. Поисковый робот запрашивает его перед обходом URL и проверяет, есть ли для его User-agent ограничения или разрешения.

Например, файл может содержать:

User-agent: *
Disallow: /admin/
Disallow: /search/
Sitemap: https://example.ru/sitemap.xml

Такой вариант сообщает роботам, что служебные разделы /admin/ и /search/ обходить не нужно, а карта сайта находится по указанному адресу.

По умолчанию, если корректного запрета нет, роботы считают URL доступными для сканирования. Поэтому создавать длинный robots.txt со множеством разрешающих правил только ради самого факта наличия файла не требуется.

Зачем нужен robots.txt

Главная задача robots.txt — управление обходом сайта поисковыми роботами.

На большом сайте могут существовать тысячи технических URL:

  • корзина и оформление заказа;
  • страницы внутреннего поиска;
  • административные разделы;
  • фильтры и параметры;
  • временные служебные URL;
  • некоторые дубли;
  • технические файлы или каталоги, которые роботам не нужны.

Если поисковый робот постоянно тратит время на такие адреса, полезные страницы могут обходиться менее эффективно. Особенно это заметно на больших интернет-магазинах, каталогах и проектах с большим количеством параметрических URL.

Это связано с понятием краулингового бюджета — объёмом ресурсов, которые поисковая система готова тратить на обход сайта.

При этом нельзя превращать robots.txt в универсальное средство от всех SEO-проблем. Дубли часто лучше решать каноникализацией, редиректами и корректной архитектурой сайта. Подробнее об этом читайте в материале про rel=canonical.

Где находится файл robots.txt

Файл должен располагаться в корневом каталоге конкретного хоста и быть доступен по адресу:

https://example.ru/robots.txt

Неправильные варианты:

https://example.ru/files/robots.txt
https://example.ru/seo/robots.txt

Для разных поддоменов правила задаются отдельно. Например:

https://example.ru/robots.txt
https://shop.example.ru/robots.txt

— это два разных файла для двух разных хостов.

Для нормальной обработки robots.txt должен быть доступен поисковому роботу. Для Яндекса важно, чтобы корректный файл был доступен из корня сайта и сервер возвращал подходящий ответ; Яндекс также умеет учитывать редирект с одного robots.txt на другой robots.txt при переезде сайта.

Как работает robots.txt

Схема упрощённо выглядит так:

Поисковый робот
      ↓
запрашивает /robots.txt
      ↓
определяет свою группу User-agent
      ↓
сравнивает URL с Allow / Disallow
      ↓
решает, можно ли сканировать URL

Важно различать два процесса:

  1. Сканирование (crawling) — робот загружает URL и его содержимое.
  2. Индексация (indexing) — поисковая система решает, добавлять ли информацию о странице в поисковый индекс.

Robots.txt в первую очередь управляет первым процессом. Страница, закрытая через Disallow, в некоторых ситуациях всё равно может быть известна поисковой системе по внешним или внутренним ссылкам.

Если хотите глубже разобраться в механике поисковых систем, посмотрите термин индекс поисковой системы.

Основные директивы robots.txt

User-agent

User-agent определяет робота, для которого действуют следующие правила.

Для всех роботов:

User-agent: *

Для Googlebot:

User-agent: Googlebot

Для основного робота Яндекса:

User-agent: Yandex

Если вам не нужны разные правила для разных поисковых систем, чаще всего достаточно общей группы User-agent: *.

Disallow

Disallow запрещает роботу сканировать указанный путь.

Например:

User-agent: *
Disallow: /admin/

Запрет нескольких разделов:

User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /search/

Будьте осторожны с самым опасным вариантом:

User-agent: *
Disallow: /

Он закрывает от сканирования весь сайт для указанной группы роботов.

Если после изменения robots.txt резко пропали страницы из поиска или прекратился их обход, сначала проверьте именно Disallow. Подробный разбор таких ситуаций есть в статье Ошибки robots.txt: что проверить и как исправить.

Allow

Allow позволяет открыть более конкретный путь внутри закрытого раздела.

Пример:

User-agent: *
Disallow: /private/
Allow: /private/public-page/

Такая схема полезна, когда весь каталог закрыт, но отдельный URL или подкаталог должен оставаться доступным для роботов.

Sitemap

Директива Sitemap указывает поисковому роботу местоположение XML-карты сайта:

Sitemap: https://example.ru/sitemap.xml

Если карт несколько, можно перечислить несколько строк:

Sitemap: https://example.ru/sitemap-posts.xml
Sitemap: https://example.ru/sitemap-products.xml

Карта сайта не заменяет хорошую внутреннюю перелинковку, но помогает поисковой системе обнаруживать важные URL. Подробнее: что такое Sitemap.

Clean-param для Яндекса

Яндекс поддерживает директиву Clean-param, которая помогает сообщить роботу, что определённые параметры URL не меняют содержимое страницы и их можно не учитывать при индексировании.

Пример:

User-agent: Yandex
Clean-param: utm_source&utm_medium&utm_campaign /

Использовать Clean-param нужно осознанно. Если параметр реально изменяет содержимое страницы, неправильная настройка может привести к нежелательному объединению URL.

Для большинства небольших сайтов эта директива не обязательна. Она особенно полезна на проектах с большим количеством параметров и дублей.

Какие директивы не стоит использовать

В старых статьях о robots.txt до сих пор встречаются директивы, которые сегодня либо не поддерживаются отдельными поисковиками, либо не должны использоваться как универсальное решение.

Noindex внутри robots.txt

Так делать не нужно:

Noindex: /private/

Google не поддерживает noindex в robots.txt. Чтобы убрать HTML-страницу из поиска, используется метатег:

<meta name="robots" content="noindex">

или HTTP-заголовок X-Robots-Tag.

Критически важно: если страница одновременно закрыта в robots.txt, робот может не открыть её и не увидеть noindex. Поэтому сначала определите, чего вы хотите добиться — запретить обход или исключить страницу из индекса.

Подробнее о метатегах: Что такое метатеги и как они влияют на SEO.

Crawl-delay

Не следует рассчитывать на Crawl-delay как на универсальную директиву. Например, Google её не поддерживает. Если сервер не справляется с нагрузкой поисковых роботов, проблему лучше решать на уровне производительности сайта, сервера и инструментов конкретной поисковой системы.

Host

В старых руководствах часто встречается:

Host: example.ru

Не стоит использовать Host как основной современный способ выбора главного зеркала. Каноническую версию домена лучше закреплять корректными 301-редиректами, едиными внутренними ссылками, canonical и настройками поисковых систем.

Как настроить robots.txt для Яндекса

Для большинства сайтов нет необходимости создавать огромный отдельный блок специально для Яндекса. Можно начать с общего набора правил:

User-agent: *
Disallow: /admin/
Disallow: /search/
Sitemap: https://example.ru/sitemap.xml

Если Яндексу нужны отдельные инструкции, создайте отдельную группу:

User-agent: Yandex
Disallow: /service/
Clean-param: utm_source&utm_medium /

User-agent: *
Disallow: /service/

Sitemap: https://example.ru/sitemap.xml

При настройке под Яндекс обратите внимание на несколько вещей:

  • файл должен находиться по адресу /robots.txt;
  • проверяйте файл через инструмент анализа robots.txt в Яндекс.Вебмастере;
  • не закрывайте страницу через robots.txt, если хотите, чтобы робот увидел на ней noindex;
  • используйте Sitemap, чтобы сообщить поисковику об XML-карте;
  • для параметрических дублей при необходимости рассмотрите Clean-param;
  • учитывайте регистр символов в путях URL.

После изменения правил проверьте несколько реальных URL в анализаторе: важную страницу, технический URL и страницу, которую вы намеренно закрыли.

Как настроить robots.txt для Google

Google использует стандарт Robots Exclusion Protocol и поддерживает базовые правила User-agent, Allow и Disallow, а также обнаруживает Sitemap.

Простой пример:

User-agent: Googlebot
Disallow: /admin/
Disallow: /search/

User-agent: *
Allow: /

Sitemap: https://example.ru/sitemap.xml

Но отдельная группа для Googlebot нужна только тогда, когда правила действительно отличаются. В остальных случаях проще и безопаснее поддерживать единый понятный набор правил.

После публикации Google сам обнаруживает обновления robots.txt. Проверить доступность и проблемы файла можно через отчёты Google Search Console.

Не используйте robots.txt, чтобы скрывать конфиденциальную информацию. Если URL должен быть недоступен посторонним, используйте авторизацию или защиту на сервере.

Готовые примеры robots.txt

Ниже — не универсальные файлы для копирования, а отправные точки. Перед использованием сравните пути со структурой своего сайта.

Простой корпоративный сайт

User-agent: *
Disallow: /admin/
Disallow: /search/

Sitemap: https://example.ru/sitemap.xml

Блог

User-agent: *
Disallow: /admin/
Disallow: /search/

Sitemap: https://example.ru/sitemap.xml

Для блога обычно не нужно закрывать изображения, CSS и JavaScript. Роботам важно видеть страницу максимально близко к тому, как её получает пользователь.

Интернет-магазин

User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /search/

Sitemap: https://shop.example.ru/sitemap.xml

У интернет-магазина часто есть фильтры, сортировки и параметры. Но закрывать их массово без анализа нельзя: часть фильтров может иметь самостоятельный поисковый спрос и приносить органический трафик.

Полностью открыть сайт

User-agent: *
Allow: /

Sitemap: https://example.ru/sitemap.xml

Allow: / обычно можно не писать — при отсутствии запрещающих правил сайт и так открыт для обхода.

Закрыть весь тестовый сайт

User-agent: *
Disallow: /

Для staging-версии надёжнее дополнительно использовать авторизацию. Один robots.txt не является механизмом безопасности и не защищает данные от недобросовестных ботов.

Как проверить robots.txt

После любой правки недостаточно просто открыть файл глазами.

1. Откройте файл в браузере

Перейдите по адресу:

https://ваш-сайт.ru/robots.txt

Убедитесь, что файл загружается и содержит именно ту версию, которую вы редактировали.

2. Проверьте Яндекс.Вебмастер

В Яндекс.Вебмастере используйте инструмент анализа robots.txt. Он позволяет проверить синтаксис и узнать, разрешён ли обход конкретного URL.

Минимальный набор тестов:

  • главная страница;
  • важная коммерческая страница;
  • статья блога;
  • URL из закрытого каталога;
  • техническая страница.

3. Проверьте Google Search Console

В Google Search Console можно отслеживать проблемы robots.txt и проверять отдельные URL через инструменты проверки страниц.

4. Проведите технический краулинг

На больших проектах полезно дополнительно использовать Screaming Frog или аналогичный краулер. Он помогает выявить страницы и ресурсы, которые оказались заблокированы неожиданно.

Если сайт потерял позиции или трафик после технических изменений, robots.txt должен входить в первый набор проверок. Смотрите также Почему упал трафик сайта.

Типичные ошибки robots.txt

Ошибка 1. Закрыт весь сайт

User-agent: *
Disallow: /

Такое правило иногда остаётся после переноса сайта с тестового сервера на production.

Ошибка 2. Закрыты CSS и JavaScript

Если поисковый робот не может загрузить важные ресурсы страницы, ему сложнее корректно отрендерить и оценить её. Не блокируйте стили и скрипты просто «для экономии краулингового бюджета».

Ошибка 3. Robots.txt используют вместо noindex

Disallow и noindex решают разные задачи. Запрет сканирования не гарантирует исключение URL из поиска.

Ошибка 4. Закрыты полезные страницы фильтрации

На интернет-магазинах некоторые фильтры имеют поисковый спрос. Массовый запрет всех параметрических URL может уничтожить полезные посадочные страницы.

Ошибка 5. Не указан Sitemap

Это не делает robots.txt неправильным, но ссылка на актуальную XML-карту помогает поисковым системам обнаруживать структуру сайта.

Ошибка 6. Правила не соответствуют реальной структуре URL

Например:

Disallow: /Catalog/

не обязательно будет эквивалентно:

Disallow: /catalog/

Регистр и конкретный путь имеют значение.

Ошибка 7. Файл редактируют без проверки

Одна лишняя косая черта или слишком широкое правило способно затронуть тысячи URL. После каждой правки тестируйте не только синтаксис, но и конкретные адреса.

Полный список практических проблем вынесен в отдельный материал: Правильная настройка robots.txt: ошибки, которых следует избегать.

Robots.txt и индексация: в чём разница

Это один из самых важных моментов.

Представим, что существует URL:

https://example.ru/private-page/

И он закрыт:

User-agent: *
Disallow: /private-page/

Поисковый робот получает инструкцию не сканировать страницу. Но поисковая система может узнать о самом URL из ссылок.

Если ваша цель — не показывать страницу в поиске, обычно правильнее разрешить роботу открыть её и прочитать:

<meta name="robots" content="noindex">

После того как поисковая система обработает noindex, страницу можно исключить из результатов.

Если же URL содержит конфиденциальные данные, noindex тоже недостаточно: пользователь всё равно сможет открыть страницу напрямую. Здесь нужна авторизация или серверное ограничение доступа.

Таким образом:

Задача Что использовать
Снизить нежелательный обход robots.txt
Убрать HTML-страницу из поиска noindex
Объединить дубли canonical / редирект
Защитить приватную информацию авторизация
Помочь найти важные страницы Sitemap + внутренняя перелинковка

Чек-лист правильной настройки robots.txt

Перед публикацией проверьте:

  • файл доступен по /robots.txt;
  • важные страницы не закрыты Disallow;
  • CSS и JavaScript не блокируются без необходимости;
  • Sitemap указан правильным абсолютным URL;
  • нет случайного Disallow: /;
  • правила проверены для Яндекса;
  • правила проверены для Google;
  • noindex не используется внутри robots.txt;
  • для поддоменов проверены отдельные robots.txt;
  • после изменений протестированы реальные URL;
  • технические параметры и фильтры закрываются только после анализа;
  • приватные данные защищены не только robots.txt.

Если большая часть пунктов вызывает вопросы, стоит провести технический SEO-аудит или полноценный SEO-аудит сайта.

Часто задаваемые вопросы о robots.txt

Что такое robots.txt простыми словами?

Это текстовый файл с правилами для поисковых роботов. Он показывает, какие адреса сайта робот может сканировать, а какие ему обходить не следует.

Обязательно ли создавать robots.txt?

Не всегда. Если специальных ограничений нет, отсутствие файла само по себе не означает, что сайт будет закрыт для роботов. Но на реальных проектах robots.txt удобен для управления служебными разделами и указания Sitemap.

Где должен находиться robots.txt?

В корне каждого хоста:

https://example.ru/robots.txt

Как проверить robots.txt в Яндексе?

Добавьте сайт в Яндекс.Вебмастер, подтвердите права и воспользуйтесь инструментом анализа robots.txt. Проверяйте не только наличие ошибок, но и доступность конкретных URL.

Как проверить robots.txt в Google?

Убедитесь, что файл доступен в браузере, а затем используйте отчёты и проверку URL в Google Search Console.

Можно ли через robots.txt убрать страницу из Google?

Не следует использовать robots.txt для этой задачи. Для запрета индексирования HTML-страницы Google рекомендует noindex, при этом робот должен иметь возможность загрузить страницу и увидеть эту директиву.

Можно ли закрывать изображения?

Технически можно ограничить их сканирование, но делать это без причины не стоит. Если вам нужен трафик из поиска по изображениям, они должны оставаться доступными соответствующим роботам.

Нужно ли писать Crawl-delay?

Как универсальное решение — нет. Google эту директиву не поддерживает. Управление нагрузкой лучше решать с учётом конкретного поисковика и производительности сервера.

Нужна ли директива Host в 2026 году?

Не стоит строить настройку основного зеркала вокруг Host. Используйте корректные 301-редиректы, canonical, единые внутренние URL и инструменты поисковых систем.

Что делать после изменения robots.txt?

Проверьте файл в Яндекс.Вебмастере и Google Search Console, протестируйте важные URL и следите за индексацией. На больших сайтах дополнительно проведите краулинг.


Вывод

Robots.txt — небольшой файл с очень большим влиянием на техническое состояние сайта. Его задача — управлять сканированием URL, а не заменять noindex, canonical, редиректы или защиту приватных данных.

Хороший robots.txt обычно прост: в нём нет десятков случайных правил, каждое ограничение понятно, Sitemap указан корректно, а изменения обязательно проверяются на реальных URL.

Если вы настраиваете файл впервые, начните с минимального набора правил и постепенно добавляйте ограничения только там, где понимаете их цель. А если сайт уже столкнулся с проблемами индексации, дополнительно проверьте распространённые ошибки robots.txt и техническое состояние проекта в целом.

SEO-словарь

Короткие объяснения понятий, которые встречаются в этой статье.


Хотите получить предварительную оценку сайта?

Отправьте адрес сайта — ведущий SEO-специалист проведёт бесплатный предварительный разбор и свяжется с вами, чтобы обсудить основные точки роста, подходящий формат продвижения и ориентировочный бюджет. Это первичное знакомство с проектом, а не большой документ. Полноценный SEO-аудит с подробной диагностикой можно заказать отдельно.

Каширин Александр Васильевич - СЕО раскрутка сайтов. Основатель бренда KashirinWeb (КаширинВеб)

Каширин Александр

Руководитель SEO и SEM агентства