Robots.txt: что это такое, как создать и правильно настроить файл в 2026 году
Александр Каширин
August 19, 2026
Файл robots.txt — один из базовых инструментов технического SEO. Он сообщает поисковым роботам, какие URL сайта можно сканировать, а какие лучше не обходить. Ошибка всего в одной строке способна закрыть от роботов важный раздел, а правильно настроенный файл помогает не тратить ресурсы сканирования на корзину, служебные страницы, внутренний поиск и другие URL, которые не должны активно обходиться поисковыми системами.
В этом руководстве разберём robots.txt простыми словами: где он находится, как работает, какие директивы понимают Яндекс и Google, как проверить файл и какие ошибки чаще всего мешают нормальной индексации сайта.
Важно: robots.txt управляет сканированием, но сам по себе не является надёжным способом удалить страницу из поисковой выдачи. Для запрета индексации обычно используют
noindex, HTTP-заголовокX-Robots-Tag, авторизацию или другие подходящие методы.
Содержание:
- Что такое robots.txt
- Зачем нужен robots.txt
- Где находится файл robots.txt
- Как работает robots.txt
- Основные директивы robots.txt
Что такое robots.txt
robots.txt — обычный текстовый файл в корне сайта. Поисковый робот запрашивает его перед обходом URL и проверяет, есть ли для его User-agent ограничения или разрешения.
Например, файл может содержать:
User-agent: *
Disallow: /admin/
Disallow: /search/
Sitemap: https://example.ru/sitemap.xmlТакой вариант сообщает роботам, что служебные разделы /admin/ и /search/ обходить не нужно, а карта сайта находится по указанному адресу.
По умолчанию, если корректного запрета нет, роботы считают URL доступными для сканирования. Поэтому создавать длинный robots.txt со множеством разрешающих правил только ради самого факта наличия файла не требуется.
Зачем нужен robots.txt
Главная задача robots.txt — управление обходом сайта поисковыми роботами.
На большом сайте могут существовать тысячи технических URL:
- корзина и оформление заказа;
- страницы внутреннего поиска;
- административные разделы;
- фильтры и параметры;
- временные служебные URL;
- некоторые дубли;
- технические файлы или каталоги, которые роботам не нужны.
Если поисковый робот постоянно тратит время на такие адреса, полезные страницы могут обходиться менее эффективно. Особенно это заметно на больших интернет-магазинах, каталогах и проектах с большим количеством параметрических URL.
Это связано с понятием краулингового бюджета — объёмом ресурсов, которые поисковая система готова тратить на обход сайта.
При этом нельзя превращать robots.txt в универсальное средство от всех SEO-проблем. Дубли часто лучше решать каноникализацией, редиректами и корректной архитектурой сайта. Подробнее об этом читайте в материале про rel=canonical.
Где находится файл robots.txt
Файл должен располагаться в корневом каталоге конкретного хоста и быть доступен по адресу:
https://example.ru/robots.txtНеправильные варианты:
https://example.ru/files/robots.txt
https://example.ru/seo/robots.txtДля разных поддоменов правила задаются отдельно. Например:
https://example.ru/robots.txt
https://shop.example.ru/robots.txt— это два разных файла для двух разных хостов.
Для нормальной обработки robots.txt должен быть доступен поисковому роботу. Для Яндекса важно, чтобы корректный файл был доступен из корня сайта и сервер возвращал подходящий ответ; Яндекс также умеет учитывать редирект с одного robots.txt на другой robots.txt при переезде сайта.
Как работает robots.txt
Схема упрощённо выглядит так:
Поисковый робот
↓
запрашивает /robots.txt
↓
определяет свою группу User-agent
↓
сравнивает URL с Allow / Disallow
↓
решает, можно ли сканировать URLВажно различать два процесса:
- Сканирование (crawling) — робот загружает URL и его содержимое.
- Индексация (indexing) — поисковая система решает, добавлять ли информацию о странице в поисковый индекс.
Robots.txt в первую очередь управляет первым процессом. Страница, закрытая через Disallow, в некоторых ситуациях всё равно может быть известна поисковой системе по внешним или внутренним ссылкам.
Если хотите глубже разобраться в механике поисковых систем, посмотрите термин индекс поисковой системы.
Основные директивы robots.txt
User-agent
User-agent определяет робота, для которого действуют следующие правила.
Для всех роботов:
User-agent: *Для Googlebot:
User-agent: GooglebotДля основного робота Яндекса:
User-agent: YandexЕсли вам не нужны разные правила для разных поисковых систем, чаще всего достаточно общей группы User-agent: *.
Disallow
Disallow запрещает роботу сканировать указанный путь.
Например:
User-agent: *
Disallow: /admin/Запрет нескольких разделов:
User-agent: *
Disallow: /admin/
Disallow: /cart/
Disallow: /search/Будьте осторожны с самым опасным вариантом:
User-agent: *
Disallow: /Он закрывает от сканирования весь сайт для указанной группы роботов.
Если после изменения robots.txt резко пропали страницы из поиска или прекратился их обход, сначала проверьте именно
Disallow. Подробный разбор таких ситуаций есть в статье Ошибки robots.txt: что проверить и как исправить.
Allow
Allow позволяет открыть более конкретный путь внутри закрытого раздела.
Пример:
User-agent: *
Disallow: /private/
Allow: /private/public-page/Такая схема полезна, когда весь каталог закрыт, но отдельный URL или подкаталог должен оставаться доступным для роботов.
Sitemap
Директива Sitemap указывает поисковому роботу местоположение XML-карты сайта:
Sitemap: https://example.ru/sitemap.xmlЕсли карт несколько, можно перечислить несколько строк:
Sitemap: https://example.ru/sitemap-posts.xml
Sitemap: https://example.ru/sitemap-products.xmlКарта сайта не заменяет хорошую внутреннюю перелинковку, но помогает поисковой системе обнаруживать важные URL. Подробнее: что такое Sitemap.
Clean-param для Яндекса
Яндекс поддерживает директиву Clean-param, которая помогает сообщить роботу, что определённые параметры URL не меняют содержимое страницы и их можно не учитывать при индексировании.
Пример:
User-agent: Yandex
Clean-param: utm_source&utm_medium&utm_campaign /Использовать Clean-param нужно осознанно. Если параметр реально изменяет содержимое страницы, неправильная настройка может привести к нежелательному объединению URL.
Для большинства небольших сайтов эта директива не обязательна. Она особенно полезна на проектах с большим количеством параметров и дублей.
Какие директивы не стоит использовать
В старых статьях о robots.txt до сих пор встречаются директивы, которые сегодня либо не поддерживаются отдельными поисковиками, либо не должны использоваться как универсальное решение.
Noindex внутри robots.txt
Так делать не нужно:
Noindex: /private/Google не поддерживает noindex в robots.txt. Чтобы убрать HTML-страницу из поиска, используется метатег:
<meta name="robots" content="noindex">или HTTP-заголовок X-Robots-Tag.
Критически важно: если страница одновременно закрыта в robots.txt, робот может не открыть её и не увидеть noindex. Поэтому сначала определите, чего вы хотите добиться — запретить обход или исключить страницу из индекса.
Подробнее о метатегах: Что такое метатеги и как они влияют на SEO.
Crawl-delay
Не следует рассчитывать на Crawl-delay как на универсальную директиву. Например, Google её не поддерживает. Если сервер не справляется с нагрузкой поисковых роботов, проблему лучше решать на уровне производительности сайта, сервера и инструментов конкретной поисковой системы.
Host
В старых руководствах часто встречается:
Host: example.ruНе стоит использовать Host как основной современный способ выбора главного зеркала. Каноническую версию домена лучше закреплять корректными 301-редиректами, едиными внутренними ссылками, canonical и настройками поисковых систем.
Как настроить robots.txt для Яндекса
Для большинства сайтов нет необходимости создавать огромный отдельный блок специально для Яндекса. Можно начать с общего набора правил:
User-agent: *
Disallow: /admin/
Disallow: /search/
Sitemap: https://example.ru/sitemap.xmlЕсли Яндексу нужны отдельные инструкции, создайте отдельную группу:
User-agent: Yandex
Disallow: /service/
Clean-param: utm_source&utm_medium /
User-agent: *
Disallow: /service/
Sitemap: https://example.ru/sitemap.xmlПри настройке под Яндекс обратите внимание на несколько вещей:
- файл должен находиться по адресу
/robots.txt; - проверяйте файл через инструмент анализа robots.txt в Яндекс.Вебмастере;
- не закрывайте страницу через robots.txt, если хотите, чтобы робот увидел на ней
noindex; - используйте
Sitemap, чтобы сообщить поисковику об XML-карте; - для параметрических дублей при необходимости рассмотрите
Clean-param; - учитывайте регистр символов в путях URL.
После изменения правил проверьте несколько реальных URL в анализаторе: важную страницу, технический URL и страницу, которую вы намеренно закрыли.
Как настроить robots.txt для Google
Google использует стандарт Robots Exclusion Protocol и поддерживает базовые правила User-agent, Allow и Disallow, а также обнаруживает Sitemap.
Простой пример:
User-agent: Googlebot
Disallow: /admin/
Disallow: /search/
User-agent: *
Allow: /
Sitemap: https://example.ru/sitemap.xmlНо отдельная группа для Googlebot нужна только тогда, когда правила действительно отличаются. В остальных случаях проще и безопаснее поддерживать единый понятный набор правил.
После публикации Google сам обнаруживает обновления robots.txt. Проверить доступность и проблемы файла можно через отчёты Google Search Console.
Не используйте robots.txt, чтобы скрывать конфиденциальную информацию. Если URL должен быть недоступен посторонним, используйте авторизацию или защиту на сервере.
Готовые примеры robots.txt
Ниже — не универсальные файлы для копирования, а отправные точки. Перед использованием сравните пути со структурой своего сайта.
Простой корпоративный сайт
User-agent: *
Disallow: /admin/
Disallow: /search/
Sitemap: https://example.ru/sitemap.xmlБлог
User-agent: *
Disallow: /admin/
Disallow: /search/
Sitemap: https://example.ru/sitemap.xmlДля блога обычно не нужно закрывать изображения, CSS и JavaScript. Роботам важно видеть страницу максимально близко к тому, как её получает пользователь.
Интернет-магазин
User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /account/
Disallow: /search/
Sitemap: https://shop.example.ru/sitemap.xmlУ интернет-магазина часто есть фильтры, сортировки и параметры. Но закрывать их массово без анализа нельзя: часть фильтров может иметь самостоятельный поисковый спрос и приносить органический трафик.
Полностью открыть сайт
User-agent: *
Allow: /
Sitemap: https://example.ru/sitemap.xmlAllow: / обычно можно не писать — при отсутствии запрещающих правил сайт и так открыт для обхода.
Закрыть весь тестовый сайт
User-agent: *
Disallow: /Для staging-версии надёжнее дополнительно использовать авторизацию. Один robots.txt не является механизмом безопасности и не защищает данные от недобросовестных ботов.
Как проверить robots.txt
После любой правки недостаточно просто открыть файл глазами.
1. Откройте файл в браузере
Перейдите по адресу:
https://ваш-сайт.ru/robots.txtУбедитесь, что файл загружается и содержит именно ту версию, которую вы редактировали.
2. Проверьте Яндекс.Вебмастер
В Яндекс.Вебмастере используйте инструмент анализа robots.txt. Он позволяет проверить синтаксис и узнать, разрешён ли обход конкретного URL.
Минимальный набор тестов:
- главная страница;
- важная коммерческая страница;
- статья блога;
- URL из закрытого каталога;
- техническая страница.
3. Проверьте Google Search Console
В Google Search Console можно отслеживать проблемы robots.txt и проверять отдельные URL через инструменты проверки страниц.
4. Проведите технический краулинг
На больших проектах полезно дополнительно использовать Screaming Frog или аналогичный краулер. Он помогает выявить страницы и ресурсы, которые оказались заблокированы неожиданно.
Если сайт потерял позиции или трафик после технических изменений, robots.txt должен входить в первый набор проверок. Смотрите также Почему упал трафик сайта.
Типичные ошибки robots.txt
Ошибка 1. Закрыт весь сайт
User-agent: *
Disallow: /Такое правило иногда остаётся после переноса сайта с тестового сервера на production.
Ошибка 2. Закрыты CSS и JavaScript
Если поисковый робот не может загрузить важные ресурсы страницы, ему сложнее корректно отрендерить и оценить её. Не блокируйте стили и скрипты просто «для экономии краулингового бюджета».
Ошибка 3. Robots.txt используют вместо noindex
Disallow и noindex решают разные задачи. Запрет сканирования не гарантирует исключение URL из поиска.
Ошибка 4. Закрыты полезные страницы фильтрации
На интернет-магазинах некоторые фильтры имеют поисковый спрос. Массовый запрет всех параметрических URL может уничтожить полезные посадочные страницы.
Ошибка 5. Не указан Sitemap
Это не делает robots.txt неправильным, но ссылка на актуальную XML-карту помогает поисковым системам обнаруживать структуру сайта.
Ошибка 6. Правила не соответствуют реальной структуре URL
Например:
Disallow: /Catalog/не обязательно будет эквивалентно:
Disallow: /catalog/Регистр и конкретный путь имеют значение.
Ошибка 7. Файл редактируют без проверки
Одна лишняя косая черта или слишком широкое правило способно затронуть тысячи URL. После каждой правки тестируйте не только синтаксис, но и конкретные адреса.
Полный список практических проблем вынесен в отдельный материал: Правильная настройка robots.txt: ошибки, которых следует избегать.
Robots.txt и индексация: в чём разница
Это один из самых важных моментов.
Представим, что существует URL:
https://example.ru/private-page/И он закрыт:
User-agent: *
Disallow: /private-page/Поисковый робот получает инструкцию не сканировать страницу. Но поисковая система может узнать о самом URL из ссылок.
Если ваша цель — не показывать страницу в поиске, обычно правильнее разрешить роботу открыть её и прочитать:
<meta name="robots" content="noindex">После того как поисковая система обработает noindex, страницу можно исключить из результатов.
Если же URL содержит конфиденциальные данные, noindex тоже недостаточно: пользователь всё равно сможет открыть страницу напрямую. Здесь нужна авторизация или серверное ограничение доступа.
Таким образом:
| Задача | Что использовать |
|---|---|
| Снизить нежелательный обход | robots.txt |
| Убрать HTML-страницу из поиска | noindex |
| Объединить дубли | canonical / редирект |
| Защитить приватную информацию | авторизация |
| Помочь найти важные страницы | Sitemap + внутренняя перелинковка |
Чек-лист правильной настройки robots.txt
Перед публикацией проверьте:
- файл доступен по
/robots.txt; - важные страницы не закрыты
Disallow; - CSS и JavaScript не блокируются без необходимости;
- Sitemap указан правильным абсолютным URL;
- нет случайного
Disallow: /; - правила проверены для Яндекса;
- правила проверены для Google;
-
noindexне используется внутри robots.txt; - для поддоменов проверены отдельные robots.txt;
- после изменений протестированы реальные URL;
- технические параметры и фильтры закрываются только после анализа;
- приватные данные защищены не только robots.txt.
Если большая часть пунктов вызывает вопросы, стоит провести технический SEO-аудит или полноценный SEO-аудит сайта.
Часто задаваемые вопросы о robots.txt
Что такое robots.txt простыми словами?
Это текстовый файл с правилами для поисковых роботов. Он показывает, какие адреса сайта робот может сканировать, а какие ему обходить не следует.
Обязательно ли создавать robots.txt?
Не всегда. Если специальных ограничений нет, отсутствие файла само по себе не означает, что сайт будет закрыт для роботов. Но на реальных проектах robots.txt удобен для управления служебными разделами и указания Sitemap.
Где должен находиться robots.txt?
В корне каждого хоста:
https://example.ru/robots.txtКак проверить robots.txt в Яндексе?
Добавьте сайт в Яндекс.Вебмастер, подтвердите права и воспользуйтесь инструментом анализа robots.txt. Проверяйте не только наличие ошибок, но и доступность конкретных URL.
Как проверить robots.txt в Google?
Убедитесь, что файл доступен в браузере, а затем используйте отчёты и проверку URL в Google Search Console.
Можно ли через robots.txt убрать страницу из Google?
Не следует использовать robots.txt для этой задачи. Для запрета индексирования HTML-страницы Google рекомендует noindex, при этом робот должен иметь возможность загрузить страницу и увидеть эту директиву.
Можно ли закрывать изображения?
Технически можно ограничить их сканирование, но делать это без причины не стоит. Если вам нужен трафик из поиска по изображениям, они должны оставаться доступными соответствующим роботам.
Нужно ли писать Crawl-delay?
Как универсальное решение — нет. Google эту директиву не поддерживает. Управление нагрузкой лучше решать с учётом конкретного поисковика и производительности сервера.
Нужна ли директива Host в 2026 году?
Не стоит строить настройку основного зеркала вокруг Host. Используйте корректные 301-редиректы, canonical, единые внутренние URL и инструменты поисковых систем.
Что делать после изменения robots.txt?
Проверьте файл в Яндекс.Вебмастере и Google Search Console, протестируйте важные URL и следите за индексацией. На больших сайтах дополнительно проведите краулинг.
Вывод
Robots.txt — небольшой файл с очень большим влиянием на техническое состояние сайта. Его задача — управлять сканированием URL, а не заменять noindex, canonical, редиректы или защиту приватных данных.
Хороший robots.txt обычно прост: в нём нет десятков случайных правил, каждое ограничение понятно, Sitemap указан корректно, а изменения обязательно проверяются на реальных URL.
Если вы настраиваете файл впервые, начните с минимального набора правил и постепенно добавляйте ограничения только там, где понимаете их цель. А если сайт уже столкнулся с проблемами индексации, дополнительно проверьте распространённые ошибки robots.txt и техническое состояние проекта в целом.

