Веб-Метрикаблог

11 мин чтения

Роботы ИИ на вашем сайте: пускать или блокировать

GPTBot, ClaudeBot, PerplexityBot ходят по сайтам и читают содержимое. Разбираем, кто из них зачем приходит, чем оборачивается блокировка, что такое llms.txt и как принять решение осознанно.

опубликовано 17 мая 2026 г.
Ворота, через которые проходит часть потоков данных

На ваш сайт заходят не только люди. Кроме привычных роботов поисковиков, по нему ходят краулеры ИИ-компаний: скачивают страницы, читают текст, кладут в свои системы. Иногда для обучения моделей, иногда чтобы ответить на вопрос пользователя прямо сейчас.

Вопрос «пускать или нет» звучит философски, но решается технически — одним файлом на три строки. Хуже другое: на многих сайтах решение уже принято, только владелец об этом не знает. Разберём, как выяснить текущее положение дел и что с ним делать.

Кто именно приходит

Роботы делятся на два принципиально разных типа, и путать их — главная ошибка в этой теме.

  • Обучающие краулеры собирают тексты, которые могут попасть в данные для обучения будущих моделей. Вам от этого прямой выгоды нет — только косвенная: модель будет что-то знать о вашей отрасли и, возможно, о вас.
  • Поисковые агенты ходят по сайту в момент, когда пользователь задал вопрос ассистенту. Они приносят реальных посетителей: ассистент цитирует страницу и ставит ссылку. Блокировать их — терять трафик прямо сейчас.
User-agentЧейЗачем ходит
GPTBotOpenAIСбор данных, которые могут использоваться для обучения моделей
OAI-SearchBotOpenAIИндекс для поиска внутри ChatGPT — влияет на цитирование
ChatGPT-UserOpenAIЗаходит по конкретному запросу пользователя в реальном времени
ClaudeBotAnthropicСбор данных для обучения
Claude-SearchBotAnthropicПоиск для ответов ассистента
PerplexityBotPerplexityИндексация для поисковых ответов со ссылками
Google-ExtendedGoogleУправляет использованием контента в моделях Google; на обычный поиск не влияет
YandexBotЯндексОбычный поисковый робот — блокировать нельзя, потеряете поиск
BingbotMicrosoftПоисковый индекс Bing, который используют и некоторые ассистенты

Как узнать, что у вас сейчас

Файл robots.txt лежит в корне сайта и доступен всем. Никаких инструментов не нужно.

  1. 01Откройте в браузере адрес вашсайт.ru/robots.txt.
  2. 02Если открылась страница «не найдено» — файла нет, и роботы не ограничены ничем. Это нормальное состояние по умолчанию.
  3. 03Если файл есть, найдите в нём строки Disallow: / — именно со слешем без продолжения. Это полный запрет для user-agent, указанного выше по тексту.
  4. 04Отдельно поищите строку User-agent: * с Disallow: / под ней: такая пара закрывает сайт от всех роботов сразу.
  5. 05Выпишите, кто у вас закрыт. Часто там обнаруживаются запреты, поставленные годы назад на время разработки.

Проверить, ходят ли роботы на самом деле, можно в логах сервера или в панели хостинга — там видны обращения с их именами в поле User-agent. Если доступа к логам нет, ничего страшного: настройка от этого не зависит.

Чем оборачивается блокировка

Аргументы за блокировку понятны: не хочется, чтобы чужая компания зарабатывала на вашем контенте, и не хочется, чтобы ассистент пересказывал ваш материал вместо того, чтобы отправить человека к вам.

Аргументы против тоже понятны, и для малого бизнеса они обычно весомее.

Если заблокироватьПоследствиеКому это критично
Обучающие краулеры (GPTBot, ClaudeBot)Ваши тексты не попадут в будущие данные для обученияМедиа и авторам — да; сайту услуг — почти безразлично
Поисковых агентов (OAI-SearchBot, PerplexityBot)Ассистент не сможет сослаться на страницу и не приведёт посетителяКритично почти всем
Всех подряд через User-agent: *Потеря обычного поиска вместе с ИИКатастрофично
НикогоКонтент доступен всем, включая тех, кто не спрашивалПриемлемо для большинства коммерческих сайтов

Рабочая настройка для сайта услуг

Для типичного сайта малого бизнеса разумная позиция — пускать всех. Ваша ценность не в текстах, а в услуге; упоминание в ответе ассистента приносит клиента, а не отнимает его.

Практически это означает, что специально ничего добавлять не нужно — достаточно убедиться, что в robots.txt нет запретов, поставленных по недоразумению. Минимальный корректный файл выглядит так:

  • User-agent: *
  • Disallow: /admin/
  • Disallow: /cart/
  • Sitemap: https://вашсайт.ru/sitemap.xml

Здесь закрыты только служебные разделы, а последняя строка подсказывает роботам, где карта сайта. Если вы всё же решили закрыть обучающие краулеры, но оставить поисковых агентов, добавьте отдельные блоки:

  • User-agent: GPTBot
  • Disallow: /
  • (пустая строка)
  • User-agent: ClaudeBot
  • Disallow: /

Когда блокировка действительно оправдана

Позиция «пускать всех» подходит большинству, но не всем. Есть случаи, где ограничение осмысленно.

  • Контент и есть товар. Онлайн-курсы, платные базы, издания, живущие на подписке и рекламе. Здесь пересказ ассистентом действительно замещает визит.
  • Уникальные данные, собранные дорого. Каталоги характеристик, справочники, результаты собственных исследований — то, что конкурент не воспроизведёт, а машина скопирует за минуту.
  • Персональные данные в открытом доступе. Профили, объявления с контактами, отзывы с именами. Здесь вопрос не в выгоде, а в обязательствах перед людьми.
  • Прямой запрет в договоре. Иногда правообладатель контента требует ограничить машинный сбор — это не обсуждается.

Обратите внимание: во всех четырёх случаях речь об обучающих краулерах. Даже медиа, закрывающие GPTBot, обычно оставляют открытыми поисковых агентов — им нужны переходы. Разделение по типам роботов почти всегда разумнее, чем сплошной запрет.

И ещё одно соображение, о котором забывают: блокировка асимметрична. Ваш сайт закрыт, сайты конкурентов открыты — в ответе ассистента окажутся они. Для медиа с сильным брендом это приемлемая цена, для подрядчика в конкурентной нише — вряд ли.

Что такое llms.txt

В 2024 году появилось предложение о файле llms.txt — текстовом файле в корне сайта, где владелец кратко описывает, что на сайте есть, и даёт ссылки на главные страницы в удобном для чтения моделью виде. По замыслу это оглавление для ассистента: вместо того чтобы разбирать вёрстку, он читает готовую выжимку.

Честно о статусе: это предложение сообщества, а не стандарт. Насколько нам известно, ни один крупный ассистент официально не объявлял, что читает и учитывает этот файл. Публичных подтверждений его влияния на ответы нет.

Стоит ли делать? Файл занимает полчаса, ничего не ломает и на всякий случай приводит в порядок ваше собственное представление о структуре сайта. Как лотерейный билет за полчаса — приемлемо. Как основа стратегии — нет.

  1. 01Создайте текстовый файл llms.txt и положите в корень сайта — туда же, где лежит robots.txt.
  2. 02Первой строкой напишите название компании через знак решётки: # Название.
  3. 03Ниже — абзац с описанием: чем занимаетесь, где, для кого. Два-три предложения без рекламы.
  4. 04Дальше список ссылок в формате: - Название страницы: краткое пояснение.
  5. 05Включите главное: услуги, цены, контакты, вопросы и ответы. Служебные страницы не нужны.
  6. 06Проверьте, что файл открывается по адресу вашсайт.ru/llms.txt и отдаётся как обычный текст.

Ошибки, которые встречаются чаще всего

Robots.txt выглядит простым, и именно поэтому в нём регулярно находятся дорогие опечатки. Пять самых частых.

  • Запрет с этапа разработки остался в проде. Сайт делали на тестовом адресе, закрыли от индексации целиком, выложили — и забыли снять. Классика; проверяется первой строкой файла.
  • Файл лежит не в корне. Robots.txt читается только по адресу домен/robots.txt. В подпапке он не работает совсем.
  • Закрыты папки со стилями и скриптами. Disallow: /assets/ мешает роботу отрисовать страницу и оценить её. Служебные разделы закрывать нужно, ресурсы оформления — нет.
  • Разные robots.txt на домене с www и без. Формально это разные адреса. Если настроен редирект — всё в порядке, если нет — проверьте оба.
  • Запрет вместо noindex. Disallow не удаляет страницу из поиска, а лишь запрещает её читать; закрытая страница может остаться в выдаче без описания. Чтобы убрать страницу, нужен мета-тег noindex, и робот должен иметь возможность её прочитать.

Проверить синтаксис можно бесплатно: в Яндекс.Вебмастере есть «Анализ robots.txt», где видно, какие правила применятся к конкретному адресу. Инструмент показывает и опечатки, и неожиданные срабатывания.

Если роботы создают нагрузку

Отдельная ситуация: краулеры ходят слишком часто и заметно нагружают сервер. Это бывает на больших каталогах с множеством фильтров, где число адресов исчисляется десятками тысяч.

Реакция «заблокировать» здесь тоже поспешна. Сначала стоит попробовать более мягкие меры.

  1. 01Посмотрите в логах, какой именно робот и с какой частотой приходит — часто виноват один, а не все.
  2. 02Закройте в robots.txt страницы фильтров и сортировок: адреса с параметрами обычно не нужны в индексе и дают основной объём.
  3. 03Проверьте, отдаются ли страницы из кэша: нагрузка от роботов чаще говорит о слабом кэшировании, чем о наглости краулеров.
  4. 04Только если это не помогло — ограничьте конкретного робота, а не всех сразу.

Полезно помнить, что причина нагрузки нередко общая с причиной медленной загрузки для людей. Если сервер тяжело переносит визиты роботов, живым посетителям тоже не сладко — разбор в статье почему сайт грузится медленно.

Что важнее файлов

Ни robots.txt, ни llms.txt не помогут, если робот приходит и не находит на странице текста. Самая частая техническая причина — контент, который отрисовывается скриптом уже в браузере. Поисковые роботы крупных систем с этим справляются, ИИ-краулеры — далеко не все и не всегда.

  • Откройте страницу и нажмите Ctrl+U — увидите исходный код, который получает робот.
  • Найдите в нём поиском (Ctrl+F) любой абзац с вашей страницы.
  • Если текста нет, а вместо него пустые блоки и подключения скриптов — страница собирается в браузере, и роботу достаётся пустота.
  • Это же касается описаний в раскрывающихся блоках, слайдерах и вкладках, если содержимое подгружается по клику.

Вторая частая причина — скорость. У краулеров есть предел ожидания: медленный сайт может быть просто не дочитан. Это ещё один довод в пользу того, чтобы разобраться со скоростью раньше, чем с тонкими настройками: почему сайт грузится медленно.

Порядок действий

  1. 01Откройте вашсайт.ru/robots.txt и посмотрите, что там сейчас.
  2. 02Уберите Disallow: / у поисковых роботов, если он там оказался.
  3. 03Решите отдельно по обучающим краулерам — для сайта услуг разумно оставить открытыми.
  4. 04Убедитесь, что в файле указана ссылка на карту сайта.
  5. 05Проверьте через Ctrl+U, что текст страниц виден в исходном коде.
  6. 06По желанию добавьте llms.txt — без ожиданий, но и без вреда.
  7. 07Через месяц загляните в логи сервера и посмотрите, кто из роботов действительно приходит.

Доступ роботов — это гигиена, а не рычаг. Он убирает препятствия, но сам по себе никого к вам не приведёт. Что влияет на попадание в ответ ассистента и какие обещания в этой области стоит считать пустыми — в отдельном разборе: видимость в ИИ-ассистентах.

Что ещё может закрывать сайт втихую

Robots.txt — не единственное место, где роботу могут отказать. Бывает, что файл в порядке, а краулер всё равно не получает страницу. Стоит проверить ещё четыре вещи.

Где искатьКак проявляетсяЧто делать
Мета-тег robots на страницеВ коде страницы строка noindex — она сильнее robots.txtНайти через Ctrl+U поиском по слову noindex и убрать с нужных страниц
Защита от ботов у хостинга или CDNРоботы получают проверку вместо страницыВ панели защиты внести полезных краулеров в исключения
Ограничение по стране или частоте запросовЧасть роботов не проходит, часть проходитПроверить настройки блокировок у хостера
Обязательная авторизация или согласиеКонтент виден только после действия пользователяОставить основное содержимое доступным без входа

Последний пункт заслуживает отдельного слова. Всплывающее окно, которое перекрывает страницу до нажатия кнопки, само по себе роботу не мешает — он читает исходный код. А вот если содержимое подгружается только после согласия, страница для машины действительно пуста. Разница именно в том, скрыт текст визуально или отсутствует в коде.

robots.txtllms.txtии-поисккраулеры

Проверьте свой сайт

До 46 проверок за минуту, прогноз роста заявок и готовые тексты исправлений. Без доступов и регистрации.

Проверить бесплатно

Читайте дальше

Сеть связей между источниками, из которых складывается один ответ
ИИ-поиск11 мин чтения

Видимость в ИИ-ассистентах: как попасть в ответ ChatGPT

Клиенты всё чаще спрашивают у ассистента «посоветуй компанию», и он называет несколько имён. Разбираем, откуда ассистенты берут эти имена, что на это реально влияет и почему услуги по «продвижению в ChatGPT» стоит читать со скепсисом.

21 мая 2026 г.