11 мин чтения
Роботы ИИ на вашем сайте: пускать или блокировать
GPTBot, ClaudeBot, PerplexityBot ходят по сайтам и читают содержимое. Разбираем, кто из них зачем приходит, чем оборачивается блокировка, что такое llms.txt и как принять решение осознанно.

На ваш сайт заходят не только люди. Кроме привычных роботов поисковиков, по нему ходят краулеры ИИ-компаний: скачивают страницы, читают текст, кладут в свои системы. Иногда для обучения моделей, иногда чтобы ответить на вопрос пользователя прямо сейчас.
Вопрос «пускать или нет» звучит философски, но решается технически — одним файлом на три строки. Хуже другое: на многих сайтах решение уже принято, только владелец об этом не знает. Разберём, как выяснить текущее положение дел и что с ним делать.
Кто именно приходит
Роботы делятся на два принципиально разных типа, и путать их — главная ошибка в этой теме.
- Обучающие краулеры собирают тексты, которые могут попасть в данные для обучения будущих моделей. Вам от этого прямой выгоды нет — только косвенная: модель будет что-то знать о вашей отрасли и, возможно, о вас.
- Поисковые агенты ходят по сайту в момент, когда пользователь задал вопрос ассистенту. Они приносят реальных посетителей: ассистент цитирует страницу и ставит ссылку. Блокировать их — терять трафик прямо сейчас.
| User-agent | Чей | Зачем ходит |
|---|---|---|
| GPTBot | OpenAI | Сбор данных, которые могут использоваться для обучения моделей |
| OAI-SearchBot | OpenAI | Индекс для поиска внутри ChatGPT — влияет на цитирование |
| ChatGPT-User | OpenAI | Заходит по конкретному запросу пользователя в реальном времени |
| ClaudeBot | Anthropic | Сбор данных для обучения |
| Claude-SearchBot | Anthropic | Поиск для ответов ассистента |
| PerplexityBot | Perplexity | Индексация для поисковых ответов со ссылками |
| Google-Extended | Управляет использованием контента в моделях Google; на обычный поиск не влияет | |
| YandexBot | Яндекс | Обычный поисковый робот — блокировать нельзя, потеряете поиск |
| Bingbot | Microsoft | Поисковый индекс Bing, который используют и некоторые ассистенты |
Как узнать, что у вас сейчас
Файл robots.txt лежит в корне сайта и доступен всем. Никаких инструментов не нужно.
- 01Откройте в браузере адрес вашсайт.ru/robots.txt.
- 02Если открылась страница «не найдено» — файла нет, и роботы не ограничены ничем. Это нормальное состояние по умолчанию.
- 03Если файл есть, найдите в нём строки Disallow: / — именно со слешем без продолжения. Это полный запрет для user-agent, указанного выше по тексту.
- 04Отдельно поищите строку User-agent: * с Disallow: / под ней: такая пара закрывает сайт от всех роботов сразу.
- 05Выпишите, кто у вас закрыт. Часто там обнаруживаются запреты, поставленные годы назад на время разработки.
Проверить, ходят ли роботы на самом деле, можно в логах сервера или в панели хостинга — там видны обращения с их именами в поле User-agent. Если доступа к логам нет, ничего страшного: настройка от этого не зависит.
Чем оборачивается блокировка
Аргументы за блокировку понятны: не хочется, чтобы чужая компания зарабатывала на вашем контенте, и не хочется, чтобы ассистент пересказывал ваш материал вместо того, чтобы отправить человека к вам.
Аргументы против тоже понятны, и для малого бизнеса они обычно весомее.
| Если заблокировать | Последствие | Кому это критично |
|---|---|---|
| Обучающие краулеры (GPTBot, ClaudeBot) | Ваши тексты не попадут в будущие данные для обучения | Медиа и авторам — да; сайту услуг — почти безразлично |
| Поисковых агентов (OAI-SearchBot, PerplexityBot) | Ассистент не сможет сослаться на страницу и не приведёт посетителя | Критично почти всем |
| Всех подряд через User-agent: * | Потеря обычного поиска вместе с ИИ | Катастрофично |
| Никого | Контент доступен всем, включая тех, кто не спрашивал | Приемлемо для большинства коммерческих сайтов |
Рабочая настройка для сайта услуг
Для типичного сайта малого бизнеса разумная позиция — пускать всех. Ваша ценность не в текстах, а в услуге; упоминание в ответе ассистента приносит клиента, а не отнимает его.
Практически это означает, что специально ничего добавлять не нужно — достаточно убедиться, что в robots.txt нет запретов, поставленных по недоразумению. Минимальный корректный файл выглядит так:
- User-agent: *
- Disallow: /admin/
- Disallow: /cart/
- Sitemap: https://вашсайт.ru/sitemap.xml
Здесь закрыты только служебные разделы, а последняя строка подсказывает роботам, где карта сайта. Если вы всё же решили закрыть обучающие краулеры, но оставить поисковых агентов, добавьте отдельные блоки:
- User-agent: GPTBot
- Disallow: /
- (пустая строка)
- User-agent: ClaudeBot
- Disallow: /
Когда блокировка действительно оправдана
Позиция «пускать всех» подходит большинству, но не всем. Есть случаи, где ограничение осмысленно.
- Контент и есть товар. Онлайн-курсы, платные базы, издания, живущие на подписке и рекламе. Здесь пересказ ассистентом действительно замещает визит.
- Уникальные данные, собранные дорого. Каталоги характеристик, справочники, результаты собственных исследований — то, что конкурент не воспроизведёт, а машина скопирует за минуту.
- Персональные данные в открытом доступе. Профили, объявления с контактами, отзывы с именами. Здесь вопрос не в выгоде, а в обязательствах перед людьми.
- Прямой запрет в договоре. Иногда правообладатель контента требует ограничить машинный сбор — это не обсуждается.
Обратите внимание: во всех четырёх случаях речь об обучающих краулерах. Даже медиа, закрывающие GPTBot, обычно оставляют открытыми поисковых агентов — им нужны переходы. Разделение по типам роботов почти всегда разумнее, чем сплошной запрет.
И ещё одно соображение, о котором забывают: блокировка асимметрична. Ваш сайт закрыт, сайты конкурентов открыты — в ответе ассистента окажутся они. Для медиа с сильным брендом это приемлемая цена, для подрядчика в конкурентной нише — вряд ли.
Что такое llms.txt
В 2024 году появилось предложение о файле llms.txt — текстовом файле в корне сайта, где владелец кратко описывает, что на сайте есть, и даёт ссылки на главные страницы в удобном для чтения моделью виде. По замыслу это оглавление для ассистента: вместо того чтобы разбирать вёрстку, он читает готовую выжимку.
Честно о статусе: это предложение сообщества, а не стандарт. Насколько нам известно, ни один крупный ассистент официально не объявлял, что читает и учитывает этот файл. Публичных подтверждений его влияния на ответы нет.
Стоит ли делать? Файл занимает полчаса, ничего не ломает и на всякий случай приводит в порядок ваше собственное представление о структуре сайта. Как лотерейный билет за полчаса — приемлемо. Как основа стратегии — нет.
- 01Создайте текстовый файл llms.txt и положите в корень сайта — туда же, где лежит robots.txt.
- 02Первой строкой напишите название компании через знак решётки: # Название.
- 03Ниже — абзац с описанием: чем занимаетесь, где, для кого. Два-три предложения без рекламы.
- 04Дальше список ссылок в формате: - Название страницы: краткое пояснение.
- 05Включите главное: услуги, цены, контакты, вопросы и ответы. Служебные страницы не нужны.
- 06Проверьте, что файл открывается по адресу вашсайт.ru/llms.txt и отдаётся как обычный текст.
Ошибки, которые встречаются чаще всего
Robots.txt выглядит простым, и именно поэтому в нём регулярно находятся дорогие опечатки. Пять самых частых.
- Запрет с этапа разработки остался в проде. Сайт делали на тестовом адресе, закрыли от индексации целиком, выложили — и забыли снять. Классика; проверяется первой строкой файла.
- Файл лежит не в корне. Robots.txt читается только по адресу домен/robots.txt. В подпапке он не работает совсем.
- Закрыты папки со стилями и скриптами. Disallow: /assets/ мешает роботу отрисовать страницу и оценить её. Служебные разделы закрывать нужно, ресурсы оформления — нет.
- Разные robots.txt на домене с www и без. Формально это разные адреса. Если настроен редирект — всё в порядке, если нет — проверьте оба.
- Запрет вместо noindex. Disallow не удаляет страницу из поиска, а лишь запрещает её читать; закрытая страница может остаться в выдаче без описания. Чтобы убрать страницу, нужен мета-тег noindex, и робот должен иметь возможность её прочитать.
Проверить синтаксис можно бесплатно: в Яндекс.Вебмастере есть «Анализ robots.txt», где видно, какие правила применятся к конкретному адресу. Инструмент показывает и опечатки, и неожиданные срабатывания.
Если роботы создают нагрузку
Отдельная ситуация: краулеры ходят слишком часто и заметно нагружают сервер. Это бывает на больших каталогах с множеством фильтров, где число адресов исчисляется десятками тысяч.
Реакция «заблокировать» здесь тоже поспешна. Сначала стоит попробовать более мягкие меры.
- 01Посмотрите в логах, какой именно робот и с какой частотой приходит — часто виноват один, а не все.
- 02Закройте в robots.txt страницы фильтров и сортировок: адреса с параметрами обычно не нужны в индексе и дают основной объём.
- 03Проверьте, отдаются ли страницы из кэша: нагрузка от роботов чаще говорит о слабом кэшировании, чем о наглости краулеров.
- 04Только если это не помогло — ограничьте конкретного робота, а не всех сразу.
Полезно помнить, что причина нагрузки нередко общая с причиной медленной загрузки для людей. Если сервер тяжело переносит визиты роботов, живым посетителям тоже не сладко — разбор в статье почему сайт грузится медленно.
Что важнее файлов
Ни robots.txt, ни llms.txt не помогут, если робот приходит и не находит на странице текста. Самая частая техническая причина — контент, который отрисовывается скриптом уже в браузере. Поисковые роботы крупных систем с этим справляются, ИИ-краулеры — далеко не все и не всегда.
- Откройте страницу и нажмите Ctrl+U — увидите исходный код, который получает робот.
- Найдите в нём поиском (Ctrl+F) любой абзац с вашей страницы.
- Если текста нет, а вместо него пустые блоки и подключения скриптов — страница собирается в браузере, и роботу достаётся пустота.
- Это же касается описаний в раскрывающихся блоках, слайдерах и вкладках, если содержимое подгружается по клику.
Вторая частая причина — скорость. У краулеров есть предел ожидания: медленный сайт может быть просто не дочитан. Это ещё один довод в пользу того, чтобы разобраться со скоростью раньше, чем с тонкими настройками: почему сайт грузится медленно.
Порядок действий
- 01Откройте вашсайт.ru/robots.txt и посмотрите, что там сейчас.
- 02Уберите Disallow: / у поисковых роботов, если он там оказался.
- 03Решите отдельно по обучающим краулерам — для сайта услуг разумно оставить открытыми.
- 04Убедитесь, что в файле указана ссылка на карту сайта.
- 05Проверьте через Ctrl+U, что текст страниц виден в исходном коде.
- 06По желанию добавьте llms.txt — без ожиданий, но и без вреда.
- 07Через месяц загляните в логи сервера и посмотрите, кто из роботов действительно приходит.
Доступ роботов — это гигиена, а не рычаг. Он убирает препятствия, но сам по себе никого к вам не приведёт. Что влияет на попадание в ответ ассистента и какие обещания в этой области стоит считать пустыми — в отдельном разборе: видимость в ИИ-ассистентах.
Что ещё может закрывать сайт втихую
Robots.txt — не единственное место, где роботу могут отказать. Бывает, что файл в порядке, а краулер всё равно не получает страницу. Стоит проверить ещё четыре вещи.
| Где искать | Как проявляется | Что делать |
|---|---|---|
| Мета-тег robots на странице | В коде страницы строка noindex — она сильнее robots.txt | Найти через Ctrl+U поиском по слову noindex и убрать с нужных страниц |
| Защита от ботов у хостинга или CDN | Роботы получают проверку вместо страницы | В панели защиты внести полезных краулеров в исключения |
| Ограничение по стране или частоте запросов | Часть роботов не проходит, часть проходит | Проверить настройки блокировок у хостера |
| Обязательная авторизация или согласие | Контент виден только после действия пользователя | Оставить основное содержимое доступным без входа |
Последний пункт заслуживает отдельного слова. Всплывающее окно, которое перекрывает страницу до нажатия кнопки, само по себе роботу не мешает — он читает исходный код. А вот если содержимое подгружается только после согласия, страница для машины действительно пуста. Разница именно в том, скрыт текст визуально или отсутствует в коде.
Проверьте свой сайт
До 46 проверок за минуту, прогноз роста заявок и готовые тексты исправлений. Без доступов и регистрации.
Проверить бесплатноЧитайте дальше

Видимость в ИИ-ассистентах: как попасть в ответ ChatGPT
Клиенты всё чаще спрашивают у ассистента «посоветуй компанию», и он называет несколько имён. Разбираем, откуда ассистенты берут эти имена, что на это реально влияет и почему услуги по «продвижению в ChatGPT» стоит читать со скепсисом.
21 мая 2026 г.

Аудит сайта своими силами: 20 проверок за один вечер
Полный обход сайта без подрядчика и платных сервисов. Двадцать проверок, разложенных по четырём направлениям, с понятным критерием «прошёл или нет» для каждой.
1 августа 2026 г.

Куда вложить бюджет на сайт: порядок, в котором это окупается
Редизайн, реклама, SEO, новый копирайтинг — на что тратить первым. Разбираем порядок работ по принципу «где сейчас самая узкая часть воронки», а не по моде.
28 июля 2026 г.