У краулеров моделей три задачи: собрать материал для обучения, открыть страницу под конкретный вопрос, назвать источник в ответе. Пустить бота на сайт и отдать материалы в обучение - разные решения, и принимать их можно порознь. Запрет всем разом убирает сайт из ответов всех платформ сразу, а материалы от обучения все равно защищает не полностью. Кроме robots.txt блокировка стоит еще в четырех местах, и сервис защиты меняет настройки по умолчанию без предупреждения. Логи сервера показывают, дошел бот до страниц или его развернули на подходе.
AI-краулеры делятся на две группы. Одни забирают материалы в обучающий набор и не приносят взамен ни ссылок, ни посещений. Другие открывают страницу в момент, когда человек задал вопрос, и ставят ссылку на источник в ответе. Запрет второй группе означает пропажу из ответов ChatGPT, Claude, Perplexity и Gemini. Проверка занимает несколько минут.
Владелец сайта узнает о запрете случайно и поздно. Правило приезжает вместе с шаблоном темы, остается от старого набора настроек для SEO или включается само на стороне сервиса защиты. Файл robots.txt при этом выглядит нормально. А бот до страниц не доходит. Если про сам подход вы читаете впервые, начните с материала о том, что такое GEO и чем оно отличается от SEO, а сюда вернитесь за технической частью.
Краулер приходит на сайт за одной из трех задач: собрать материал в обучающий набор, скачать страницу под конкретный вопрос пользователя, назвать источник в ответе. Задачи разные, боты у них тоже разные. Решение о доступе принимается отдельно по каждой группе, и здесь теряется большая часть смысла всей работы по видимости.
Имена разведены по этим задачам. Обучение у OpenAI забирает GPTBot, поиск внутри ChatGPT питает OAI-SearchBot. Anthropic отправляет на обучение ClaudeBot, на поиск - Claude-SearchBot. Common Crawl собирает общий набор ботом CCBot, и на этом наборе учатся сразу несколько компаний. Отсюда вывод: разрешение на обход и разрешение на обучение разводятся по разным правилам.
Есть и третья группа, которую пропускают чаще остальных. ChatGPT-User и Claude-User приходят на сайт, когда человек в диалоге дал модели прямое поручение: открыть эту страницу, сравнить два предложения, пересказать условия. Такой запрос идет от человека с конкретным намерением, и его вес выше, чем у обычного обхода. Владелец сайта видит одно обращение вместо тысячи, а стоит оно дороже.
Выбор дальше сводится к двум позициям, и у каждой есть основания.
Осторожная. Закрыть краулеры обучения, чтобы не отдавать материалы бесплатно, и явно открыть краулеры выдачи, чтобы попадать в ответы со ссылкой. Логика издательская: тексты составляют продукт, а присутствие в ответах нужно сохранить.
Открытая. Пустить всех. Попадание в набор Common Crawl дает присутствие сразу у нескольких сервисов, а блокировка вредит почти всегда, кроме случая с собственными исследованиями, которые сами по себе составляют ценность бизнеса.
Издателю с уникальными материалами ближе первая. Сайту услуг, магазину, локальному бизнесу - вторая. Клиника в Ташкенте ничего не защищает своим запретом GPTBot, а вот из ответов на вопрос про имплантацию она пропадает целиком.
Делюсь практикой и разборами по performance‑маркетингуПеречень ниже актуален на июль 2026 года. Имена копируются в файл посимвольно: регистр и дефисы имеют значение, `Claude-SearchBot` и `claude searchbot` для сервера разные строки.
| Имя в robots.txt | Чей | Задача | Что дает запрет |
|---|---|---|---|
| GPTBot | OpenAI | сбор для обучения | материалы не попадают в обучение модели |
| OAI-SearchBot | OpenAI | подача страниц в поиск ChatGPT | сайт пропадает из ответов ChatGPT со ссылкой |
| ChatGPT-User | OpenAI | обращение по действию пользователя | модель не откроет страницу по прямой просьбе человека |
| ClaudeBot | Anthropic | сбор для обучения | материалы не попадают в обучение |
| Claude-User | Anthropic | обращение по действию пользователя | модель не откроет страницу по прямой просьбе человека |
| Claude-SearchBot | Anthropic | индекс поиска внутри Claude | пропадание из ответов Claude |
| Google-Extended | обучение и генеративные ответы | выпадение из AI Overviews и Gemini, обычный поиск остается | |
| PerplexityBot | Perplexity | обход под ответы | пропадание из ответов Perplexity |
| CCBot | Common Crawl | сбор общего набора данных | выпадение из набора, на котором учатся сразу несколько моделей |
| YandexBot | Яндекс | индекс Яндекса, на нем работает Алиса | выпадение из выдачи Яндекса и ответов Алисы |
| Bingbot | Microsoft | индекс Bing | потеря индекса, на который опирается поиск ChatGPT |
К таблице идут четыре пояснения, без которых она читается неверно.
Google-Extended отделен от Googlebot. Закрыть первый и остаться в обычном поиске можно, механика работает. Цена такая: AI Overviews и Gemini отпадают. Многие сайты держат Googlebot открытым и закрывают Google-Extended, не понимая, что отключают присутствие в самой массовой AI-поверхности.
Имена меняются, и это ловушка. Anthropic уточнил документацию в феврале 2026: `anthropic-ai` и `Claude-Web` объявлены устаревшими, вместо них три отдельных имени - ClaudeBot, Claude-User, Claude-SearchBot. У OpenAI такое разделение случилось раньше. По логам проектов, которые я веду, старые строки уже не встречаются, зато появилась новая - `claude-code`, агент командной строки, который открывает страницы по поручению разработчика. Правила, написанные под устаревшие имена, при этом работают вхолостую. Отсюда режим работы: набор правил пересматривается раз в полгода, а не пишется один раз навсегда.
Список не закрыт. Сервисы отслеживания краулеров ведут уже больше двух десятков имен, среди которых Applebot-Extended, Meta-ExternalAgent, DuckAssistBot, Amazonbot. Таблица выше - опора для решения, а не окончательный перечень.
Региональная часть таблицы решается отдельно от глобальной. Для сайта, который работает на Узбекистан, Казахстан или Кыргызстан, YandexBot остается открытым по умолчанию: через индекс Яндекса сайт попадает и в обычную выдачу, и в ответы Алисы. Для проекта, нацеленного на ЕС или ОАЭ, вес этого бота падает почти до нуля, зато растет цена открытого Bingbot. Смотреть стоит на то, откуда приходят люди, а не на длину перечня в чужом шаблоне.
Мелкие сборщики отделяются от крупных. Никто не обязывает пускать всех: можно закрыть второстепенные скраперы вроде Bytespider и оставить открытыми основные площадки. А вот отсутствие robots.txt означает открытую дверь всем подряд, включая тех, кто собирает ваши данные и не приносит ничего взамен.
Ahrefs проверил 140 миллионов сайтов и насчитал около 5,9% таких, где GPTBot закрыт. Речь про миллионы страниц, невидимых для ChatGPT. Причина у большинства не в позиции владельца, а в унаследованных правилах из шаблона.
Запрет любому краулеру означает отсутствие на его площадке. Не понижение позиции, не слабую видимость - отсутствие. Модель не может процитировать то, чего не скачала. Закрытый GPTBot обнуляет остальную работу по видимости в моделях: разметка, структура текстов, факты, отзывы - все это остается за закрытой дверью.
Закрытие всех краулеров разом защищает материалы хуже, чем кажется. Тексты все равно расходятся по агрегаторам, цитатам в соцсетях и чужим пересказам, а сайт при этом теряет канал целиком. Для изданий история еще жестче: те, кто ограничивал доступ вместо договоренностей с платформами, выпадали из цитирования быстрее, чем находили замену этой аудитории.
Оправданные случаи есть, и их немного: собственные исследования, которые вы продаете, базы и расчеты, составляющие продукт, материалы за оплатой доступа. Здесь запрет краулерам обучения становится осмысленным решением, но это исключение, а не типовой сценарий.
Посчитать цену запрета проще, чем кажется. Возьмите вопросы, по которым к вам приходят из поиска, и задайте их модели без упоминания бренда. Ответ покажет, кого называют вместо вас. Строительная компания в Астане так обнаружила, что по вопросу про сроки согласования проекта модель тянет ответ с форума пятилетней давности, тогда как на ее собственном сайте лежит разобранная инструкция с актуальными нормами. Инструкция была закрыта вместе со всем сайтом одной строкой в шаблоне.
Отдельный случай - когда доступ открыт, а сайта в ответах все равно нет. Там причины другие: рендеринг, скорость, структура. Разбор в материале почему сайт не читается, даже когда доступ открыт.
Файл robots.txt - одно из пяти мест, где стоит запрет. Остальные четыре владелец сайта чаще не открывал ни разу.
Начать стоит с сервиса защиты. Cloudflare с июля 2025 года управляет трафиком краулеров через robots.txt: сервис сам дописывает в файл сигнал не использовать материалы для обучения. Отдельный переключатель блокировки обучающих ботов включен по умолчанию для части тарифов, и при нем видимость в моделях падает до нуля. Ищут его в разделе защиты от ботов, пункт про AI-краулеров, режимы «разрешить» и «блокировать».
1 июля 2026 года Cloudflare перестроил эту механику и объявил новые правила. Теперь трафик ботов разложен на три категории: поиск (страница скачивается для индекса и последующих ответов), агент (система действует по поручению человека в момент запроса), обучение (материалы идут в веса модели). С 15 сентября 2026 года категории «обучение» и «агент» блокируются по умолчанию на страницах, где показывается реклама. Поисковые краулеры остаются открытыми. Новые правила применяются к новым клиентам, к новым сайтам действующих клиентов и ко всем, кто сидит на бесплатном тарифе; отказаться от них можно в панели до этой даты. Боты со смешанным поведением попадают под самое строгое из заявленных ими назначений.
Основания у такого шага есть, и не только денежные. По статистике самого Cloudflare, в июне 2026 года обучающие краулеры дали 50,6% всего трафика ботов моделей, поисковые - 10,7%, а больше половины обходов пришлось на страницы, которые с прошлого визита не менялись. Крупные сайты получают нагрузку, сравнимую с атакой, поэтому владельцы защиты закручивают настройки по умолчанию.
Для владельца сайта отсюда следуют две вещи. Настройки меняются без вашего участия, и дату 15 сентября стоит записать в календарь. Проверять доступ придется заново после каждого такого обновления, а обновления теперь приходят чаще, чем раз в год.
Случай из работы. На собственном проекте настройка блокировки обучающих ботов стояла в режиме запрета. Файл robots.txt разрешал всех, валидатор показывал зеленый статус, а в логах по краулерам моделей была тишина. На поиск причины ушел час. Отдельная ценность истории в том, что ни один инструмент проверки robots.txt об этом не сообщит: запрет стоит выше того уровня, который эти инструменты видят. Подробный разбор с панелью конструктора - в материале о том, как это выглядит на конструкторе и где прячется блокировка.
Сайт может нормально ранжироваться в Google и оставаться полностью невидимым для ChatGPT. Это две независимые настройки, и одна ничего не говорит о другой.
Второй случай, клиентский. Агрегатор клиник и врачей, сайт закрыт для краулеров моделей. Сама правка занимала минут десять. Согласование с отделом разработки клиента заняло почти месяц: возражения шли про нагрузку на сервер, про обучение чужих моделей на содержимом каталога, про безопасность. Каждое из них разбиралось отдельно. Техническая часть работы в таких историях самая короткая, а спор о том, пускать ли ботов, растягивается дольше всей остальной подготовки. Закладывайте это время в план заранее, особенно когда сайтом занимается подрядчик со своим регламентом правок.
Остальные точки блокировки вне robots.txt выглядят так.
Порядок проверки: robots.txt, панель сервиса защиты, правила брандмауэра, настройки хостинга, расширения безопасности. Пять шагов, минут двадцать работы.
Два образца ниже рабочие целиком. Меняете домен в последней строке - и файл готов.
Образец 1. Открытый доступ. Подходит сайту услуг, магазину, блогу, локальному бизнесу.
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: CCBot
Allow: /
User-agent: *
Disallow: /cart
Disallow: /checkout
Disallow: /wp-admin/
Allow: /
Sitemap: https://example.com/sitemap.xml
# llms.txt: https://example.com/llms.txt Разбор. Каждому краулеру отдано отдельное правило с явным разрешением. Строка `Allow: /` для бота, у которого нет запретов, технически не меняет ничего. Она снимает двусмысленность при чтении общих правил и сразу показывает вашу позицию тому, кто открыл файл. Блок `User-agent: *` закрывает служебные адреса от всех: корзина, оформление заказа, панель администратора. Последняя строка отдает адрес карты сайта.
Образец 2. Разделенный доступ. Подходит изданию, проекту с собственными исследованиями, сайту с платными материалами.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
User-agent: *
Disallow: /wp-admin/
Allow: /
Sitemap: https://example.com/sitemap.xml Разбор. Первые три блока закрывают обучение: GPTBot, ClaudeBot и CCBot забирают материалы в наборы данных. Дальше идут открытые краулеры выдачи - через них сайт попадает в ответы со ссылкой. Google-Extended оставлен открытым намеренно: он отвечает и за обучение, и за генеративные ответы Google, поэтому его запрет выбивает сайт из AI Overviews и Gemini. Bingbot открыт, потому что на индекс Bing опирается поиск внутри ChatGPT.
Оговорка к этому образцу. Закрытие CCBot убирает сайт из общего набора Common Crawl, а на нем учатся сразу несколько компаний, включая те, чьих собственных краулеров вы никогда не увидите в логах. Цена решения выше, чем выглядит по одной строке.
Что еще должно быть в файле:
После правки файл проверяется тремя действиями. Откройте адрес `вашсайт.ru/robots.txt` в браузере и убедитесь, что отдается свежая версия, а не старая из кеша сервиса доставки контента. Повторите то же для каждого поддомена: правила действуют на конкретный хост, а блог по отдельному адресу читает собственный файл. Сравните версию на домене с www и без www - при разных настройках краулер получает противоречивые указания и выбирает строгое.
Типовые ошибки в файле встречаются четырех видов. Первая - запрет всем в первой строке, а разрешения ниже; порядок правил их гасит, и файл работает противоположно замыслу. Вторая - закрытые каталоги со скриптами и стилями. Третья - разное содержимое для краулера и для человека; это нарушение первого из трех прав, которые есть у краулера, права читать то же, что видит пользователь. Четвертая - несогласованность каналов, когда раздел закрыт в robots.txt, но перечислен в карте сайта.
Логи сервера показывают правду, которую не покажет ни один валидатор. Смотреть в них нужно три вещи: имя краулера, адрес страницы, код ответа.
Нормальная картина выглядит странно для тех, кто видит ее впервые. Краулер скачивает страницу заново на каждое цитирование, поэтому десятки тысяч обращений к одним и тем же двадцати страницам за квартал - штатная работа, а не сбой и не атака. В отдельные дни объем обращений от краулеров моделей сравнивается с объемом от Googlebot.
Коды ответа читаются так:
Частота обращений говорит о состоянии сайта не меньше, чем сами коды. Ровный поток к разделу и полное молчание по соседнему означают, что до второго краулер не дошел: либо на него нет внутренних ссылок, либо он лежит слишком глубоко в структуре. Резкий обрыв после спокойного месяца указывает на изменение настроек защиты, а не на потерю интереса со стороны платформы. Смотреть логи имеет смысл окном в две недели: за меньший период картина складывается из случайных колебаний.
Проверка со стороны занимает минуту: попросите модель открыть конкретный адрес на вашем сайте и пересказать содержимое страницы. Отказ или пересказ невпопад означает, что до страницы бот не добрался. Дальше по списку: сервис защиты, ускорители, расширения безопасности.
Сервисы отслеживания краулеров ведут больше двух десятков имен и показывают частоту обращений по каждому; обзор такого набора инструментов - в отдельном материале про обзор сервисов мониторинга краулеров. Полная процедура замера с упоминаниями и конкурентами описана там, где разбирается как снять полный замер AI-видимости.
Ритм проверки: после каждой правки настроек защиты и раз в квартал плановая сверка. На клиентских проектах с проверки доступности начинается работа в HITZ Agency - до нее остальные работы по видимости смысла не имеют, потому что улучшать нечего, пока краулер не доходит. Если бот доходит, а сайта в ответах нет, дело в рендеринге, скорости и структуре страницы.
На части конструкторов robots.txt не редактируется вообще, на другой части - редактируется частично. Правится он в разделе настроек сайта, а не в корне домена по FTP, и найти его получается не сразу.
Шаблоны приносят чужие настройки. Стандартные оформления магазинов часто закрывают краулеров моделей правилами, которые автор темы написал два года назад под другую задачу. Устаревшие наборы правил для SEO закрывают GPTBot и Google-Extended по умолчанию, потому что писались в момент, когда эти имена считались угрозой.
Типовая находка на конструкторах - остаточные запреты от страниц, которые когда-то стояли черновиками со скрытым адресом. Страницу опубликовали, а строка `Disallow` в файле осталась. Разбор с панелью конструктора на рабочем проекте - в материале про то, как это выглядит на конструкторе и где прячется блокировка.
Есть и вторая помеха, не связанная с файлом. Краулеры моделей идут по ссылкам вглубь примерно до пятого уровня вложенности. Структура разделов, где статья лежит на седьмом уровне от главной, теряет часть страниц независимо от того, что написано в robots.txt.
Если файл недоступен для правки, остаются три пути: настройки на уровне домена, правила сервиса доставки контента перед сайтом, обращение в поддержку площадки. Последний вариант работает медленно, но у крупных конструкторов такие запросы обрабатываются.
Отдельно проверьте, что отдается по адресу файла после публикации изменений. Конструкторы кешируют содержимое, и правка, сохраненная в панели, попадает на боевой домен через несколько минут или через сутки - зависит от площадки и тарифа. Пока старая версия висит в кеше, краулер читает старые правила, а вы считаете вопрос закрытым.
Добавьте в файл отдельный блок с именем бота и разрешением: строка `User-agent: GPTBot`, следом `Allow: /`. Рядом стоит открыть OAI-SearchBot и ChatGPT-User - без них сайт остается вне поиска внутри ChatGPT, даже когда GPTBot разрешен. После правки проверьте, что общий блок `User-agent: *` не закрывает те же адреса ниже по файлу: порядок правил имеет значение.
Для сайта услуг, магазина и локального бизнеса блокировка вредит: сайт пропадает из ответов платформ, а материалы все равно расходятся через пересказы и агрегаторы. Запрет оправдан, когда содержимое сайта составляет продукт: собственные исследования, базы, материалы за оплатой доступа. В таком случае закрывают краулеров обучения и оставляют открытыми краулеров выдачи.
Минимальный набор для присутствия в ответах: OAI-SearchBot и ChatGPT-User для ChatGPT, Claude-SearchBot и Claude-User для Claude, PerplexityBot для Perplexity, Google-Extended для AI Overviews и Gemini, Bingbot для индекса, на который опирается поиск ChatGPT. Обучающие GPTBot, ClaudeBot и CCBot открываются по выбору владельца: они дают присутствие в самих моделях, но не приносят ссылок.
Googlebot собирает страницы для обычного поиска Google, Google-Extended отвечает за обучение моделей и генеративные ответы. Запрет Google-Extended сохраняет позиции в обычной выдаче, но убирает сайт из AI Overviews и ответов Gemini. Запрет Googlebot убирает сайт из поиска целиком. Владельцы часто закрывают первый, думая, что защищают материалы, и теряют самую массовую AI-поверхность.
Запрет стоит выше уровня файла. Проверять нужно панель сервиса защиты, где блокировка краулеров моделей включается по умолчанию, правила брандмауэра приложения, ограничения хостинга и модули безопасности движка сайта. Вторая по частоте причина - медленный ответ сервера: если страница отдается слишком долго, платформа обрывает соединение и берет другой источник.
Откройте логи сервера и найдите строки с именами OAI-SearchBot, ChatGPT-User и GPTBot. Рядом с именем стоит код ответа: 200 означает, что страница отдана, 403 - что бот получил отказ от защиты, 499 - что он не дождался ответа. Быстрая проверка без логов: попросите модель открыть конкретный адрес вашего сайта и пересказать содержимое страницы.