Доступ для ботов

Самый частый диагноз при аудите: сайт невидим для нейросетей не из-за контента, а потому что роботов блокируют на уровне robots.txt или фаервола. Начинаем с этого.

🎯 Тема урока

Доступ для ИИ-ботов: кого пускать и как проверить

1. Три категории ИИ-краулеров

Роботы нейросетей решают разные задачи, и путать их не стоит.

КатегорияКтоЧто делает
ТренировочныеGPTBot, ClaudeBotСобирают данные для обучения будущих версий моделей
ПоисковыеOAI-SearchBot, PerplexityBot, поисковый бот Anthropic, Google-ExtendedНаполняют оперативный индекс, из которого генерируются ответы в реальном времени
Пользовательские ассистентыChatGPT-UserЗаходят на страницу в момент, когда человек в чате просит ИИ открыть конкретный URL
Что важнее для бизнеса. Поисковые боты дают результат здесь и сейчас — именно они формируют пул кандидатов для RAG. Тренировочные работают на далёкую перспективу (попадание в веса модели). Google-Extended — ключ к Gemini и AI Overviews.

2. Настройка robots.txt

Главная ошибка — блокировать неизвестных роботов «по умолчанию» правилом Disallow: / для всех, кроме Яндекса и Google. Для нейросетей ваш сайт после этого просто перестаёт существовать.

Правильный подход: явные разрешающие директивы для ИИ-ботов на разделы с каталогом и статьями.

User-agent: GPTBot
Allow: /catalog/
Allow: /blog/
Disallow: /search/
Disallow: /cart/
Disallow: /personal/

User-agent: OAI-SearchBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Google-Extended
Allow: /

Sitemap: https://example.com/sitemap.xml

Экономия краулингового бюджета. Роботы нейросетей обходят сайты реже и менее дотошно, чем классические поисковики. Закройте от обхода системный мусор, чтобы они тратили ресурс на полезные страницы:

  • страницы результатов внутреннего поиска;
  • корзину, оформление заказа, личный кабинет;
  • админку и служебные разделы;
  • страницы сортировки и постраничные дубли.

Заодно уберите устаревшие директивы — например, Host, которую Яндекс давно не учитывает.

3. Файл llms.txt

llms.txt — текстовый файл в корне сайта с кратким описанием компании для ИИ-агентов и ссылками на ключевые разделы с пояснениями.

# Название компании

> Одно-два предложения: чем занимается компания, для кого, с какого года.

## Услуги
- [Аудит сайта](https://example.com/audit/): что входит, сроки, стоимость от 5 000 ₽.
- [Продвижение](https://example.com/seo/): работы, отчётность, срок первых результатов.

## Экспертиза
- [Блог](https://example.com/blog/): статьи по SEO, AEO и GEO.

## Контакты
- Адрес, телефон, email — в точности как в Яндекс.Бизнесе и на сайте.
Честно о статусе: llms.txt пока не является общепринятым стандартом, и гарантий его учёта нет. Но файл делается примерно за 20 минут, вреда не наносит и позволяет подготовиться к изменениям раньше конкурентов. Делайте, но не считайте его волшебной кнопкой.

4. Блокировки на уровне хостинга и CDN

Вторая по частоте причина невидимости. В Cloudflare и подобных сервисах защита от ИИ-скрейперов может быть включена по умолчанию — и никакие настройки robots.txt на это не влияют, потому что бот не доходит до файла.

Что проверить:

  1. Настройки WAF / Bot Fight Mode / «Block AI Scrapers» в панели CDN — внесите нужных роботов в белый список.
  2. Правила на уровне хостинга и nginx: блокировки по User-Agent, ограничения rate limit.
  3. Капчу и «Under Attack Mode» — они полностью отсекают краулеров.
  4. Логи сервера: приходят ли к вам GPTBot, OAI-SearchBot, PerplexityBot вообще.

Простая проверка из консоли:

grep -Ei "GPTBot|OAI-SearchBot|PerplexityBot|ClaudeBot|Google-Extended" access.log | tail -50

Пусто за неделю — значит, вы заблокированы, а не «не понравились алгоритму».

5. Редиректы: строго в один шаг

Боты нейросетей нетерпеливы. Цепочка из трёх и более последовательных перенаправлений приводит к тому, что робот бросает обход и не индексирует целевую страницу.

Плохо: http://site.ruhttps://site.ruhttps://www.site.ruhttps://www.site.ru/page/

Правильно: любая исходная точка ведёт на конечный адрес за один переход.

Проверьте цепочки командой:

curl -sIL http://example.com/old-page | grep -E "HTTP/|location:"

6. Чек-лист урока

  • В robots.txt есть явные Allow для GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, ClaudeBot, Google-Extended.
  • Закрыт системный мусор: поиск, корзина, кабинет, админка.
  • В Cloudflare/хостинге ИИ-боты не блокируются фаерволом.
  • В логах видны визиты ИИ-краулеров.
  • Все редиректы ведут на цель за один шаг.
  • Создан llms.txt в корне сайта.

🧭 Что дальше?

Робот зашёл. Теперь научим его понимать смысл блоков на странице — переходим к микроразметке.