Доступ для ботов
Самый частый диагноз при аудите: сайт невидим для нейросетей не из-за контента, а потому что роботов блокируют на уровне robots.txt или фаервола. Начинаем с этого.
🎯 Тема урока
Доступ для ИИ-ботов: кого пускать и как проверить
1. Три категории ИИ-краулеров
Роботы нейросетей решают разные задачи, и путать их не стоит.
| Категория | Кто | Что делает |
|---|---|---|
| Тренировочные | GPTBot, ClaudeBot | Собирают данные для обучения будущих версий моделей |
| Поисковые | OAI-SearchBot, PerplexityBot, поисковый бот Anthropic, Google-Extended | Наполняют оперативный индекс, из которого генерируются ответы в реальном времени |
| Пользовательские ассистенты | ChatGPT-User | Заходят на страницу в момент, когда человек в чате просит ИИ открыть конкретный URL |
Google-Extended — ключ к Gemini и AI Overviews.2. Настройка robots.txt
Главная ошибка — блокировать неизвестных роботов «по умолчанию» правилом Disallow: / для всех, кроме Яндекса и Google. Для нейросетей ваш сайт после этого просто перестаёт существовать.
Правильный подход: явные разрешающие директивы для ИИ-ботов на разделы с каталогом и статьями.
User-agent: GPTBot
Allow: /catalog/
Allow: /blog/
Disallow: /search/
Disallow: /cart/
Disallow: /personal/
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /
Sitemap: https://example.com/sitemap.xmlЭкономия краулингового бюджета. Роботы нейросетей обходят сайты реже и менее дотошно, чем классические поисковики. Закройте от обхода системный мусор, чтобы они тратили ресурс на полезные страницы:
- страницы результатов внутреннего поиска;
- корзину, оформление заказа, личный кабинет;
- админку и служебные разделы;
- страницы сортировки и постраничные дубли.
Заодно уберите устаревшие директивы — например, Host, которую Яндекс давно не учитывает.
3. Файл llms.txt
llms.txt — текстовый файл в корне сайта с кратким описанием компании для ИИ-агентов и ссылками на ключевые разделы с пояснениями.
# Название компании
> Одно-два предложения: чем занимается компания, для кого, с какого года.
## Услуги
- [Аудит сайта](https://example.com/audit/): что входит, сроки, стоимость от 5 000 ₽.
- [Продвижение](https://example.com/seo/): работы, отчётность, срок первых результатов.
## Экспертиза
- [Блог](https://example.com/blog/): статьи по SEO, AEO и GEO.
## Контакты
- Адрес, телефон, email — в точности как в Яндекс.Бизнесе и на сайте.4. Блокировки на уровне хостинга и CDN
Вторая по частоте причина невидимости. В Cloudflare и подобных сервисах защита от ИИ-скрейперов может быть включена по умолчанию — и никакие настройки robots.txt на это не влияют, потому что бот не доходит до файла.
Что проверить:
- Настройки WAF / Bot Fight Mode / «Block AI Scrapers» в панели CDN — внесите нужных роботов в белый список.
- Правила на уровне хостинга и nginx: блокировки по User-Agent, ограничения rate limit.
- Капчу и «Under Attack Mode» — они полностью отсекают краулеров.
- Логи сервера: приходят ли к вам
GPTBot,OAI-SearchBot,PerplexityBotвообще.
Простая проверка из консоли:
grep -Ei "GPTBot|OAI-SearchBot|PerplexityBot|ClaudeBot|Google-Extended" access.log | tail -50Пусто за неделю — значит, вы заблокированы, а не «не понравились алгоритму».
5. Редиректы: строго в один шаг
Боты нейросетей нетерпеливы. Цепочка из трёх и более последовательных перенаправлений приводит к тому, что робот бросает обход и не индексирует целевую страницу.
Плохо: http://site.ru → https://site.ru → https://www.site.ru → https://www.site.ru/page/
Правильно: любая исходная точка ведёт на конечный адрес за один переход.
Проверьте цепочки командой:
curl -sIL http://example.com/old-page | grep -E "HTTP/|location:"6. Чек-лист урока
- В robots.txt есть явные
Allowдля GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, ClaudeBot, Google-Extended. - Закрыт системный мусор: поиск, корзина, кабинет, админка.
- В Cloudflare/хостинге ИИ-боты не блокируются фаерволом.
- В логах видны визиты ИИ-краулеров.
- Все редиректы ведут на цель за один шаг.
- Создан llms.txt в корне сайта.
🧭 Что дальше?
Робот зашёл. Теперь научим его понимать смысл блоков на странице — переходим к микроразметке.