BotBan

ИИ-краулеры на сайте: GPTBot, ClaudeBot и другие

Новый класс роботов, про который два года назад никто не думал. Кто это такие, чем отличаются от поисковиков и что даёт решение их закрыть.

3 мин чтения

За последние пару лет к привычным поисковым роботам добавился новый класс: краулеры, собирающие тексты для обучения языковых моделей и для ответов в чат-ботах.

Кто ходит

GPTBot — сбор данных для обучения моделей OpenAI. ChatGPT-User — обращение, когда пользователь чата просит открыть конкретную ссылку. ClaudeBot и anthropic-ai — краулеры Anthropic. PerplexityBot — поисковый сервис с ответами. Google-Extended — не отдельный робот, а признак: закрыв его в robots.txt, вы отказываетесь от использования сайта в обучении моделей Google, не теряя обычную индексацию. Bytespider — краулер ByteDance, известен агрессивностью. CCBot — Common Crawl, открытый архив, на котором обучаются многие.

Чем они отличаются от поисковых

Поисковый робот приносит вам трафик: он индексирует страницу, и человек приходит по ссылке. Обмен понятен — вы отдаёте контент, получаете посетителей.

С ИИ-краулерами обмен другой. Модель, обученная на вашем тексте, ответит человеку сама. Ссылка при этом может не появиться вовсе, а если появится, переход по ней происходит редко.

Отдельная разница: интенсивность. Некоторые из них обходят сайты заметно агрессивнее поисковиков, создавая нагрузку, несоизмеримую с отдачей.

Стоит ли закрывать

Однозначного ответа нет, и он зависит от того, чем вы живёте.

Закрывать имеет смысл, если контент — ваш основной актив: медиа, справочники, обучающие материалы, базы отзывов. Вы вложились в тексты, а получаете нагрузку без посетителей.

Не закрывать имеет смысл, если вы продаёте товар или услугу. Упоминание вашего магазина в ответе чат-бота — это то же, что упоминание в статье: оно работает на узнаваемость. Терять его ради экономии трафика странно.

Промежуточный вариант: закрыть обучающие краулеры и оставить те, что ходят по прямой просьбе пользователя. ChatGPT-User приходит потому, что человек прямо сейчас попросил открыть вашу ссылку — это фактически посетитель.

Как закрыть

Через robots.txt — если краулер его соблюдает, а крупные соблюдают:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: CCBot
Disallow: /

Оговорка та же, что и всегда: это просьба. Кто её не соблюдает — не остановится.

Как отличить настоящего от подделки

Прикрыться именем известного краулера — старый приём: авось пропустят как «полезного робота». Проверять надо не строку User-Agent, а принадлежность адреса.

Крупные операторы публикуют диапазоны своих адресов, а часть поддерживает обратный DNS: адрес резолвится в имя в их зоне, а имя — обратно в тот же адрес. Если проверка не сходится, перед вами не краулер, а кто-то, кто им представился, — и это довод против него, а не за.

Что стоит решить заранее

Не «блокировать или нет», а знать, сколько их у вас. Часто оказывается, что доля ИИ-краулеров в трафике измеряется процентами и решать нечего. А иногда — что один из них даёт больше запросов, чем все живые посетители вместе.

Посмотреть на цифры дешевле, чем спорить о принципах.

Читайте также