Краулеры-пауки атакуют светящийся защитный щит с надписью robots.txt disallow для блокировки ИИ-ботов.

Робот GPTBot: Как остановить массовое скачивание сайта нейросетью OpenAI

Если в отчетах аналитики или логах сервера вы обнаружили массовые посещения от юзер-агента GPTBot, это значит, что на ваш сайт пришел глобальный обучающий краулер компании OpenAI.

В отличие от точечного робота ChatGPT-User, который ищет информацию под конкретные сиюминутные вопросы пользователей в реальном времени, GPTBot работает как промышленный пылесос. Он планомерно, страница за страницей, выкачивает терабайты данных из интернета, чтобы скармливать их в базы данных для обучения будущих моделей искусственного интеллекта (GPT-5 и следующих поколений).

Стоит ли блокировать GPTBot?

Этот бот не приносит вашему сайту вообще ни одного клика, перехода или показа. Он просто бесплатно забирает ваш уникальный контент, чтобы сделать коммерческий продукт OpenAI умнее. При этом на крупных контентных проектах интенсивный парсинг от GPTBot может создавать ощутимую нагрузку на хостинг и процессор сервера.

Большинство крупных мировых медиаплатформ и независимых блогов предпочитают жестко закрывать от него доступ.

Как заблокировать GPTBot: Инструкция

Закрыть сайт от этого краулера можно стандартной директивой. Добавьте следующие строчки в ваш файл robots.txt

User-agent: GPTBot
Disallow: /

Если бот игнорирует правила или вы хотите заблокировать его на уровне сетевого экрана, используйте правила Cloudflare WAF. Настраивайте их аккуратно, чтобы избежать ложных срабатываний Cloudflare WAF, и блокируйте запросы только по точному совпадению User-Agent.

  1. Компания-владелец: OpenAI
  2. Полный User-Agent:Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; GPTBot/1.2; +https://openai.com)
  3. Тип робота: Обучающий краулер (LLM Training)
  4. Код для robots.txt:textUser-agent: GPTBot Disallow: /

Прокрутить вверх