Робот паук сканирует серверную комнату перед светящимся неоновым знаком ROBOTS.TXT

Слив чатов Claude в Google: почему директива Disallow в robots.txt не заменяет Noindex

В открытом поиске Google массово появились ссылки на личные диалоги пользователей с искусственным интеллектом Claude от компании Anthropic. В выдачу утекли сотни публичных страниц (site:claude.ai/share), содержащие конфиденциальные данные: от медицинских карт и юридических контрактов до приватных API-ключей. Причиной масштабного инцидента стала фундаментальная техническая ошибка инженеров Anthropic в понимании базовой логики работы поисковых роботов.

В чем заключалась ошибка Anthropic

Разработчики Claude планировали защитить раздел со сгенерированными ссылками на чаты (/share/*) от попадания в поисковую выдачу. Для этого они применили стандартное, на первый взгляд, решение:

  1. Занесли директорию /share/ в файл robots.txt с запрещающей директивой Disallow.
  2. Одновременно с этим на самих страницах чатов прописали метатег noindex и настроили отдачу HTTP-заголовка X-Robots-Tag: noindex.

Такой подход полностью провалился из-за базовых алгоритмов сканирования. Директива Disallow в файле robots.txt жестко запрещает роботу Googlebot скачивать и считывать исходный код страницы. Поисковый краулер послушно следовал этому правилу и просто физически не мог зайти на закрытые URL-адреса, чтобы прочесть установленный там запрещающий тег noindex.

Как страницы попали в индекс без сканирования

Хотя Googlebot не заходил внутрь страниц, он зафиксировал их существование. Пользователи Claude активно делились сгенерированными ссылками на сторонних публичных ресурсах, форумах и в репозиториях.

Когда алгоритмы Google обнаруживают прямые внешние ссылки на закрытый в robots.txt URL, они все равно заносят его в индекс поисковой системы. Поисковик понимает, что страница существует и на нее ссылаются люди, но отображает ее в выдаче без текстового сниппета, основываясь исключительно на анкорах внешних ссылок и самом адресе URL. В итоге закрытые файлы стали доступны любому желающему через операторы поиска.

Главный урок технического SEO

Этот случай наглядно доказывает старое правило веб-мастеринга: robots.txt управляет только сканированием, но не индексацией.

Если страницу или целый раздел необходимо гарантированно скрыть из поиска, их категорически нельзя блокировать через Disallow в robots.txt. Робот должен иметь беспрепятственный доступ к URL-адресу, чтобы зайти на страницу, считать код и корректно отработать метатег noindex либо заголовок ответа сервера X-Robots-Tag.

Прокрутить вверх