В открытом поиске Google массово появились ссылки на личные диалоги пользователей с искусственным интеллектом Claude от компании Anthropic. В выдачу утекли сотни публичных страниц (site:claude.ai/share), содержащие конфиденциальные данные: от медицинских карт и юридических контрактов до приватных API-ключей. Причиной масштабного инцидента стала фундаментальная техническая ошибка инженеров Anthropic в понимании базовой логики работы поисковых роботов.
В чем заключалась ошибка Anthropic
Разработчики Claude планировали защитить раздел со сгенерированными ссылками на чаты (/share/*) от попадания в поисковую выдачу. Для этого они применили стандартное, на первый взгляд, решение:
- Занесли директорию
/share/в файл robots.txt с запрещающей директивойDisallow. - Одновременно с этим на самих страницах чатов прописали метатег
noindexи настроили отдачу HTTP-заголовкаX-Robots-Tag: noindex.
Такой подход полностью провалился из-за базовых алгоритмов сканирования. Директива Disallow в файле robots.txt жестко запрещает роботу Googlebot скачивать и считывать исходный код страницы. Поисковый краулер послушно следовал этому правилу и просто физически не мог зайти на закрытые URL-адреса, чтобы прочесть установленный там запрещающий тег noindex.
Как страницы попали в индекс без сканирования
Хотя Googlebot не заходил внутрь страниц, он зафиксировал их существование. Пользователи Claude активно делились сгенерированными ссылками на сторонних публичных ресурсах, форумах и в репозиториях.
Когда алгоритмы Google обнаруживают прямые внешние ссылки на закрытый в robots.txt URL, они все равно заносят его в индекс поисковой системы. Поисковик понимает, что страница существует и на нее ссылаются люди, но отображает ее в выдаче без текстового сниппета, основываясь исключительно на анкорах внешних ссылок и самом адресе URL. В итоге закрытые файлы стали доступны любому желающему через операторы поиска.
Главный урок технического SEO
Этот случай наглядно доказывает старое правило веб-мастеринга: robots.txt управляет только сканированием, но не индексацией.
Если страницу или целый раздел необходимо гарантированно скрыть из поиска, их категорически нельзя блокировать через Disallow в robots.txt. Робот должен иметь беспрепятственный доступ к URL-адресу, чтобы зайти на страницу, считать код и корректно отработать метатег noindex либо заголовок ответа сервера X-Robots-Tag.












