Появление ИИ-ответов (AI Overviews) в поисковой выдаче изменило структуру органического трафика. Нейросети парсят уникальный контент сайтов, компилируют его и выводят готовый ответ прямо на странице поиска. Из-за этого растет доля кликов «впустую» (Zero-Click Searches) — пользователи получают информацию из веб-документа, но не переходят на сам ресурс. Владельцы площадок теряют просмотры и рекламный доход, оставаясь бесплатными донорами данных для технологических корпораций.
Единственный способ защитить свою интеллектуальную собственность — ограничить доступ ИИ-сканеров к коду сайта. В этой статье мы разберем, как технически заблокировать ИИ-краулеров на уровне директив robots.txt и HTML-тегов, сохранив при этом позиции сайта в классической поисковой выдаче.
Главное правило: Разделяйте ИИ-роботов и поисковых ботов
Главная ошибка веб-мастеров при попытке закрыться от ИИ — использование радикальной директивы User-agent: * с полным запретом индексации. Это мгновенно выкинет сайт из классического поиска Google и Яндекс, полностью обнулив органический трафик.
Для защиты контента от нейросетей необходимо блокировать строго определенные юзер-агенты (User-Agents). Поисковые системы разделяют краулеров, которые собирают данные для обучения ИИ, и роботов, отвечающих за классический поиск.
Самые распространенные ИИ-агенты:
- Google-Extended: Специальный робот Google. Он не участвует в обычном поиске, а собирает тексты для обучения моделей Gemini.
- GPTBot: Официальный краулер компании OpenAI. Используется для парсинга контента под будущие модели ChatGPT (включая GPT-5).
- ClaudeBot: Робот от компании Anthropic, собирающий данные для языковых моделей Claude.
- CommonCrawl: Независимый открытый веб-архив, базы которого массово скачивают и используют для обучения практически все создатели коммерческих нейросетей.
Настройка robots.txt: Готовые листинги кода
Файл robots.txt находится в корневой директории вашего сайта. Для блокировки ИИ-краулеров откройте этот файл и добавьте в него следующие конфигурации.
Блокировка обучения ИИ от Google (Gemini)
Чтобы запретить Google использовать контент вашего сайта для обучения Gemini, пропишите следующую директиву:
User-agent: Google-Extended
Disallow: /
Важно: Блокировка Google-Extended никак не влияет на позиции сайта в поиске Google. Робот Googlebot по-прежнему будет заходить на страницы, индексировать их и выводить сайт в органическую выдачу.
Тотальный бан всех ключевых ИИ-скраперов
Для комплексной защиты от кражи контента всеми популярными нейросетями добавьте в файл общий блок запретов:
# Блокировка обучения Google Gemini
User-agent: Google-Extended
Disallow: /
# Блокировка обучения OpenAI ChatGPT
User-agent: GPTBot
Disallow: /
# Блокировка обучения Anthropic Claude
User-agent: ClaudeBot
Disallow: /
# Блокировка общего ИИ-архива
User-agent: CCBot
Disallow: /
Наш бесплатный генератор robots txt поможет за пару кликов создать правильный файл конфигурации для вашего сайта. Инструмент универсален: просто введите домен, выберите систему управления (WordPress, OpenCart, Битрикс или другую CMS) — и сервис сам предложит оптимальные настройки.
После изменения файла обязательно проверьте корректность его синтаксиса в панели Google Search Console (вкладка «Инструмент проверки файла robots.txt»).
Локальная защита контента: Атрибуты nosnippet и data-nosnippet
Метод с robots.txt работает на уровне целых страниц или разделов сайта. Однако, если вы хотите оставить страницу доступной для ИИ, но защитить от копирования конкретные элементы (например, коммерческий прайс-лист, уникальную формулу или авторский вывод), необходимо использовать микрохирургию HTML-кода.
Глобальный запрет на вывод сниппетов
Если вы добавите в блок <head> страницы следующий метатег:
<meta name="googlebot" content="nosnippet">
Google потеряет право выводить текстовые фрагменты (сниппеты) вашего сайта как в обычной выдаче, так и в ИИ-блоках AI Overviews. Обратная сторона метода — в поиске останется только голая ссылка на сайт, что сильно снизит кликабельность (CTR).
Точечная защита через data-nosnippet
Для защиты конкретных кусков контента используйте HTML-атрибут data-nosnippet. Оберните важный текст в тег div, span или section с этим атрибутом:
<div data-nosnippet>
<!-- Этот текст ИИ-краулер Google полностью проигнорирует -->
Уникальная авторская методика SEO-продвижения, цена которой составляет 50 000 рублей.
</div>
Обычный пользователь увидит этот текст на сайте, но роботы Google не смогут скопировать его для генерации быстрого ответа в выдаче.
⚠️ Внимание, апдейт 2026 года! Инструкция выше отлично блокирует стандартного робота GPTBot. Однако OpenAI запустила краулер реального времени ChatGPT-User, который официально игнорирует любые директивы в robots.txt. Если вам нужно защитить приватные разделы и от него, читайте наше новое руководство по блокировке ChatGPT-User на уровне сервера Apache и Nginx.
Упадут ли позиции сайта в поиске Google после блокировки Google-Extended?
Нет. Google официально заявляет, что блокировка юзер-агента Google-Extended влияет исключительно на обучение моделей Gemini и формирование блоков AI Overviews. На ранжирование страниц в стандартном органическом поиске этот запрет влияния не оказывает.
Защитит ли robots.txt от краулера PerplexityBot?
Ответ: Нет. Сервисы вроде Perplexity используют поисковых роботов реального времени (PerplexityBot). Если заблокировать их, сайт перестанет получать трафик из ответов ИИ-поисковиков. Если ваша цель — получать переходы из чат-ботов, роботов реального времени блокировать нельзя.
Помогают ли от скрапинга новые форматы файлов вроде ai.txt?
На данный момент инициативы по внедрению отдельных файлов для ИИ (ai.txt) носят неофициальный характер. Крупные корпорации, включая Google и OpenAI, ориентируются исключительно на стандартные директивы в файле robots.txt и метатеги в HTML-коде страницы.












