Сайты можно будет скрывать от нейросетей*
*или нет
Новость про новый инструмент от Cloudflare, который должен позволить скрывать контент своего сайта от обучающих ИИ-ботов, перепостили уже многие, а прокомментировать по делу почему-то никто не взялся. А тема важная — и, что показательно, не новая: я эти разговоры слышал ещё года полтора назад, когда все носились с форматом llms.txt (файл, которым сайт просил обучающих ботов не трогать его тексты). Работать он так толком и не начал, но сам запрос был понятен уже тогда: авторы не хотят бесплатно "кормить" нейросети своим трудом.
Почему поиск блокирует меньше 1%, а обучение — 17%
Эта пара цифр — оценка самого Cloudflare:
Одно дело, когда тебя нашёл поисковый бот и потом процитировал — в выдаче или в ИИ-ответе, но со ссылкой на твой сайт. Это трафик, а трафик бизнесу нужен как воздух: вся монетизация живёт на площадке — реклама, подписки, свои продукты, партнёрские ссылки. Для любой модели заработка нужен свой трафик. Поэтому индексацию режет меньше 1% сайтов: блокировать поиск — значит резать себе выручку.
Совсем другое дело, когда модель поглотила твой материал и вываливает всю фактуру и выводы прямо в окне ответа. Может, автора и упомянет — но без ссылки, без перехода. Просто "есть такое мнение". И всё, над чем ты пыжился-мурыжился — собирал по крупицам многолетний опыт, чтобы поделиться и заработать, — модель отдаёт даром. Отсюда 17%, которые уже блокируют обучение: это те, кто очень захотел и нашёл неочевидный способ. Дальше будет только больше.
Кто на самом деле тормозил рынок
Самое интересное: мешали не издатели, а провайдеры ИИ-моделей. Им нужно обучать модели на свежем человеческом контенте — без него модели деградируют, и быстро. Это уже видно: сеть заваливает сгенерированным контентом, и модели всё чаще учатся на трижды пересказанных идеях.
Отсюда парадокс. Одной рукой ИИ-компании хотят всё больше живого человеческого текста. Другой рукой те же провайдеры обязаны придумать механизм, который устроит издателей: пустить поискового бота и не пустить обучающего. llms.txt должен был это закрыть, но не закрыл — половина игроков просто не стала его поддерживать.
Что изменил Cloudflare и в чём здесь бизнес-урок
За Cloudflare стоит больше 20% сайтов по всему миру. Компания заявляет, что договорилась с большинством крупных провайдеров: те делят ботов на поисковых и обучающих и соблюдают запрет. Google и Apple уже под критерии подходят, Microsoft обещает подтянуться в начале 2027-го. Для владельца сайта это один переключатель: поиск оставить, обучение закрыть.
Главный вывод для бизнеса — не про технологию. Cloudflare решил удовлетворить потребность, которая на рынке всё заметнее и будет только расти. Нейровыдача меняет не только методы продвижения, но и сами паттерны поискового поведения людей, а значит, запрос "пускать в поиск, но не в обучение" будет звучать всё громче. Разрыв 17% против 1% — это спрос, который существовал всегда, просто без инструмента люди городили обходные пути. Кто умеет читать такие разрывы в цифрах, тот и находит следующий продукт раньше конкурентов.
Почему я не жду, что это сработает как надо
Разделить ботов на стороне сайта нельзя в принципе: один и тот же бот заходит сразу с двумя задачами — и поиск формирует, и модель обучает. Ни по названию, ни по IP их не растащить. Значит, всё держится на честном слове провайдеров, а проверить исполнение издателю нечем.
Но главная дыра глубже. Контент утягивают не только модели — его массово тащат парсеры, которые бесплатно перепубликуют текст у себя. Я как автор сталкиваюсь с этим постоянно: каждая публикация всплывает на трёх-пяти-десяти чужих сайтах. Будут ли те сайты закрываться от обучения? Скорее всего нет. Модель не возьмёт мой материал с моего домена — возьмёт с чужого.
Куда движется рынок
Вектор при этом верный. Недавно Google начал платить издателям за использование их контента в ответах нейросетей — пока в тесте, но это по сути тот же разговор — рынок пытается нащупать баланс: без живого человеческого текста модели тупеют, а человеку должно быть выгодно этот текст отдавать.
Моделям нужен тот, кому есть что сказать; на пересказе пересказов они задыхаются. В сухом остатке ценность должна остаться у авторов, способных передавать смысл, опыт и фактуру, а не у контент-мельниц.
Что делать сейчас: не бежать блокировать всё подряд, а трезво посмотреть, есть ли у вашего контента та самая ценность, ради которой его вообще стоит защищать. Пишу об этом в своём канале — там же разбираю, как перестроить продвижение под нейровыдачу.