Почему невидимая маркировка текста от OpenAI это теперь вопрос к маркетингу, а не к юристам
5 октября OpenAI рассказала, как собирается закрывать требования ЕС к происхождению сгенерированного текста. Коротко: в тексты встраивается система textGrain, невидимые машинно-читаемые сигналы, по которым можно определить, что фрагмент сгенерирован моделью. Там, где применение маркировки обязательным не является, API-клиентам она доступна по согласию, то есть включается самим клиентом. Отдельно компания предупреждает, что детекция не является абсолютным доказательством авторства.
Новость выглядит как юридическая, но последствия у неё в первую очередь редакционные. Разберу, что меняется для контента бренда и что из этого можно проверить у себя на этой неделе.
Что именно изменилось
Раньше вопрос «это писала нейросеть или человек» решался внешними детекторами: сторонний сервис оценивал текст по косвенным признакам и выдавал вероятность. Работало это так себе, ошибалось в обе стороны, и ни одна площадка не принимала такой вывод как доказательство.
Теперь сигнал появляется не снаружи, а внутри: его ставит сама модель в момент генерации. Это другой уровень надёжности и, что важнее для редакции, другой уровень неизбежности.
- Маркировка перестаёт быть добровольной практикой площадок и становится частью инфраструктуры моделей.
- Проверка смещается от «похоже на AI» к «есть сигнал происхождения или нет».
- Решение о маркировке принимает не автор текста, а поставщик модели и регуляторный контур, в котором тот работает.
Почему это не разовая история одной компании
OpenAI здесь не первая и точно не последняя. Google давно развивает SynthID для своих генеративных продуктов, индустриальный стандарт C2PA с метаданными о происхождении файла поддерживают и Midjourney, и часть крупных платформ. У Anthropic, Perplexity и xAI публичных текстовых водяных знаков такого рода на сегодня нет, но направление общее: происхождение контента становится техническим атрибутом, а не декларацией в футере.
Для бренда это означает следующее: политику «AI-черновик, человек доработал» придётся описывать не на уровне ценностей компании, а на уровне процесса, где видно, в какой момент текст вышел из модели и что с ним делали дальше.
Маркировка AI-контента перестала быть этической рекомендацией и стала частью технической инфраструктуры самих моделей.
Чего маркировка не делает
Здесь есть одна проблема, и OpenAI о ней говорит прямо. Наличие сигнала не равно доказательству авторства, а отсутствие сигнала не равно тому, что текст написал человек.
- Сигнал может не пережить переписывание: перевод, пересборку абзацев, сокращение втрое.
- Текст мог быть сгенерирован моделью без маркировки или до её включения.
- Сигнал говорит о происхождении фрагмента, но ничего не говорит о качестве, достоверности и о том, проверял ли кто-то факты.
Поэтому любые внутренние регламенты в духе «если детектор показал AI, снимаем с публикации» ломаются о первую же ложную сработку. Разумнее привязываться к процессу, а не к вердикту детектора.
Что меняется в работе с контентом
Тексты, которые вы публикуете сами
На практике это выглядит так: у площадок появляется техническая возможность отличать сгенерированные материалы массово и дёшево. Дальше это их решение, что с этим делать, и варианты понятны заранее: пометка в интерфейсе, понижение в ленте, отдельные правила для рекламных форматов. Угадывать политику конкретной площадки смысла нет, но закладывать в план, что она появится, уже стоит.
Практический вывод: ценность чистой генерации под объём падает дальше. Выигрывает контент, который модель в принципе не может произвести, то есть ваши данные, ваши замеры, ваши клиентские случаи и цифры, которых нет в обучающей выборке.
Тексты, которые читают нейросети
Если смотреть на это через GEO, вопрос звучит иначе: как наличие сигнала происхождения повлияет на то, какие источники ассистенты берут в ответы. Публичных правил на этот счёт сейчас ни у кого нет, и выдумывать их я не буду. Но сам факт, что происхождение текста стало машинно-читаемым, делает его потенциальным фактором ранжирования источников, а значит, за этим придётся следить.
Проверяется это тем же способом, что и обычная AI-видимость: берёте список коммерческих запросов, смотрите, какие источники ассистенты цитируют в ответах по вашей теме, и как этот список меняется. Вручную это пара вечеров, на регулярной основе такие замеры закрывают GEO-сервисы вроде brandfound, Profound или Pixel Tools. Важно не разовое попадание, а именно динамика состава источников: по ней видно, что модели начали переоценивать.
Из чего такой срез состоит на практике: список цитируемых источников по каждому запросу, разбивка по нейросетям, изменение состава от периода к периоду и момент, когда конкретная статья впервые появилась в ответах. Последнее для темы маркировки важнее всего: если сигнал происхождения однажды начнёт влиять на отбор источников, вы увидите это не в пресс-релизе, а как раз здесь, по тому, что материалы определённого типа перестанут попадать в ответы. В brandfound я смотрю именно эту динамику, у других сервисов набор метрик свой, и перед выбором его стоит сравнить на своих запросах.
Что проверить у себя
- 1. Зафиксировать в регламенте, на каком шаге текст проходит через модель и кто отвечает за факты после этого. Это пригодится независимо от требований ЕС.
- 2. Проверить настройки API-клиентов: там, где маркировка включается по согласию, решение придётся принимать осознанно, а не узнавать о нём от подрядчика.
- 3. Пересобрать контент-план в сторону материалов с собственными данными, которые не воспроизводятся генерацией.
- 4. Снять текущий срез источников, которые ассистенты цитируют по вашим темам, чтобы было с чем сравнивать через квартал.
- 5. Не строить процессы вокруг внешних AI-детекторов: они ошибаются, и это признаёт в том числе поставщик модели.
Главный вопрос здесь не в том, будут ли ваши тексты помечены, а в том, что останется ценным, когда пометка станет обычным техническим атрибутом. На мой взгляд, ответ не изменился за последние два года: ценны данные, которых нет больше ни у кого, и готовность показать, откуда они взялись.