Нейротекст: какие признаки ИИ-текста работают на самом деле. Я прогнал 12 миллионов слов живой переписки и посчитал
Половина "признаков нейросети" из популярных списков у живых людей встречается постоянно. Зато выдаёт машину то, что в списках не пишут. Цифры из замера на 331 тысяче сообщений.
Ощущение "этот текст писала машина" есть у всех. Назвать, по чему именно, получается редко. Я решил перестать угадывать и посчитать: взял 331 тысячу реальных сообщений из чатов и переписок, 12 миллионов слов, и сравнил с тем, что выдают модели.
Часть привычных признаков замер не подтвердил. Зато подтвердил другие, которые словами описать сложнее.
Зачем я это считал
Я маркетолог, веду канал и блог, часть текстов пишет нейросеть по моим заметкам. Читатель это чувствует за секунду, и вовлечённость падает. Мне нужен был способ проверять текст до публикации.
Готовые списки признаков не подошли. Их составляют по впечатлению, и там рядом стоят "длинное тире" и "слово синергия" без указания, насколько это вообще редко у людей. Свой список я собирал в шесть заходов, он вырос с 70 признаков до 205. Но главное случилось, когда я начал проверять каждый признак по корпусу живой речи.
Что считал и как
Корпус: 331 тысяча сообщений, 12,04 миллиона слов. Чаты предпринимателей и экспертов, комментарии в каналах, рабочие переписки за несколько лет, расшифровки голосовых. Тот самый регистр, в котором люди пишут, когда не стараются писать красиво.
Метод скучный (поиск по регулярным выражениям и подсчёт на Python). Для каждого признака я считал, сколько раз он встречается у живых людей на миллион слов и в каком проценте сообщений. Для длины предложений считал распределение.
Тексты моделей для сравнения: посты, которые нейросети писали по моим же заметкам, плюс открытые замеры детекторов. Где опираюсь на чужие данные, так и пишу.
Признаки ИИ-текста, которые не работают
Тройное перечисление. Самый популярный пункт в любом списке. Конструкция "X, Y и Z" встречается у живых людей 35 256 раз на 12 миллионах слов. Люди так говорят постоянно. Списки, которые запрещают тройку, запрещают обычную русскую речь. Сигналом она становится только когда стоит в каждом абзаце подряд.
Повтор первого слова. Анафора есть у 12,2% живых сообщений. Каждое восьмое. Обычная разговорная фигура.
Отдельные "машинные" слова. "Без воды" у людей 280 вхождений, "честно говоря" 155, "методичка" 20, "каша в голове" 15. Все живые. Списки, которые запрещают такие слова, вырезают из текста нормальную речь.
Вывод из этой части: ни одно слово и ни один приём сами по себе ничего не доказывают. К тому же пришла Bloomberry Research на корпусе из 7 400 сигналов: машинный текст выдаёт совпадение нескольких сигналов сразу, по одному его не поймать.
Признаки, которые работают
Ритм. Медиана длины предложения у живых людей 8 слов. У модели 14 и выше. Но интереснее распределение.
Предложения короче 4 слов: у живых 21,6%, у модели меньше 5%.
Предложения на 12-18 слов: у живых 17,3%, у модели больше 40%.
Предложения длиннее 30 слов: у живых 7,8%, у модели меньше 1%.
Человек постоянно роняет реплики в два слова и изредка выдаёт фразу на тридцать. Модель всегда держится в середине. По разбросу длин она в 3-5 раз менее вариативна, и этот сигнал не зависит ни от словаря, ни от темы, ни от языка.
Разметка в обычном тексте. Звёздочки и решётки там, где markdown не рендерится: у людей 8 вхождений на 10 тысяч слов, у модели 90. Жирный через звёздочки чаще в 43 раза, заголовок через решётку в 23 раза. Это замер Pangram по миллионам документов за август 2026, мой корпус его подтверждает: жирный шрифт у живых людей есть в 0,05% сообщений.
Заголовок-строка с двоеточием. "Что внутри:", "Как это работает:". У людей 0,65% сообщений.
Начала предложений. Живые начинают с "а" в 3,9% случаев, с "и" в 2,9%, с "ну" в 1,6%. Модель почти никогда. Длинный неформальный текст без единого такого начала это машина.
То, чего у людей нет вообще. Проверял буквальным поиском. Конструкция "в 2:47" как приём драматизации времени: ноль вхождений на 12 миллионов слов. "И вот тут начинается": два. Такие обороты приходят из переводного английского и в русской переписке не живут.
Как проверить текст на нейросеть глазами: один абзац
Абзац, где сошлись четыре приёма сразу:
"Эксперты отмечают, что регулярность важнее интенсивности, именно она формирует привычку. Дело не в количестве часов, а в постоянстве подхода. Каждая тренировка укрепляет тело, дисциплину и уверенность. Тот, кто занимается понемногу каждый день, добивается большего, чем тот, кто выкладывается раз в неделю."
Ссылка на "экспертов" без имени. Контрастная пара с отрицанием. Перечисление строго из трёх. Ни одного предложения короче двенадцати слов. Поодиночке так пишут и люди, вместе это узнаётся раньше самой мысли.
Тот же смысл живым ритмом:
"Регулярность работает лучше интенсивности. Проверено на себе: три коротких пробежки в неделю дают больше, чем одна выматывающая. Тело привыкает постепенно, и через месяц дистанция даётся легче. А главное, себя больше не нужно уговаривать."
Смысл прежний. Поменялись плотность приёмов и длины предложений. И всё.
Правило, к которому я пришёл
Считать совпадения. Один признак игнорировать. Два держать в голове. Три и больше в коротком тексте, и он уходит на переписывание.
Я собрал это в скрипт, который прогоняет текст перед публикацией: считает медиану и разброс длин предложений, доли коротких и длинных, разметку, начала абзацев, словарь из списка. На выходе число жёстких сигналов. Пороги сверял на 60 своих постах с известной вовлечённостью. Часть пунктов после сверки снял: замер не показал по ним штрафа, зато список стал честнее.
Забавная деталь. Когда я прогнал скриптом собственный сайт, он поставил каждой странице по два жёстких сигнала. Разобрался: он считал за прозу типографские стрелки из кнопок вида "Читать дальше". Чекер тоже надо проверять.
Что этот замер не доказывает
Корпус русскоязычный и из одной среды: предприниматели, эксперты, их клиенты. В технической переписке или в художественном тексте пороги будут другими.
Сравнение с моделями частично опирается на чужие замеры. Свои тексты моделей у меня есть, но их объём несопоставим с 12 миллионами слов живой речи.
Детекторы переобучаются каждые несколько месяцев, модели меняют почерк, и признак, который сегодня улика, через полгода оказывается обычной речью. Список из 205 признаков я обновлял шесть раз за год.
И главное. Обмануть детектор заменой слов нельзя. Структура текста выдаёт машину без всякой лексики. Единственный рабочий способ это переписать ритм. Словарь вторичен.
Полный список
Все 205 признаков с правками и числовыми порогами лежат у меня на сайте: pavelrostovtsev.ru/markery-neiroteksta. Файл можно скачать и отдать своей нейросети как инструкцию.
Как я применяю это в текстах каждый день, пишу в канале: telegram.me/edstartpro.