Нейротекст: какие признаки ИИ-текста работают на самом деле. Я прогнал 12 миллионов слов живой переписки и посчитал

Половина "признаков нейросети" из популярных списков у живых людей встречается постоянно. Зато выдаёт машину то, что в списках не пишут. Цифры из замера на 331 тысяче сообщений.

Нейротекст: какие признаки ИИ-текста работают на самом деле. Я прогнал 12 миллионов слов живой переписки и посчитал

Ощущение "этот текст писала машина" есть у всех. Назвать, по чему именно, получается редко. Я решил перестать угадывать и посчитать: взял 331 тысячу реальных сообщений из чатов и переписок, 12 миллионов слов, и сравнил с тем, что выдают модели.

Часть привычных признаков замер не подтвердил. Зато подтвердил другие, которые словами описать сложнее.

Зачем я это считал

Я маркетолог, веду канал и блог, часть текстов пишет нейросеть по моим заметкам. Читатель это чувствует за секунду, и вовлечённость падает. Мне нужен был способ проверять текст до публикации.

Готовые списки признаков не подошли. Их составляют по впечатлению, и там рядом стоят "длинное тире" и "слово синергия" без указания, насколько это вообще редко у людей. Свой список я собирал в шесть заходов, он вырос с 70 признаков до 205. Но главное случилось, когда я начал проверять каждый признак по корпусу живой речи.

Что считал и как

Корпус: 331 тысяча сообщений, 12,04 миллиона слов. Чаты предпринимателей и экспертов, комментарии в каналах, рабочие переписки за несколько лет, расшифровки голосовых. Тот самый регистр, в котором люди пишут, когда не стараются писать красиво.

Метод скучный (поиск по регулярным выражениям и подсчёт на Python). Для каждого признака я считал, сколько раз он встречается у живых людей на миллион слов и в каком проценте сообщений. Для длины предложений считал распределение.

Тексты моделей для сравнения: посты, которые нейросети писали по моим же заметкам, плюс открытые замеры детекторов. Где опираюсь на чужие данные, так и пишу.

Признаки ИИ-текста, которые не работают

Тройное перечисление. Самый популярный пункт в любом списке. Конструкция "X, Y и Z" встречается у живых людей 35 256 раз на 12 миллионах слов. Люди так говорят постоянно. Списки, которые запрещают тройку, запрещают обычную русскую речь. Сигналом она становится только когда стоит в каждом абзаце подряд.

Повтор первого слова. Анафора есть у 12,2% живых сообщений. Каждое восьмое. Обычная разговорная фигура.

Отдельные "машинные" слова. "Без воды" у людей 280 вхождений, "честно говоря" 155, "методичка" 20, "каша в голове" 15. Все живые. Списки, которые запрещают такие слова, вырезают из текста нормальную речь.

Вывод из этой части: ни одно слово и ни один приём сами по себе ничего не доказывают. К тому же пришла Bloomberry Research на корпусе из 7 400 сигналов: машинный текст выдаёт совпадение нескольких сигналов сразу, по одному его не поймать.

Признаки, которые работают

Ритм. Медиана длины предложения у живых людей 8 слов. У модели 14 и выше. Но интереснее распределение.

Предложения короче 4 слов: у живых 21,6%, у модели меньше 5%.

Предложения на 12-18 слов: у живых 17,3%, у модели больше 40%.

Предложения длиннее 30 слов: у живых 7,8%, у модели меньше 1%.

Человек постоянно роняет реплики в два слова и изредка выдаёт фразу на тридцать. Модель всегда держится в середине. По разбросу длин она в 3-5 раз менее вариативна, и этот сигнал не зависит ни от словаря, ни от темы, ни от языка.

Разметка в обычном тексте. Звёздочки и решётки там, где markdown не рендерится: у людей 8 вхождений на 10 тысяч слов, у модели 90. Жирный через звёздочки чаще в 43 раза, заголовок через решётку в 23 раза. Это замер Pangram по миллионам документов за август 2026, мой корпус его подтверждает: жирный шрифт у живых людей есть в 0,05% сообщений.

Заголовок-строка с двоеточием. "Что внутри:", "Как это работает:". У людей 0,65% сообщений.

Начала предложений. Живые начинают с "а" в 3,9% случаев, с "и" в 2,9%, с "ну" в 1,6%. Модель почти никогда. Длинный неформальный текст без единого такого начала это машина.

То, чего у людей нет вообще. Проверял буквальным поиском. Конструкция "в 2:47" как приём драматизации времени: ноль вхождений на 12 миллионов слов. "И вот тут начинается": два. Такие обороты приходят из переводного английского и в русской переписке не живут.

Как проверить текст на нейросеть глазами: один абзац

Абзац, где сошлись четыре приёма сразу:

"Эксперты отмечают, что регулярность важнее интенсивности, именно она формирует привычку. Дело не в количестве часов, а в постоянстве подхода. Каждая тренировка укрепляет тело, дисциплину и уверенность. Тот, кто занимается понемногу каждый день, добивается большего, чем тот, кто выкладывается раз в неделю."

Ссылка на "экспертов" без имени. Контрастная пара с отрицанием. Перечисление строго из трёх. Ни одного предложения короче двенадцати слов. Поодиночке так пишут и люди, вместе это узнаётся раньше самой мысли.

Тот же смысл живым ритмом:

"Регулярность работает лучше интенсивности. Проверено на себе: три коротких пробежки в неделю дают больше, чем одна выматывающая. Тело привыкает постепенно, и через месяц дистанция даётся легче. А главное, себя больше не нужно уговаривать."

Смысл прежний. Поменялись плотность приёмов и длины предложений. И всё.

Правило, к которому я пришёл

Считать совпадения. Один признак игнорировать. Два держать в голове. Три и больше в коротком тексте, и он уходит на переписывание.

Я собрал это в скрипт, который прогоняет текст перед публикацией: считает медиану и разброс длин предложений, доли коротких и длинных, разметку, начала абзацев, словарь из списка. На выходе число жёстких сигналов. Пороги сверял на 60 своих постах с известной вовлечённостью. Часть пунктов после сверки снял: замер не показал по ним штрафа, зато список стал честнее.

Забавная деталь. Когда я прогнал скриптом собственный сайт, он поставил каждой странице по два жёстких сигнала. Разобрался: он считал за прозу типографские стрелки из кнопок вида "Читать дальше". Чекер тоже надо проверять.

Что этот замер не доказывает

Корпус русскоязычный и из одной среды: предприниматели, эксперты, их клиенты. В технической переписке или в художественном тексте пороги будут другими.

Сравнение с моделями частично опирается на чужие замеры. Свои тексты моделей у меня есть, но их объём несопоставим с 12 миллионами слов живой речи.

Детекторы переобучаются каждые несколько месяцев, модели меняют почерк, и признак, который сегодня улика, через полгода оказывается обычной речью. Список из 205 признаков я обновлял шесть раз за год.

И главное. Обмануть детектор заменой слов нельзя. Структура текста выдаёт машину без всякой лексики. Единственный рабочий способ это переписать ритм. Словарь вторичен.

Полный список

Все 205 признаков с правками и числовыми порогами лежат у меня на сайте: pavelrostovtsev.ru/markery-neiroteksta. Файл можно скачать и отдать своей нейросети как инструкцию.

Как я применяю это в текстах каждый день, пишу в канале: telegram.me/edstartpro.

33