Люди начали писать как Claude. Исследование 461 тысячи текстов на GitHub
Инженер Луи Абрахам полтора года исследовал сотни тысяч пул-реквестов на GitHub и зафиксировал феномен: специфический «стиль мышления и письма» нейросетей за полтора года вырос с 0,7% до внушительных 39% всех текстов. Его маркерное слово — load-bearing («несущий»). Разбираем датасет, который доказывает: мы начинаем думать и формулировать мысли языком моделей.
Если вы ежедневно работаете с Claude, вы безошибочно узнаете эту манеру из тысячи: в кодовой базе непременно обнаруживается «несущая конструкция» (load-bearing), изменения вносятся «тихо и аккуратно» (quietly), а сложные архитектурные решения описываются как «предельно простые» (plainly). В англоязычном инженерном сообществе у этой узнаваемой стилистики появилось даже собственное название — Claudish («клодский диалект»).
В конце августа топ Hacker News взорвал проект «The load-bearing vocabulary of Claude». Независимый исследователь Луи Абрахам математически замерил, с какой скоростью характерный вокабуляр Claude расползается по крупнейшему опенсорс-репозиторию планеты. Вывод получился ошеломляющим: сегодня в этом стиле оформляется более трети всех изменений в коде.
Датасет: 461 000 пул-реквестов и 51 миллион слов
Объектом исследования стали описания пул-реквестов (PR descriptions) на GitHub — текстовые записки, в которых разработчики объясняют коллегам логику своих правок. Сегодня их пишут живые программисты, терминальные агенты или гибридные тандемы человека и ИИ.
Методология сбора данных была выстроена со строгой математической строгостью:
- Регулярный сэмплинг: автоматический парсер ежедневно делал 10 случайных пятиминутных срезов из глобального потока событий GitHub.
- Жесткая фильтрация ботов: автогенераторы вроде Dependabot и Renovate, а также пустые описания вычищались на входе.
- Временной горизонт: с 6 января 2025 года по 17 августа 2026 года (603 дня непрерывного мониторинга).
- Итоговый объем: 461 121 уникальный пул-реквест и свыше 51 миллиона словоупотреблений.
Затем алгоритм кластеризации без учителя разбил весь корпус на 10 устойчивых стилей («манер письма») исключительно по распределению словаря. Ключевой нюанс методологии: алгоритм ничего не знал о временных метках — он группировал тексты вслепую только по частотности лексики, а временная шкала накладывалась уже на готовые кластеры.
Взрывной рост: с 0,7% до 39% за полтора года
Результат шокировал исследователей: одна конкретная манера письма в начале 2025 года занимала ничтожные 0,7% от общего потока. Но к середине 2026 года её доля взлетела до 39%! Причём экспансия не остановилась: в последние месяцы этот стиль прибавляет в среднем по 1,2 процентных пункта каждую неделю.
Главным маркером этого кластера стало словечко load-bearing («несущий»). Внутри выделенной группы оно встретилось 929 раз, тогда как во всём гигантском остатке корпуса — лишь 82 раза. С учётом объёмов это 39-кратный статистический перевес. В этой же когорте аномально часто всплывают любимчики моделей: plainly («просто / явно»), quietly («аккуратно / без шума»), crucial («критический») и streamline («оптимизировать»). Проект ранжирует топ-1000 таких маркеров — и даже на тысячной позиции частотность превышает норму в 5 раз.
Исследование Луи Абрахама живёт в реальном времени: парсер продолжает ежедневно обновлять статистику на дашборде проекта, и график доли Claudish неумолимо стремится к 50%.
Почему именно Claude: три объяснения феномена
Справедливое замечание скептиков: если алгоритм кластеризации не видел ни профилей авторов, ни используемых инструментов, почему исследователи уверены, что виноват именно Claude?
Лингвистический взрыв такого масштаба объясняется тремя параллельными процессами:
- Агенты пишут за людей: Claude Code, Cursor и расширения для терминала автоматически генерируют commit messages и PR descriptions при пуше. Человек просто жмёт Enter, и текст уходит с живого аккаунта в обход спам-фильтров.
- Гибридный рерайтинг: инженер берет рыбу, сгенерированную Claude, правит пару технических деталей, но сохраняет синтаксический скелет и фирменные обороты.
- Языковая диффузия: люди бессознательно перенимают лексику. Если разработчик по 8 часов в день читает аргументацию и код-ревью от Claude, его собственный словарный запас неизбежно мутирует.
Разграничить эти три сценария чисто статистически невозможно. Но практический итог один: IT-индустрия начала говорить на диалекте конкретной нейросети. Тот же термин load-bearing зафиксирован у сотен независимых авторов — это уже не локальный мем отдельной команды, а новая языковая норма.
Кейс GH Archive: почему первая версия ошиблась в 158 раз
В истории этого исследования есть поучительный технический детектив. В первой итерации Абрахам использовал GH Archive — стандартный публичный массив данных GitHub. Первые замеры повергли автора в шок: слово load-bearing нашлось всего в… 17 пул-реквестах на весь GitHub.
В ходе расследования выяснилось: из-за изменений в пайплайнах с середины 2025 года GH Archive перестал корректно агрегировать полные текстовые тела событий. В базе образовалась «дыра», и реальные цифры оказались занижены в 158 раз! Абрахам экстренно переписал краулер напрямую на поисковый API GitHub и выпустил открытый постмортем с предупреждением другим исследователям.
Это золотое правило для всех, кто строит аналитику на публичных датасетах: отсутствие сигнала в базе часто означает сбой в трубе сбора данных, а не отсутствие явления в реальном мире.
Реакция Anthropic: Claude Opus 5.5 и попытка «звучать естественно»
В самой Anthropic проблему отлично осознают. На днях при релизе Claude Opus 5.5 компания вынесла в официальный ченджлог пункт о кардинальном улучшении стиля: модель научили писать живее, ставить суть на первое место и безжалостно вычищать навязчивый корпоративный жаргон. Профильное издание The Decoder прямо указало, что это был ответ лаборатории на насмешки над «клодским новоязом».
Возникает парадоксальная гонка на опережение: пока разработчики Anthropic отучают флагманскую модель от её любимых штампов, программисты по всему миру уже впитали эти штампы в свои привычки и продолжают тиражировать их в прод.
Что делать нам: гигиена текстов и фактчекинг
1. Если вы пишете промпты для работы: проверяйте итоговый текст на паразитные маркеры. В русскоязычной среде Claude мгновенно выдают конструкции вроде «не просто X, а Y», «на фундаментальном уровне», «важно отметить» и «несущий каркас». Самый надёжный способ избавиться от них — прямо зашить в системный промпт чёрный список стоп-слов.
2. Если вы нанимаете или проверяете кандидатов: стилистика текста больше не является доказательством того, что тестовое задание выполнил ИИ. Высокий индекс Claudish лишь показывает, что кандидат находится в плотном симбиозе с инструментом. Пора признать: ИИ-детекторы сегодня оценивают «модность слога», а не авторство.
3. Если вы любите лингвистику и цифры: репозиторий проекта полностью открыт. На интерактивном дашборде можно вбить любое английское слово и в реальном времени проследить, как менялась его популярность среди коммитов за последние два года.
Эволюция языка всегда следовала за теми, с кем люди проводят больше всего времени. Столетия назад на речь влияли священные тексты, затем — радио и телевидение, а сегодня главным собеседником человека стал ИИ в окне терминала.