Люди начали писать как Claude. Исследование 461 тысячи текстов на GitHub

Люди начали писать как Claude. Исследование 461 тысячи текстов на GitHub

Инженер Луи Абрахам полтора года исследовал сотни тысяч пул-реквестов на GitHub и зафиксировал феномен: специфический «стиль мышления и письма» нейросетей за полтора года вырос с 0,7% до внушительных 39% всех текстов. Его маркерное слово — load-bearing («несущий»). Разбираем датасет, который доказывает: мы начинаем думать и формулировать мысли языком моделей.

Если вы ежедневно работаете с Claude, вы безошибочно узнаете эту манеру из тысячи: в кодовой базе непременно обнаруживается «несущая конструкция» (load-bearing), изменения вносятся «тихо и аккуратно» (quietly), а сложные архитектурные решения описываются как «предельно простые» (plainly).
В англоязычном инженерном сообществе у этой узнаваемой стилистики появилось даже собственное название — Claudish («клодский диалект»).

В конце августа топ Hacker News взорвал проект «The load-bearing vocabulary of Claude». Независимый исследователь Луи Абрахам математически замерил, с какой скоростью характерный вокабуляр Claude расползается по крупнейшему опенсорс-репозиторию планеты. Вывод получился ошеломляющим: сегодня в этом стиле оформляется более трети всех изменений в коде.

Датасет: 461 000 пул-реквестов и 51 миллион слов

Объектом исследования стали описания пул-реквестов (PR descriptions) на GitHub — текстовые записки, в которых разработчики объясняют коллегам логику своих правок. Сегодня их пишут живые программисты, терминальные агенты или гибридные тандемы человека и ИИ.

Методология сбора данных была выстроена со строгой математической строгостью:

  • Регулярный сэмплинг: автоматический парсер ежедневно делал 10 случайных пятиминутных срезов из глобального потока событий GitHub.
  • Жесткая фильтрация ботов: автогенераторы вроде Dependabot и Renovate, а также пустые описания вычищались на входе.
  • Временной горизонт: с 6 января 2025 года по 17 августа 2026 года (603 дня непрерывного мониторинга).
  • Итоговый объем: 461 121 уникальный пул-реквест и свыше 51 миллиона словоупотреблений.

Затем алгоритм кластеризации без учителя разбил весь корпус на 10 устойчивых стилей («манер письма») исключительно по распределению словаря. Ключевой нюанс методологии: алгоритм ничего не знал о временных метках — он группировал тексты вслепую только по частотности лексики, а временная шкала накладывалась уже на готовые кластеры.

Взрывной рост: с 0,7% до 39% за полтора года

Результат шокировал исследователей: одна конкретная манера письма в начале 2025 года занимала ничтожные 0,7% от общего потока. Но к середине 2026 года её доля взлетела до 39%!
Причём экспансия не остановилась: в последние месяцы этот стиль прибавляет в среднем по 1,2 процентных пункта каждую неделю.

Главным маркером этого кластера стало словечко load-bearing («несущий»). Внутри выделенной группы оно встретилось 929 раз, тогда как во всём гигантском остатке корпуса — лишь 82 раза. С учётом объёмов это 39-кратный статистический перевес.
В этой же когорте аномально часто всплывают любимчики моделей: plainly («просто / явно»), quietly («аккуратно / без шума»), crucial («критический») и streamline («оптимизировать»). Проект ранжирует топ-1000 таких маркеров — и даже на тысячной позиции частотность превышает норму в 5 раз.

Исследование Луи Абрахама живёт в реальном времени: парсер продолжает ежедневно обновлять статистику на дашборде проекта, и график доли Claudish неумолимо стремится к 50%.

Почему именно Claude: три объяснения феномена

Справедливое замечание скептиков: если алгоритм кластеризации не видел ни профилей авторов, ни используемых инструментов, почему исследователи уверены, что виноват именно Claude?

Лингвистический взрыв такого масштаба объясняется тремя параллельными процессами:

  1. Агенты пишут за людей: Claude Code, Cursor и расширения для терминала автоматически генерируют commit messages и PR descriptions при пуше. Человек просто жмёт Enter, и текст уходит с живого аккаунта в обход спам-фильтров.
  2. Гибридный рерайтинг: инженер берет рыбу, сгенерированную Claude, правит пару технических деталей, но сохраняет синтаксический скелет и фирменные обороты.
  3. Языковая диффузия: люди бессознательно перенимают лексику. Если разработчик по 8 часов в день читает аргументацию и код-ревью от Claude, его собственный словарный запас неизбежно мутирует.

Разграничить эти три сценария чисто статистически невозможно. Но практический итог один: IT-индустрия начала говорить на диалекте конкретной нейросети. Тот же термин load-bearing зафиксирован у сотен независимых авторов — это уже не локальный мем отдельной команды, а новая языковая норма.

Кейс GH Archive: почему первая версия ошиблась в 158 раз

В истории этого исследования есть поучительный технический детектив. В первой итерации Абрахам использовал GH Archive — стандартный публичный массив данных GitHub. Первые замеры повергли автора в шок: слово load-bearing нашлось всего в… 17 пул-реквестах на весь GitHub.

В ходе расследования выяснилось: из-за изменений в пайплайнах с середины 2025 года GH Archive перестал корректно агрегировать полные текстовые тела событий. В базе образовалась «дыра», и реальные цифры оказались занижены в 158 раз!
Абрахам экстренно переписал краулер напрямую на поисковый API GitHub и выпустил открытый постмортем с предупреждением другим исследователям.

Это золотое правило для всех, кто строит аналитику на публичных датасетах: отсутствие сигнала в базе часто означает сбой в трубе сбора данных, а не отсутствие явления в реальном мире.

Реакция Anthropic: Claude Opus 5.5 и попытка «звучать естественно»

В самой Anthropic проблему отлично осознают. На днях при релизе Claude Opus 5.5 компания вынесла в официальный ченджлог пункт о кардинальном улучшении стиля: модель научили писать живее, ставить суть на первое место и безжалостно вычищать навязчивый корпоративный жаргон.
Профильное издание The Decoder прямо указало, что это был ответ лаборатории на насмешки над «клодским новоязом».

Возникает парадоксальная гонка на опережение: пока разработчики Anthropic отучают флагманскую модель от её любимых штампов, программисты по всему миру уже впитали эти штампы в свои привычки и продолжают тиражировать их в прод.

Что делать нам: гигиена текстов и фактчекинг

1. Если вы пишете промпты для работы: проверяйте итоговый текст на паразитные маркеры. В русскоязычной среде Claude мгновенно выдают конструкции вроде «не просто X, а Y», «на фундаментальном уровне», «важно отметить» и «несущий каркас». Самый надёжный способ избавиться от них — прямо зашить в системный промпт чёрный список стоп-слов.

2. Если вы нанимаете или проверяете кандидатов: стилистика текста больше не является доказательством того, что тестовое задание выполнил ИИ. Высокий индекс Claudish лишь показывает, что кандидат находится в плотном симбиозе с инструментом. Пора признать: ИИ-детекторы сегодня оценивают «модность слога», а не авторство.

3. Если вы любите лингвистику и цифры: репозиторий проекта полностью открыт. На интерактивном дашборде можно вбить любое английское слово и в реальном времени проследить, как менялась его популярность среди коммитов за последние два года.

Эволюция языка всегда следовала за теми, с кем люди проводят больше всего времени. Столетия назад на речь влияли священные тексты, затем — радио и телевидение, а сегодня главным собеседником человека стал ИИ в окне терминала.