Microsoft замерил эффект Claude Code на своих инженерах. Цифры неудобные для всех
Почти вся публичная аналитика про ИИ в разработке строится на субъективных опросах. Инженера спрашивают в анкете: «Почувствовали ли вы прирост продуктивности?» Тот отвечает «да, процентов на двадцать», и эта цифра гордо кочует по корпоративным отчётам. Фундаментальный изъян такого подхода очевиден: субъективное ощущение скорости и реальный объём задеплоенного кода — вещи совершенно разные.
В Microsoft пошли другим путём. Компания выдала десяткам тысяч своих инженеров два конкурирующих инструмента — Claude Code от Anthropic и Copilot CLI от дочернего GitHub. А затем на протяжении четырёх месяцев скрупулёзно собирала объективную телеметрию по каждому человеку: кто запустил консоль, кто бросил через неделю, а сколько изменений в итоге реально доехало до продакшена. Препринт исследования выложили на arXiv.
Перед нами первое масштабное полевое исследование с полным знаменателем: авторы изучили не только выборку энтузиастов, но и поведение тех, кто имел доступ, но сознательно проигнорировал новые инструменты.
Реальный прирост: сколько кода дают ИИ-агенты
Главная базовая метрика: активные пользователи терминальных агентов закрывали в среднем на 24% больше пул-реквестов по сравнению с собственными контрольными периодами без ИИ (доверительный интервал — от 14,5% до 33,7%).
Напомним контекст: замерялись именно смердженные пул-реквесты (PR), то есть код прошёл внутренний код-ревью и влился в основную ветку. При этом авторы сразу делают честную оговорку: PR — это мера пропускной способности (throughput), а не ценности созданного продукта.
Зависимость от регулярности оказалась практически экспоненциальной: • 1 день использования в неделю — прирост всего +3% (на уровне погрешности). • 3 дня в неделю — уже +15%. • 5 дней и более (полный рабочий цикл) — скачок до +50% закрытых PR.
И что принципиально: полученный буст не выдыхается со временем. И этот вывод в исследовании Microsoft гораздо важнее самой цифры в 24%.
Эффект выгорания: спор Microsoft с исследованием Cursor
Весной 2024 года в индустрии наделала шума другая научная работа: исследователи сравнили 807 открытых репозиториев, перешедших на редактор Cursor, с контрольной группой из 1380 аналогичных проектов. Вердикт авторов был жёстким: ИИ даёт резкий стартовый всплеск, но уже к 2–3 месяцу скорость падает до исходной, а проект обрастает скрытой архитектурной сложностью.
В датасете Microsoft на дистанции в четыре месяца никакого затухания эффекта не обнаружено: в феврале средний прирост держался на уровне +29%, в марте-апреле — около +20%. Доверительные интервалы пересекаются, а значит, колебания укладываются в стандартный рабочий шум.
Почему два фундаментальных исследования показывают диаметрально противоположные картины? В Microsoft предлагают два веских аргумента:
1. Разница поколений. Классический Cursor — это умный автокомплит и инлайн-чат внутри IDE. А Claude Code и Copilot CLI — автономные терминальные агенты следующего поколения: они сами парсят репозиторий, запускают тесты, правят зависимости и коммитят результат.
2. Методологическая ловушка (парадокс Симпсона). Авторы работы по Cursor брали «среднюю температуру по больнице» на уровне репозитория. Когда инструмент выходит за рамки группы энтузиастов к широкой массе пассивных разработчиков, средние цифры проекта неминуемо ползут вниз — но не из-за снижения отдачи инструмента, а из-за размытия базы. Microsoft же оценивал персональную динамику каждого конкретного инженера, сравнивая его продуктивные недели с неделями без ИИ. Такой дизайн исследования исключает эффект размытия.
Если вам в следующий раз покажут вирусный график о том, как «польза ИИ для программистов обнуляется через 90 дней», помните: чаще всего это следствие наивной математики усреднения, а не деградации самих ассистентов.
Кто начинает пользоваться: фактор «соседа по опенспейсу»
Раздел исследования о том, как новые технологии распространяются внутри корпорации, разрушает сразу несколько устоявшихся HR-мифов.
Ключевым драйвером адопшена оказался вовсе не грейд, не опыт работы в компании и не любовь к гик-новинкам. Главный триггер — поведение ближайшего профессионального окружения.
Статистика социальных связей говорит сама за себя: • Если инструментом начал пользоваться коллега по кросс-функциональной ветке (уровень общего руководителя N+2) — вероятность того, что инженер тоже попробует консоль, подскакивает на +216%. • Если инструмент использует прямой тимлид — шансы выше на +82%. • Если активен постоянный партнер по код-ревью — вероятность возрастает на +54%.
При этом формальный стаж внутри Microsoft не играл роли: новички первого года лишь на символические 11% любопытнее остальных. Иерархия по грейдам дала еле заметный градиент: джуниоры экспериментируют чуть реже, сеньоры — чуть чаще, а активность менеджмента статистически неотличима от базовой линии.
Формула исследователей звучит однозначно: реальный рабочий контекст важнее строки в штатном расписании. Плотность коммуникаций в репозитории и повседневные привычки объясняют внедрение агентов несоизмеримо точнее, чем должностная плашка.
Практический вывод для техлидов и CTO: централизованные корпоративные рассылки и мотивационные письма от топ-менеджмента практически не работают. Работает исключительно «демонстрация экрана от коллеги»: пока инженер воочию не увидит, как сосед по проекту закрыл агентом рутинный баг за три минуты, никакая корпоративная агитация не сдвинет процесс.
Парадокс удержания: почему активные пользователи ИИ уходят первыми
Здесь исследователи зафиксировали контринтуитивный паттерн: факторы первого знакомства с агентом и факторы долгосрочного удержания (retention) кардинально расходятся.
Разработчики, уже имевшие солидный бэкграунд работы с плагинами в IDE, с огромной охотой брались тестировать агентский CLI — готовность попробовать возрастала на величину до +83%. Но именно эта когорта хуже всего закреплялась на новом стеке: по всем группам опытных пользователей удержание ушло в стабильный минус.
Логика авторов предельно прагматична: у искушённого разработчика всегда есть комфортный путь к отступлению. Если терминальный агент с первой попытки споткнулся о сложный контекст, профи мгновенно возвращается к привычному комплаеру в IDE — он ничего не теряет. А для новичка CLI-агент стал первым мощным откровением: сравнивать не с чем, пути назад нет, и порог закрепления оказывается в разы выше.
Этот факт на корню ломает классическую стратегию развёртывания «через внутренних ИИ-евангелистов»: они первыми прибегут на пилот и первыми же с него соскочат при малейшем неудобстве.
Неудобная правда: Copilot CLI против Claude Code
А теперь — ключевой конфликт препринта, ради которого публикацию и обсуждают в кулуарах бигтеха.
В исследовании провели прямое лобовое сравнение разработчиков, изолированно использовавших только один инструмент: • GitHub Copilot CLI показал прирост продуктивности в +24,9%. • Claude Code от Anthropic дал прирост лишь в +11,4%. Разница в результативности составила 2,2 раза в пользу решения GitHub с абсолютной статистической значимостью.
Авторы открыто признают: этот результат бьёт наотмашь по публичному консенсусу разработчиков, где Claude Code стабильно лидирует в бенчмарках автономного кодинга. Исследователи выдвигают две гипотезы: 1. Инструменты в реальности закрывали разные типы задач (рутинный рефакторинг против сложного проектирования), что смазало метрику закрытия PR. 2. Внутренняя инфраструктура: Microsoft владеет GitHub, а доступ к Claude покупает как сторонний софт. Инженерная обвязка Copilot в корпоративной сети Microsoft годами полировалась под внутренние сервисы, давая домашнему продукту фору.
И здесь неизбежно встаёт вопрос о конфликте интересов, который авторы аккуратно зафиксировали в разделе Positionality Statement: все трое исследователей являются штатными сотрудниками Microsoft. Корпорация коммерчески заинтересована в продажах экосистемы GitHub и Copilot. И хотя авторы декларируют отсутствие прямого административного заказа, корпоративный контекст не мог не повлиять на акценты.
Самый красноречивый штрих упоминается авторами мимоходом: сразу после окончания сбора данных руководство Microsoft уведомило штат, что корпоративные лицензии на Claude Code будут отключены, а весь штат безальтернативно переводится на Copilot CLI. Исследователям пришлось экстренно отсекать дату окончания наблюдений, чтобы принудительная миграция не выглядела как «органический триумф Copilot».
Иными словами: перед нами редчайший документ — независимое научное вскрытие двух передовых ИИ-систем внутри корпорации, которая ещё до публикации отчёта сделала свой административный выбор.
Экономика токенов: сколько стоит такая продуктивность
Чтобы осознать цену этих +24%, авторы ссылаются на недавнюю публикацию Fortune о расходах Meta: всего за один месяц сотрудники корпорации сожгли свыше 60 триллионов токенов — в среднем по 281 млрд токенов на человека. Даже по оптовым ценам инфраструктуры это эквивалентно более чем $1,4 млн затрат на инженера.
Именно поэтому экономика автономных агентов сегодня волнует финдиректоров куда сильнее процентов прироста скорости. При подобных масштабах потребления малейшая ошибка в расчёте ROI обходится компании дороже, чем весь бюджет на R&D.
Слепое пятно: объём вырос, но стал ли код лучше?
Финальное признание исследователей Microsoft обесценивает половину победных реляций индустрии.
Наука научилась считать скорость, но до сих пор не умеет считать качество. Смердженный пул-реквест — это метрика, поощряющая дробление задач на мелкие частые порции. Она ничего не сообщает о том, сколько скрытого техдолга было сгенерировано, насколько усложнилась архитектура и сколько багов вылезет в проде через полгода. Авторы прямо констатируют: индустрия до сих пор не создала общепринятого инструментария, чтобы объективно измерить долгосрочное качество сгенерированного софта.
И здесь скептики из лагеря Cursor вполне могут оказаться правы: объём выпускаемого кода растёт лавинообразно, но вместе с ним накапливается скрытая системная энтропия.
Итог на 2026 год таков: мы научились с точностью до десятых долей процента измерять, насколько больше строк и коммитов генерируют инженеры с ИИ. Но мы по-прежнему не знаем, делает ли это сам продукт надежнее.