Дмитрий Ильин

+55
с 25.02.2026

Пишу про AI-first разработку: веб-сервисы, ИИ-агенты, мультиагентные системы (MAS). Личный опыт, кейсы и разборы.

17 подписчиков
5 подписок

20 июля Hugging Face разбирал взлом собственной инфраструктуры. Логов набралось на 17 тысяч действий атакующего — вручную это недели работы, поэтому инженеры отдали их коммерческим моделям на разбор. Модели отказались. Встроенные фильтры увидели в логах фрагменты вредоносного кода и не отличили специалиста, который расследует инцидент, от того, кто…

Anthropic отчиталась: их исследовательская система из ведущего агента и подчинённых обошла одиночного агента на 90,2%. Цифра разошлась по презентациям подрядчиков как доказательство, что рой умнее. В том же тексте есть вторая цифра, которую в презентации не переносят: расход токенов сам по себе объясняет 80% разброса результатов. Решает объём потра…

Air Canada заявила в суде, что её чат-бот — «отдельное юридическое лицо», которое само отвечает за свои слова. Суд отклонил довод и обязал компанию заплатить. Бот выдумал несуществующий тариф, клиент на него положился.

Ваш чат-бот пообещал клиенту скидку. Платить будет компания — Верховный суд уже решал похожие споры
22

В середине июня Anthropic на 18 дней закрыла доступ к своим новым флагманам, Fable 5 и Mythos 5. Не из-за аварии и не из-за неоплаченного счёта: доступ распорядилось закрыть правительство США, опасаясь, что модели способны находить критические уязвимости в чужом коде. Модели вышли за несколько дней до этого, в прод их мало кто успел поставить, и Op…

11

Разработчик на r/LangChain описал знакомую многим ситуацию: агент упал на середине задачи, перезапустился и отправил клиенту второе письмо. То же самое, слово в слово, второй раз. Модель тут ни при чём. Она отработала правильно — оба раза. Развалилось то, что вокруг неё: перезапуск не знал, что первое письмо уже ушло.

Агентный харнес: почему агент разваливается из-за обвязки, а не из-за модели
33

В мае GitHub показал разработчикам калькулятор: во что превратится их счёт после перехода Copilot на поштучную оплату. Инженер, плативший $177,99, увидел проекцию в $2 899,35. Другой при расходе около $29 в месяц насчитал почти $750. Тридцатого июня закрылся первый месяц на новой схеме.

GitHub Copilot перешёл на оплату за токены: калькулятор насчитал $750 вместо $29
44

Полтора года назад главным обещанием ИИ-разработки было «больше не нужно ничего расписывать — опиши словами, модель сделает». А теперь GitHub выпускает Spec Kit — инструмент, который заставляет сначала написать спецификацию, потом план, потом список задач, и только потом пускает ИИ-агента к коду. И это не одиночная причуда: у инструмента больше 30…

55
11

Год назад под интернет-магазин или несложный веб-сервис вы бы собирали команду: бэкендер, фронтендер, немного DevOps, кто-то за тесты. Сегодня к вам приходит один человек и говорит, что закроет всё это сам — с ИИ. И берёт за это как за одного, а не за пятерых.

AI-разработчик вместо мини-команды: что один человек реально закрывает, а где бизнес платит дважды
22

В июне 2026 команда Tenet Security показала атаку, в которой нет ни вируса, ни украденного пароля. Достаточно отправить одну поддельную запись об ошибке в Sentry — сервис, к которому подключены тысячи сайтов. ИИ-агент разработчика (Claude Code, Cursor, Codex) читает эту запись через стандартную интеграцию, принимает спрятанную в ней инструкцию за «…

22
11
11

В июне 2026 вышел отчёт про Arbor — фреймворк-агент для автономных исследований от лаборатории RUC-NLPIR (Renmin University), выложенный на GitHub. На шести задачах по оптимизации (обучение моделей, инженерия обвязки, синтез данных) он дал в среднем в 2,5 раза больший прирост, чем Claude Code и Codex. Сравнивали при одном интерфейсе задачи и одном…

22

10 июня 2026 команда MiMo от Xiaomi выложила в открытый доступ MiMo Code — терминального ИИ-агента для программирования. За двое суток 5600 звёзд на GitHub, первое место на Hacker News и ярлык в соцсетях: «убийца Claude Code с настоящей памятью». По бенчмаркам Xiaomi он и правда обходит Claude Code: SWE-bench Verified 82% против 79%, а на длинных з…

11

Весной 2026 компания Sinch опросила больше 2500 руководителей, которые отвечают за внедрение ИИ. Результат неудобный для индустрии: 74% уже откатывали или выключали ИИ-агента, работавшего с клиентами, после запуска в прод. У компаний со зрелым управлением рисками — даже 81%. Причём дело почти никогда не в «глупой модели»: на первом месте утечки кли…

22