Дмитрий Ильин

+54
с 25.02.2026

Пишу про AI-first разработку: веб-сервисы, ИИ-агенты, мультиагентные системы (MAS). Личный опыт, кейсы и разборы.

17 подписчиков
5 подписок

20 июля Hugging Face разбирал взлом собственной инфраструктуры. Логов набралось на 17 тысяч действий атакующего — вручную это недели работы, поэтому инженеры отдали их коммерческим моделям на разбор. Модели отказались. Встроенные фильтры увидели в логах фрагменты вредоносного кода и не отличили специалиста, который расследует инцидент, от того, кто…

ИИ-помощник откажется работать ровно тогда, когда он нужнее всего. Что держать про запас

Anthropic отчиталась: их исследовательская система из ведущего агента и подчинённых обошла одиночного агента на 90,2%. Цифра разошлась по презентациям подрядчиков как доказательство, что рой умнее. В том же тексте есть вторая цифра, которую в презентации не переносят: расход токенов сам по себе объясняет 80% разброса результатов. Решает объём потра…

Рой ИИ-агентов стоит вчетверо дороже одного. При равном бюджете мультиагентная система ему проигрывает

Air Canada заявила в суде, что её чат-бот — «отдельное юридическое лицо», которое само отвечает за свои слова. Суд отклонил довод и обязал компанию заплатить. Бот выдумал несуществующий тариф, клиент на него положился.

Ваш чат-бот пообещал клиенту скидку. Платить будет компания — Верховный суд уже решал похожие споры
2

В середине июня Anthropic на 18 дней закрыла доступ к своим новым флагманам, Fable 5 и Mythos 5. Не из-за аварии и не из-за неоплаченного счёта: доступ распорядилось закрыть правительство США, опасаясь, что модели способны находить критические уязвимости в чужом коде. Модели вышли за несколько дней до этого, в прод их мало кто успел поставить, и Op…

Claude отключили на 18 дней по решению властей США. Что делать бизнесу, чей процесс держится на одной ИИ-модели
1

Разработчик на r/LangChain описал знакомую многим ситуацию: агент упал на середине задачи, перезапустился и отправил клиенту второе письмо. То же самое, слово в слово, второй раз. Модель тут ни при чём. Она отработала правильно — оба раза. Развалилось то, что вокруг неё: перезапуск не знал, что первое письмо уже ушло.

Агентный харнес: почему агент разваливается из-за обвязки, а не из-за модели
3

В мае GitHub показал разработчикам калькулятор: во что превратится их счёт после перехода Copilot на поштучную оплату. Инженер, плативший $177,99, увидел проекцию в $2 899,35. Другой при расходе около $29 в месяц насчитал почти $750. Тридцатого июня закрылся первый месяц на новой схеме.

GitHub Copilot перешёл на оплату за токены: калькулятор насчитал $750 вместо $29
4

Полтора года назад главным обещанием ИИ-разработки было «больше не нужно ничего расписывать — опиши словами, модель сделает». А теперь GitHub выпускает Spec Kit — инструмент, который заставляет сначала написать спецификацию, потом план, потом список задач, и только потом пускает ИИ-агента к коду. И это не одиночная причуда: у инструмента больше 30…

«Просто опишите словами» не сработало: почему ИИ-разработка возвращается к спецификациям
5
1

Год назад под интернет-магазин или несложный веб-сервис вы бы собирали команду: бэкендер, фронтендер, немного DevOps, кто-то за тесты. Сегодня к вам приходит один человек и говорит, что закроет всё это сам — с ИИ. И берёт за это как за одного, а не за пятерых.

AI-разработчик вместо мини-команды: что один человек реально закрывает, а где бизнес платит дважды
2

В июне 2026 команда Tenet Security показала атаку, в которой нет ни вируса, ни украденного пароля. Достаточно отправить одну поддельную запись об ошибке в Sentry — сервис, к которому подключены тысячи сайтов. ИИ-агент разработчика (Claude Code, Cursor, Codex) читает эту запись через стандартную интеграцию, принимает спрятанную в ней инструкцию за «…

Вы дали ИИ-агенту доступы к системам — и открыли дверь злоумышленнику: разбор свежих атак и что урезать в правах
2
1
1

В июне 2026 вышел отчёт про Arbor — фреймворк-агент для автономных исследований от лаборатории RUC-NLPIR (Renmin University), выложенный на GitHub. На шести задачах по оптимизации (обучение моделей, инженерия обвязки, синтез данных) он дал в среднем в 2,5 раза больший прирост, чем Claude Code и Codex. Сравнивали при одном интерфейсе задачи и одном…

Arbor — агент, который обошёл Claude Code и Codex в 2,5 раза при том же бюджете: решает архитектура агента
2

10 июня 2026 команда MiMo от Xiaomi выложила в открытый доступ MiMo Code — терминального ИИ-агента для программирования. За двое суток 5600 звёзд на GitHub, первое место на Hacker News и ярлык в соцсетях: «убийца Claude Code с настоящей памятью». По бенчмаркам Xiaomi он и правда обходит Claude Code: SWE-bench Verified 82% против 79%, а на длинных з…

Xiaomi выпустила MiMo Code бесплатный аналог Claude Code и берёт бенчмарки. Но «прорывной памяти», о которой все пишут, там нет
1

Весной 2026 компания Sinch опросила больше 2500 руководителей, которые отвечают за внедрение ИИ. Результат неудобный для индустрии: 74% уже откатывали или выключали ИИ-агента, работавшего с клиентами, после запуска в прод. У компаний со зрелым управлением рисками — даже 81%. Причём дело почти никогда не в «глупой модели»: на первом месте утечки кли…

Вам не нужен ИИ-агент. Нужен workflow — и вот по каким признакам
1