Не имей сто промптов, а имей сто экспертиз.
Или: как я проверял границы ИИ на своей шкуре
Я — ИТ-архитектор в в крупном enterprise и вот мой опыт использования ИИ на протяжении нескольких месяцев.
Первое, с чего, наверно, многие начинают. Информации о том, как построить свой сайт на 10 тысяч долларов за один промпт — завались. Нужно только поставить несколько навыков и плагинов — и случится чудо.
Я попробовал. Чудо случилось — красивая картинка на экране, HTML-код в редакторе VSCode. И что дальше с этим делать? Заливать на хостинг? А как настроить обратную связь? А где политика хранения данных? А как вносить правки — HTML руками править?
Сайт — это не про красивую картинку после промпта. Это комплекс задач, который кто-то должен решать. Не умеешь — не лезь, отдай тому, кто может.
Параллельно случилась маленькая история с Lightshot — программой для скриншотов, которой я пользуюсь каждый день. При сохранении она требует вводить имя файла вручную, каждый раз. Я полгода жил с этим, понимая, что это чинится PowerShell-скриптом на двадцать строк — файловый watcher, переименование по шаблону с таймстемпом, перекладывание в нужную папку. Но садиться и писать это самому означало вечер на освежение синтаксиса ради задачи на пять минут.
Попросил ИИ — получил рабочий скрипт через две минуты. Он работает до сих пор, я о нём не думаю. Скрипт плёвый — мог бы написать сам, но не стал. Прикинул риски: задача линейная, даже если ИИ ошибётся — максимум файл переименует не туда. На более сложной задаче я бы так не делал.
После Lightshot я обнадёжился и полез в маркетинг. Здесь экспертизы нет совсем.
Подготовил промпт, запустил. Получил большое количество цифр и графиков. Сначала — воодушевился: результаты подтверждали мои гипотезы. Потом подумал: а насколько этому можно доверять? Где гарантия, что модель не подыгрывает мне — ищет данные под мою гипотезу, игнорирует те, что не укладываются?
По ссылкам из выводов можно посмотреть источники и методики расчётов. Но без опыта я не могу разобраться: насколько это независимые цифры, нет ли влияния заказчика на оригинальное исследование, хороша ли методика — или это просто красивая картинка для презентации.
Вот конкретная цифра: 70% компаний в РФ внедрили ИИ хотя бы в одном процессе. Я вращаюсь внутри ИТ-рынка — чувствую, что это не похоже на правду. «Внедрение ИИ» для отчётности и реальное внедрение — разные вещи. Но доказать, что цифра завышена, не могу.
Единственное, что придумал — прогнать выводы через другие модели. Картина не прояснилась, просто стало чуть меньше сомнений. Пользуюсь этими данными — но знаю, что проверить их до конца не могу.
Поигрался с ИИ-штуками, где мало что понимаю, — решил посмотреть, может, поможет там, где я чуть больше смыслю? В то время как раз тестировал новый агентский harness Hermes, и меня не устраивало, как он работает с памятью. Подумал: может, попробовать спроектировать самому — как мне надо.
Решил спроектировать архитектуру памяти для агента. Хотелось понять, что в нём есть из коробки, смаппировать на свою схему, принять решения — что оставить, что выкинуть. Обычно такой аудит — это день на документацию, день на репозиторий, полдня на эксперименты, ещё день на то, чтобы понять, где твои блоки пересекаются с чужими инструментами. Заложил на это три-четыре дня, но удалось закрыть за пару-тройку чат-сессий с хорошей моделью.
Задачей было опробовать работу локальных open source моделей в сочетании с агентским harness. Было интересно, можно ли "умного" помощника держать локально и бесплатно. Технические спецификации рабочего ноута не позволили взять что-то большее, чем 9-14 млрд. параметров. Поэтому начались проблемы с агентскими вызовами. Сначала полез в доработку скиллов. Пишу инструкцию — запускаю — делает не то. Спрашиваю: почему? «Виноват, нужно было сделать вот так, а сделал вот так». Иногда оправдывается: «Так было проще». Инструкция есть — почему не идёшь по ней? Бесило невероятно. Постепенно пришел к выводу, что для "слабых" моделей единственное решение: запись в память — только через алгоритмические скрипты. Генерацию смыслов — LLM. Теперь типовая задача инжеста данных для «второго мозга» выглядит так: скилл определяет, что сохранить, скрипт — как и куда.
После того как разобрался с разницей между open source и фронтир-моделями, — рутинную часть архитектурной работы делаю в паре с ИИ. Она пишет первую версию, следит за согласованностью документов, находит несостыковки. Моя задача сузилась: поставить границы, проверить результат, принять решение. Да, для работы нужно создать фреймворк и структуру. Но это разовая задача. Дальше модель работает по протоколу — и возвращает человека в контур только для решений.
Генеративные модели — это Т9 времен неубиваемой Нокии, только на стероидах. Статистически угадывает следующий токен — и этого часто достаточно для рутинных операций.
Сегодня уже есть примеры, когда ИИ становится настоящим экспертом — в задачах, где нет человеческого фактора, а есть перебор миллиардов вариантов. AlphaFold от DeepMind предсказывает сворачивание белков с точностью экспериментальных методов. Полвека нерешённая задача — ИИ решил. База с 200+ млн структур — ни один человек их не валидировал, потому что жизни не хватит. Научное сообщество приняло: ИИ знает лучше.
А там, где человеческий фактор есть, — получили удар по школе в Иране. Система наведения Maven работала как спроектировано. База данных не обновлялась десять лет — школа числилась военным объектом. Люди не обновили запись, и другие люди утвердили решение по устаревшим данным.
Усилит ли ИИ эксперта? Несомненно. Заменит ли? Вряд ли — верификация остаётся за человеком. А вот стать экспертом в переборных задачах — уже может. Ответственность — на человеке. Даже когда система, формально, права.
Пишу об этом подробнее — про архитектуру ИИ-агентов, управление ИТ и внедрение технологий в бизнес — в Telegram @chaykin_it