Ярослав Кононенко

с 2019

Разработчик. Пишу про LLM и агентов изнутри: что работает, что ломается и почему

0 подписчиков
0 подписок

22 сентября за один день вышли три модели: Opus 5.5 у Anthropic, GPT-6 Sol и GPT-6 Luna у OpenAI. Сэм Альтман в тот же вечер написал, что GPT-6 вдвое дешевле за токен, чем модели 5.6, «и ещё дешевле за задачу». Отдельным постом добавил, что сравнивать модели надо по цене за задачу. В Anthropic про Opus 5.5 сказали похоже: примерно на 30% быстрее и…

С середины июня у нас работает небольшой эксперимент. Раз в неделю скрипт задаёт 37 вопросов, которые обычно задают предприниматели, пяти системам: ChatGPT, Claude, Gemini, Perplexity и связке «выдача Яндекса плюс YandexGPT». Последняя собрана по образцу Нейро, саму Алису мы напрямую не опрашиваем. Каждый вопрос уходит до пяти раз, потому что ответ…

Мы делаем Сам Решу — ИИ-агента, который работает в кабинетах маркетплейсов, складских программах, банках и CRM. За последний год мы поняли: самые дорогие ошибки агента случаются не в диалоге и не в «галлюцинациях». Они случаются в момент, когда агент что-то записывает во внешнюю систему, а ответ не приходит.

Разберу, почему это отдельный клас…

Я разработчик и последние месяцы занимаюсь агентами, которые подключаются к 1С, банку и ЭДО. Бухгалтеры первым делом спрашивают, не испортит ли агент базу. Это как раз решается легко: отдельный пользователь, права только на чтение, и портить нечем.

Опаснее другое: агент, который ничего не сломал, но уверенно выдал неверную цифру. Про это и хо…

Выбирать ИИ-агента по тому, насколько он умный, — всё равно что выбирать бухгалтера по скорости печати. Агент получает доступ к кабинетам, базе клиентов и деньгам, поэтому главный вопрос к поставщику не «что он умеет», а «что будет с моими данными и что он сможет сделать без меня». Ниже — чек-лист из двадцати вопросов по четырём блокам: данные, дос…