У нас ИИ-коуч грубит пользователям. Это наше конкурентное преимущество

У нас ИИ-коуч грубит пользователям. Это наше конкурентное преимущество

Я встроил ИИ-коучинг в приложение привычек. Спойлер: тестеры начали с ним ссориться

Меня зовут Иван, я делаю Bloom — социальный трекер привычек с геймификацией и ИИ. В прошлый раз я рассказывал, как мы выбирали подрядчика и чуть не убили стартап на этом этапе. Теперь хочу поговорить про то, ради чего вообще затевался Bloom — про ИИ-коучинг.

Звучит как типичная фича «для галочки». LLM-чат, который пишет «ты молодец, продолжай в том же духе». Я сам так думал, пока не начал вникать.

В итоге мы потратили на этот блок два с лишним месяца, переписали архитектуру дважды, и в бете пользователи всерьёз спорят с агентом. Кто-то обижается. Кто-то пишет «закрой рот, я знаю, что делаю». Это странно, забавно и неожиданно полезно.

Как мы до этого дошли — под катом.

Почему просто «напоминание» не работает

Все приложения для привычек работают одинаково: ты ставишь цель, приложение присылает пуши, ты отмечаешь выполнение, получаешь ачивку. Проходит две недели — ты забрасываешь. Потому что мотивация от ачивок умирает после третьего дня.

Исследования подтверждают: ключевой фактор удержания — эмоциональная поддержка в моменте срыва. Не «ты молодец», а именно адресная реакция на контекст: «Ты пропустил тренировку в третий раз. Что изменилось на этой неделе? Может, стоит снизить планку?»

Ни одно приложение из стора так не делает. Либо статичные напоминалки, либо доски с прогрессом. Мы решили попробовать ИИ в этой роли — не как болталку, а как коуча, который знает твою историю.

Первая версия — просто GPT в чате

Подключили API:

curl -X POST "https://api.openai.com/v1/chat/completions"-H "Authorization: Bearer $OPENAI_API_KEY"-d '{"model": "gpt-4o", "messages": [...]}'

Системный промпт описали на полстраницы: «Ты коуч по привычкам. Пользователь делает X. Твоя задача — поддерживать и мягко направлять». Добавили историю последних семи дней. Результат предсказуемый: модель писала идеально вежливые, общие советы. Как будто психолог из глянцевого журнала. Пользователи читали и не возвращались. Никто не хочет «проявлять сострадание к себе» в восьмой раз.

Что пошло не так — и как пересобрали

Первое. Модель не знала пользователя. Она видела только сырые данные: «пропустил день, отметил день». Без контекста. Мы добавили слой аналитики перед запросом к LLM: агрегатор считает тренды за 7, 14, 30 дней, определяет паттерны — «срывается по средам», «хорошо идёт первую неделю, потом откат». Второе. Вежливость убивала вовлечение. Модель боялась быть резкой. Мы переписали системный промпт, убрав половину «поддерживающих» инструкций. Добавили: «Если пользователь саботирует — скажи ему об этом прямо». Третье. Отсутствие геймификации. ИИ-коуч ничего не знал про игровую механику Bloom. Мы докрутили: агент теперь видит, какие «цветы» (внутренняя валюта) заработал пользователь, какие уровни открыл, где застрял. И привязывает советы к прогрессу в игре. Четвёртое (самое важное). Пользователи не доверяли безличному голосу. Мы добавили возможность выбрать «стиль коуча»: мотивирующий, строгий, аналитичный, дружеский. Стекло разделилось — 40% выбрали строгого, 35% мотивирующего. Остальные — аналитику и дружеский. Когда мы включили строгий стиль, случилось неожиданное: пользователи начали спорить. Один написал: «Ты не понимаешь, у меня аврал на работе». Агент ответил: «Аврал будет всегда. Вопрос в том, какую привычку ты хочешь потерять». Человек вернулся на следующий день и отметил тренировку.

Архитектура, к которой пришли

Сейчас схема выглядит так:

Пользователь —> отмечает действие или пропускает Аналитический слой —> считает тренды и паттерны Решатель стиля —> выбирает тон ответа под персонажа LLM (GTP-4o-mini, чтобы не разориться) —> генерирует ответ Пост-процессор —> проверяет длину, токсичность, наличие пользы

В ответе агент может: — Похвалить конкретное достижение (не «молодец», а «ты закрыл 5 тренировок подряд, это новый рекорд») — Спросить про причину срыва с вариантами ответа — Предложить снизить планку, если видит перегруз — Связать прогресс с игровой механикой («ещё два дня — и ты откроешь редкий цветок») — В редких случаях — просто съязвить (в строгом режиме)

Стоимость одного ответа — около 0,003-0,005$ на GPT-4o-mini. На нагрузку 1000 активных пользователей в день — около $3-5 в день на AI-коучинг. В рамках подписки ($5-10/мес) это окупается.

Что говорят пользователи

Собрали stats за первый месяц беты (около 40 активных): — Retension D7 — 64% (для трекеров привычек норма — 30-40%) — D30 — 38% (норма — 15-25%) — 72% пользователей хотя бы раз ответили агенту (не просто прочитали) — Средняя глубина диалога — 4 сообщения за сессию — 18% пользователей сменили стиль коуча в первую неделю

Прямые цитаты из обратной связи: «Сначала бесил, потом привык. Теперь реально стыдно пропускать, потому что он спросит» «Я попросила быть помягче, он стал мягче. Но когда я начала оправдываться — он сказал „ты сама попросила строгость две недели назад, что изменилось?“. Было неприятно, но справедливо» «Спорю с ИИ-психологом каждое утро. Лучшее начало дня»

Не без проблем: — Иногда агент не понимает шуток и воспринимает буквально — На сложных эмоциональных состояниях (выгорание, депрессия) даёт советы, которые выглядят обесценивающими. Пришлось добавить детектор триггерных тем и маршрутизацию к заглушке «рекомендуем обратиться к специалисту» — Несколько раз модель «ломалась» и начинала давать общие советы, как в первой версии — приходится мониторить качество через A/B тесты

Стоило ли оно того

Я не буду говорить, что мы «совершили прорыв». ИИ-коучинг — штука скользкая. Пользователи либо слишком доверяют агенту, либо слишком критикуют. Золотая середина — редкость.

Но цифры retention говорят сами за себя: люди возвращаются не столько ради ачивок, сколько ради диалога. Им интересно, что скажет агент. Они хотят поспорить, доказать, что он неправ, или — реже — признать, что он прав.

Если подводить итог: ИИ-коучинг в Bloom работает не как «эксперт», а как «зеркало». Оно отражает твои же паттерны и заставляет задуматься. Технически сложно, дороговато для стартапа, и иногда пользователи пишут «отстань». Но D64 vs 30-40% у конкурентов — это аргумент, с которым не поспоришь.

P.S. Мы продолжаем докручивать Bloom и в следующих постах расскажу про геймификацию, про работу с Health API и про то, как мы в Paladin Engineering встраивали агентов в продукт, не сломав пользовательский опыт. Если есть вопросы по AI-коучингу или трекерам привычек — пишите, обсудим.

2