Руслан Соларев

+100
с 2023

Разработчик ИИ в компании "Русский Краб" и основатель стартапа

19 подписчиков
1 подписка

Михаил, спасибо за дополнение. Очень важная идея, которую надо держать в голове.

Спасибо большое за ваш комментарий, стараюсь давать две стороны медали в любом совете (чтобы не было ощущения, что есть какая-то "волшебная палочка")

Мне кажется главная задача любого бизнеса сейчас - начать появляться в ответах от ИИ (то есть GEO). Правильно обозначили про экономию времени при поиске, но, мне кажется, что оптимизация под ИИ сейчас одно из главных для бизнеса. Хотелось бы отдельный разбор про GEO.

1

По первому — верно, и это важное уточнение: 85% там нормированы на человеческую самосогласованность, а не абсолютная точность. Потолок действительно сильно ниже ста. В статье я выразился неточно, спасибо.
По второму бьёте в точку. Моя задача не сводится к бинарной классификации, так как помимо предсказания да/нет ещё учитывается сегмент для которого это имеет больший спрос (поэтому в моём случае 50% - это уже уход от чистого рандома в сторону осознанного предсказания).
Пока я не опубликую распределение классов, метрику и baseline — эта цифра не результат, а заметка на полях. Методику опишу отдельно. Если окажется, что мы на уровне монетки, так и напишу — канал ровно для этого.

Это проблема множественных сравнений — вторая большая дыра, о которой говорят реже. Механизм тот же: каждая лишняя метрика на дашборде — ещё одна попытка угадать.

Лечится тем же — дисциплиной до старта: одна главная метрика, зафиксированная заранее, решение только по ней. Остальные семь — защитные, они ловят поломки, а не объявляют победу. Если решение всё же по нескольким — нужны поправки на множественные сравнения.

Про 771 из 1000 отвечу так: там формулировка «достиг значимости в какой-то момент в течение теста», то есть данные смотрели непрерывно. Точной частоты проверок в описании нет, и выдумывать её не буду. Важная деталь: порог был 90%, а не 95% — при более строгом доля была бы заметно ниже. Так что 77% — это верхняя оценка худшего сценария. Более консервативный ориентир: 5–7 проверок примерно удваивают вероятность ошибки, к 20 она подбирается к 25%.

Ваш случай в чём-то хуже: подглядывание хотя бы заметно и его можно запретить регламентом. А восемь метрик на дашборде выглядят как ответственный подход к аналитике.

Спасибо за комментарий.

Универсального числа нет — «100 правил» никто не отмерит. Но момент ловится по нескольким сигналам.

Главный — регрессия правок: когда изменение одного правила начинает ломать другие. Пока правки независимы и спокойны — рано. Второй — рост исключений и «заплаток» вида «но если клиент из этого сегмента и не декабрь, то иначе»: так вы вручную аппроксимируете то, что модель выучила бы сама. Третий, самый измеримый — часы на поддержку: заведите метрику, сколько человеко-часов в месяц уходит на правку правил, и если график устойчиво растёт — вы у порога.

Практический совет: как только замечаете регрессию правок и рост этих часов — это сигнал начать считать ROI модели, а не сразу её строить. Иногда расчёт покажет, что порог ещё не пройден — и это тоже полезный ответ.

Я имел ввиду, спасибо что подметили, я постараюсь более понятно объяснять в следующих статьях. Касаемо вашего вопроса: тут фундаментальная ошибка в самом сборе информации. Если вы не понимаете, как отслеживать уход клиента, то никаким образом нельзя понять, ошибка ли это ии-агента (то есть, возможно ии-агент пропускал возможные оттоки клиентов; а возможно, сами действия по предотвращению потенциальных уходов клиентов - неэффективные). Хотите, могу сделать статью, в которой подробно расскажу, как отслеживать эффективность ии-агентов. Напишите, если хотите такой разбор