Более 6 лет запускаю AI/ML продукты в промышленности, финтехе и на маркетплейсах. Перешел в продуктовый менеджмент из Data Science. https://t.me/mlboroda
для всех, кого интересует тема кредитного скоринга, очень рекомендую статью Alexey Masyutin, Vadim Anpilogov и Романа Тихонова про оценку качества скоринговых моделей и связь ML-метрик с экономическим эффектом через матрицу ошибок.
Эта работа в свое время помогла мне решить тестовое задание и дала базовый фундамент по кредитному скорингу.
У T-Search качество оценивалось на их собственных бэнчах.
Для Harness-1 брали опенсорс бэнчи, при этом часть из них обознача как held-out, с точки зрения домена (т.е. вопросов и соответствующих траекторий из этих доменов не было на обучении). При этом, судя по их результатам, они не только получили кросс-доменный перенос связки LLM+харнес, но и даже зафиксировали доп буст по качеству Поиска (относительно уровня приростов на бенчах, вопросы из которых пересекались с доменами из обучения).
В обоих подходах агенты генерят не ответ, а набор чанков из базы знаний, которые нужно далее по цепочки отправлять в следующий агент для генерации ответа.
По сути, через Recall (набор найденных чанков из множества актуальных для данного запроса) и оценивается качество поисковой траектории.