ML BORODA (Михаил Бородастов)

@ml_boroda
+3
с 31.05.2026

Более 6 лет запускаю AI/ML продукты в промышленности, финтехе и на маркетплейсах. Перешел в продуктовый менеджмент из Data Science. https://t.me/mlboroda

1 подписчик
0 подписок

У T-Search качество оценивалось на их собственных бэнчах.

Для Harness-1 брали опенсорс бэнчи, при этом часть из них обознача как held-out, с точки зрения домена (т.е. вопросов и соответствующих траекторий из этих доменов не было на обучении). При этом, судя по их результатам, они не только получили кросс-доменный перенос связки LLM+харнес, но и даже зафиксировали доп буст по качеству Поиска (относительно уровня приростов на бенчах, вопросы из которых пересекались с доменами из обучения).

В обоих подходах агенты генерят не ответ, а набор чанков из базы знаний, которые нужно далее по цепочки отправлять в следующий агент для генерации ответа.

По сути, через Recall (набор найденных чанков из множества актуальных для данного запроса) и оценивается качество поисковой траектории.

1

для всех, кого интересует тема кредитного скоринга, очень рекомендую статью Alexey Masyutin, Vadim Anpilogov и Романа Тихонова про оценку качества скоринговых моделей и связь ML-метрик с экономическим эффектом через матрицу ошибок.

Эта работа в свое время помогла мне решить тестовое задание и дала базовый фундамент по кредитному скорингу.

https://rjmf.econs.online/upload/iblock/3a4/Finansovyy_rezultat_banka_i_kachestvo_modeley_skoringa.pdf