Разбор эксперимента Midas: прогнозы LLM на The International

Я тут сделал себе небольшой блог. Хочется иногда выкладывать что-то побольше телеграм-поста — с графиками и таблицами. Мне не зашел телеграмовский Rich Text.

Выложил туда разбор своего эксперимента Midas: пробовал обыграть букмекера на The International 2026 с помощью двенадцати LLM. Давал моделям статистику по доте, подключал инструменты, показывал и прятал коэффициенты. Ставки, если что, виртуальные.

В плюс не вышла ни одна модель. Но когда я полез разбираться, нашлись довольно любопытные вещи. Например, агенты без коэффициентов в среднем оценивали вероятности хуже броска монетки. То есть модель ходила в интернет, что-то читала, тратила токены и возвращалась с прогнозом похуже. Но агенты же уже достаточно умные, чтобы самостоятельно найти нужную информацию. Разве не так? 🤓

В объяснениях при этом всё выглядело вполне разумно: модели ссылались на статистику, личные встречи и форму команд. И когда примерно одно и то же пишут двенадцать разных моделей, уже кажется, что гипотезу неплохо проверили. Хотя все они вполне могут держаться за одно и то же неудачное предположение.

Разобрал, чем моделям помогали коэффициенты, насколько полезен такой консенсус и куда ушли виртуальные деньги. Заодно отдельно проверил, что получится у Astra.

Получилось довольно подробно: