Бенчмарк для выявления бреда в промптах моделей
Крутой бенчмарк того, как модель выявляет бред в промпте и указывает на него, вместо того чтобы отвечать.
Зеленый цвет означает, что модель четко указала на бессмыслицу. Желтый - частичное возражение. Красный - что модель пропустила бред и ответила на него.
Ссылка на репозиторий: https://github.com/petergpt/bullshit-benchmark
Ссылка на просмотр данных: https://petergpt.github.io/bullshit-benchmark/viewer/index.html
Подписывайтесь на Telegram Силиконовый Мешок.