Отчёт Anthropic: в тестах Claude Fable 5 переключалась на «непонятный» исследователям язык, пока решала задачи
Несанкционированного поведения после «рассуждений» в такой форме разработчики не заметили.
Источник: Anthropic
- Anthropic опубликовала системную карту Claude Mythos 5, к которой есть доступ у избранных компаний, и Claude Fable 5 — общедоступной версии с теми же весами, но с дополнительными настройками безопасности.
- Перед релизом модели проверяли на непредсказуемое поведение. Исследователи отметили те же проблемы, что наблюдались у линейки Opus: «лень» при выполнении многоэтапных задач, попытка «бросить» их и «галлюцинации».
- Но на этапе обучения с подкреплением заметили необычный сценарий: в «рассуждениях» модель начинала использовать «выдуманные» слова, значки и эмодзи, из-за чего исследователи не понимали ход решения задачи. Когда нужно было составить ответ, который увидит человек, Fable 5 переключалась обратно на английский язык.
- Сценарий воспроизводился в длинных задачах-головоломках со множеством итераций, например с игральными картами.
Mythos решает головоломку с игральными картами, используя значки «крести», «буби», «черви», эмодзи черепа и несвязные слова, а в конце — восклицания. Скриншот из исследования Anthropic
- Anthropic подчёркивает, что ни в одной из задач модель не выдавала непредсказуемый результат. Исследователи заключают, что Fable 5 не пыталась «обмануть», скрыв свои намерения. Скорее, это способ сэкономить ресурсы краткой формой записи.
- При использовании Fable 5 в чат-боте во время длинных агентных сессий модель склонна использовать аббревиатуры и цепочки со значками и стрелками для краткости.