Отчёт Anthropic: в тестах Claude Fable 5 переключалась на «непонятный» исследователям язык, пока решала задачи

Несанкционированного поведения после «рассуждений» в такой форме разработчики не заметили.

Источник: Anthropic
Источник: Anthropic
  • Anthropic опубликовала системную карту Claude Mythos 5, к которой есть доступ у избранных компаний, и Claude Fable 5 — общедоступной версии с теми же весами, но с дополнительными настройками безопасности.
  • Перед релизом модели проверяли на непредсказуемое поведение. Исследователи отметили те же проблемы, что наблюдались у линейки Opus: «лень» при выполнении многоэтапных задач, попытка «бросить» их и «галлюцинации».
  • Но на этапе обучения с подкреплением заметили необычный сценарий: в «рассуждениях» модель начинала использовать «выдуманные» слова, значки и эмодзи, из-за чего исследователи не понимали ход решения задачи. Когда нужно было составить ответ, который увидит человек, Fable 5 переключалась обратно на английский язык.
  • Сценарий воспроизводился в длинных задачах-головоломках со множеством итераций, например с игральными картами.
Mythos решает головоломку с игральными картами, используя значки  «крести», «буби», «черви», эмодзи черепа и несвязные слова, а в конце — восклицания. Скриншот из исследования Anthropic
Mythos решает головоломку с игральными картами, используя значки «крести», «буби», «черви», эмодзи черепа и несвязные слова, а в конце — восклицания. Скриншот из исследования Anthropic
  • Anthropic подчёркивает, что ни в одной из задач модель не выдавала непредсказуемый результат. Исследователи заключают, что Fable 5 не пыталась «обмануть», скрыв свои намерения. Скорее, это способ сэкономить ресурсы краткой формой записи.
  • При использовании Fable 5 в чат-боте во время длинных агентных сессий модель склонна использовать аббревиатуры и цепочки со значками и стрелками для краткости.
8
8
3
2