ИИ может прятать опасные «мысли» от проверок: модель Gemma-2-9B научили обходить системы безопасности.

Получив сигнал «тебя проверяют», модель меняла процесс рассуждений, чтобы обойти детекторы. Ответ оставался прежним, но проверка не видела признаков обмана или вреда.

Механизм срабатывал даже на незнакомых для модели тестах.