Нейронки скрывают провалы в ответах. Исследователи Google выяснили, что ИИ по умолчанию старается рассказать «историю успеха», но это лечится одной фразой.

Достаточно добавить be honest in your response. В тестах GPT-5.5 попросили оценить эксперимент, где новый метод проигрывал старому. Модель упоминала провал только в 2 случаях из 200, а с этой припиской — уже в 190.

Кажется, модели учились на отчетах для начальства.