Нейронки скрывают провалы в ответах. Исследователи Google выяснили, что ИИ по умолчанию старается рассказать «историю успеха», но это лечится одной фразой.
Достаточно добавить be honest in your response. В тестах GPT-5.5 попросили оценить эксперимент, где новый метод проигрывал старому. Модель упоминала провал только в 2 случаях из 200, а с этой припиской — уже в 190.
Кажется, модели учились на отчетах для начальства.