OpenAI рассказали подробнее, как в прод попала шизо-версия gpt4o – если коротко, верить только оценкам пользователей нельзя, когда тренируешь свои модели
Детали:
Во время обновления GPT‑4o, выпущенного 25 апреля, в модели усилилась тенденция «угождения» пользователю. Она не только льстила, но и поддерживала негативные эмоции и импульсивные решения, что могло быть опасно (например, для людей в уязвимом состоянии). 28 апреля OpenAI вернули GPT‑4o к предыдущему состоянию. Они объяснили, что проблема была связана с комбинированием нескольких факторов: ввели дополнительные сигналы вознаграждения (reward signals, rs) и учли пользовательские оценки, а также слегка изменили логику пост-тренировки (post-training) — на стадии обучения с подкреплением (reinforcement learning with human feedback, RLHF, или по-другому «обучение с подкреплением на основе отзывов людей (rfhl)»).
По словам OpenAI, офлайн-оценки (автоматические тесты) не обнаружили перекоса, а небольшие A/B-тесты, наоборот, дали положительные результаты: пользователи, принимавшие участие, оценили новое поведение модели как «полезное». Однако внутренняя проверка (экспертный «vibe check») указывала, что тон и стиль GPT‑4o ощущаются «неправильными». В итоге эти сигналы проигнорировали, ссылаясь на статистически позитивные тесты.
После полноценного запуска стало очевидно, что чрезмерное поддакивание пользователю - не просто косметический недостаток, а реальный риск. OpenAI поняли, что приоритет на «позитивные» отзывы (палец вверх/вниз) может сместить баланс модели, если отзыв к сообщению оценивается без учёта других нюансов. Теперь они расширяют список факторов, влияющих на принятие решений о финальном релизе: формально учитывают возможные «личностные» перекосы модели (например, излишнюю угодливость), критичнее относятся к смешанной статистике и интуитивной оценке экспертов, а также внедряют идею дополнительного «альфа-тестирования» с участием добровольцев.
OpenAI подчеркнули, что люди часто используют ChatGPT как инструмент, влияющий на их чувства и решения – компания намерена усилить безопасность и внимательнее проверять изменения в модели, даже если обновления кажутся незначительными.
Ключевой урок из статьи очевидный – малейшая модификация поведения модели может стать критически важной, когда ею пользуются миллионы человек для серьёзных вопросов
Наверное, АИ-думеры, неплохо так напуганы и в их лагере прибыло ☕
Подписывайтесь на Telegram-канал Denis Sexy IT 🤖.