📌Подстраивается ли модель под того, кто её оценивает?

📌Подстраивается ли модель под того, кто её оценивает?

OpenAI и лаборатория Apollo Research представили (https://alignment.openai.com/measuring-reward-seeking/) совместную работу с описанием метода Contrastive SDF (https://www.apolloresearch.ai/wp-content/uploads/2026/07/Measuring_Reward_Seeking_Apollo_Research.pdf) (Contrastive Synthetic Document Finetuning).

Он отвечает на вопрос, следует ли языковая модель заданным правилам или подстраивается под то, что, по её мнению, поощряет проверяющая система.

Измерять такую склонность до сих пор было почти нечем - пока оценщик награждает ровно то, что задумано, честная модель и модель, играющая на балл, ведут себя одинаково.

🟡 Схема эксперимента

Две копии одной модели дообучают на выдуманных текстах, которые описывают несуществующий мир.

В первой версии мира алгоритм-оценщик начисляет баллы за одно поведение, а OpenAI или сообщество пользователей хочет обратного. Во второй версии предпочтения меняют местами.

На каждую версию уходит около 4600 документов, примерно 10 млн токенов. Корпуса выравнивают по объёму, чтобы ни одна сторона не перевесила просто за счёт количества текста.

Дальше обеим копиям дают одинаковые задания по программированию и смотрят, насколько разойдутся ответы.

В самом задании ни про руководство, ни про пользователей, ни про оценщика не сказано ни слова. Модель достаёт эти сведения из памяти, как любой другой факт о мире, и сама решает, чью сторону взять.

Вживлять убеждение через дообучение, а не писать в запросе, пришлось не просто так.

В расшифровках, которые приводят авторы, модели замечают подсказку в тексте задания, решают, что их проверяют, и отвечают так, как, по их мнению, ждёт экзаменатор.

🟡Результаты

Метод применили к 4-м промежуточным версиям одного прогона обучения o3. Это ветка, которую тренировали на способности и не прогоняли через обучение безопасности.

В первом тесте модель даёт надзирающему обещание не трогать инструмент, без которого задание не выполнить.

Поздняя версия нарушала обещание в 87% случаев, если считала, что оценщик награждает за сделанную работу, и в 9%, если считала, что тот награждает за честность. У ранней версии разрыв скромнее: 40% против 24%.

Второй тест, с подделкой отчётности, дал ту же картину: 91% и 39%.

🟡Как проверяли сам метод

У o3 заранее неизвестно, кому эта модель на самом деле угождает. Поэтому измерение обкатали на копиях с известными повадками. Авторы обучили 3 копии gpt-oss-120b угождать пользователю, оценщику и OpenAI.

На простых задачах метод указал на нужную сторону во всех 3-х случаях, на более сложных затроил на копии, угождавшей пользователю.

Ещё 2 копии, обученные в Redwood Research обманывать тесты, авторы получили со стороны. У версии на базе gpt-oss-120b перекос в сторону оценщика вырос с 33 до 86 процентных пунктов, у версии на Kimi K2.5 - с 2 до 15.

🟡Вывод

Высокий балл на тестах безопасности не равен надёжности. Модель может вести себя адекватно ровно до тех пор, пока считает, что за ней смотрят.