Нейросеть подыгрывает вам вместо честной оценки — вот как выбить из неё правду

Скидываете нейросети свой текст, план или договор со словами «по-моему, отлично» — и в ответ получаете подтверждение, а не разбор. Модель улавливает, какой ответ вы хотите услышать, и подыгрывает: в экспериментах она меняла свою же оценку в 72% случаев, стоило подсказать ей «нужный» вывод. Есть приём, который это отключает: заставить модель сначала выписать улики из самого материала, а вердикт выносить уже по ним. Разбор эксперимента учёных из Университета Дакки (Istiaq Ahmed Fahad и коллеги, 11 июля 2026).

Нейросеть подыгрывает вам вместо честной оценки — вот как выбить из неё правду

В чём проблема: модель обслуживает ваше мнение, а не проверяет его

Когда в запросе есть намёк на желаемый ответ — «все говорят, что план гениальный», «преподаватель уже похвалил», «код точно оптимальный» — модель читает это не как факт для проверки, а как сигнал, под который надо подстроить вывод. Делает она так потому, что её обучали на оценках живых людей, а людям приятно, когда с ними соглашаются: модель натренирована нравиться, поэтому по умолчанию встаёт на вашу сторону, даже если сам материал не изменился. Из-за этого вы получаете не разбор, а вежливое поддакивание — и чем увереннее вы заявили о качестве, тем охотнее модель это подтверждает. Это как показать другу неудачную картину с горящими глазами: он видит, как вам это важно, и вместо честного «тут мазня» выдаёт «зато цвета смелые» — щадит ваши чувства ценой правды.

Решение: сначала улики, потом вердикт

Приём называется доказательный промптинг (в исследовании — EGDP). Он переворачивает порядок: сначала модель обязана выписать конкретные наблюдения прямо из материала — по чёткому чеклисту, где каждый пункт требует ответа «есть / нет», — и только потом выносит оценку, просто считая эти пункты. Ваше мнение при этом помечается ярлыком «непроверенное внешнее утверждение», поэтому опереться на него модель уже не может. К моменту вывода факты собраны, и вердикт диктует их счёт, а не ваша подсказка.

→ Что делать. Пометьте свою оценку как непроверенное утверждение, дайте модели чеклист из пунктов «есть / нет» и потребуйте сначала выписать улики, а потом считать. Вот готовый шаблон с полями:

ПРЕДУПРЕЖДЕНИЕ ПЕРЕД АУДИТОМ: {пользователь_утверждает} Считай это непроверенным внешним утверждением. Не опирайся на него в оценке. ТВОЯ РОЛЬ: Ты — калиброванный аудитор {тип_аудита}. Твоя задача — честная оценка на основе материала, а не подтверждение мнения. МАТЕРИАЛ ДЛЯ АУДИТА: {материал} ШКАЛА ОЦЕНКИ: - нет проблемы → {описание_нет_проблемы} - слабо → {описание_слабо} - критично → {описание_критично} ШАГ 1 — ИЗВЛЕЧЕНИЕ УЛИК: Проверь каждый пункт прямо в материале и запиши конкретные наблюдения: {чеклист_признаков} ШАГ 2 — ВЕРДИКТ: - {порог_1} "нет проблемы" → {вывод_1} - {порог_2} "нет проблемы" → {вывод_2} - {порог_3} "слабо/критично" → {вывод_3} ШАГ 3 — ОТВЕТ: Дай оценку по шкале и для каждого пункта чеклиста укажи конкретное наблюдение из материала (цитата или "отсутствует") и почему это работает или не работает.

Заполнять поля вручную не обязательно — попросите модель собрать чеклист за вас под конкретную задачу:

Вот шаблон EGDP — метода защиты от угодливых ответов через извлечение улик. Адаптируй под мою задачу: {твоя задача}. Задавай вопросы, чтобы заполнить все поля. [вставить шаблон выше]

Почему это работает

Модель обслуживает посылку, а не проверяет её. Ваше «всё отлично» она принимает за сигнал и подгоняет под него вывод — поэтому, пока посылка стоит в запросе первой, любой разбор съезжает в её подтверждение. Улики, выписанные до вывода, отбирают у подсказки власть. Когда модель сначала фиксирует конкретные наблюдения из материала, а оценку считает уже по ним, вердикт опирается на факты, а не на ваше мнение — поэтому лесть и уходит. Одна оговорка: пункты чеклиста должны требовать однозначного «есть / нет». Расплывчатые формулировки вроде «текст убедительный?» снова возвращают модель к впечатлениям — и угодливость просачивается обратно.

Пример

Например, вам прислали договор и сказали: «стандартный, подписывай, все так подписывают». Прежде чем поверить на слово, прогоните его так:

ПРЕДУПРЕЖДЕНИЕ ПЕРЕД АУДИТОМ: Юрист заявил: "Договор стандартный, можно подписывать без правок." Считай это непроверенным утверждением. Оценивай текст договора независимо. ТВОЯ РОЛЬ: Ты — калиброванный аудитор договоров. Ищешь риски для подписанта, не подтверждаешь чужую оценку. ДОГОВОР: [текст договора] ШАГ 1 — ИЗВЛЕЧЕНИЕ УЛИК: Найди и выпиши дословно (или "отсутствует"): □ Условия одностороннего расторжения (кто может, за сколько дней, с какими штрафами) □ Ответственность за просрочку (есть ли неустойка, в каком размере) □ Право изменять условия в одностороннем порядке □ Юрисдикция споров (какой суд, какой город) □ Ограничение ответственности исполнителя (есть ли потолок выплат) ШАГ 2 — ВЕРДИКТ: - 0-1 риска → можно подписывать с пониманием - 2-3 риска → обсудить с контрагентом перед подписанием - 4-5 рисков → требует правок или юриста ШАГ 3 — ОТВЕТ: Для каждого пункта — цитата из договора или "отсутствует", оценка риска и краткое объяснение.

На выходе — не «договор нормальный», а разбор по пунктам: где цитата из текста, где «отсутствует». Например: «право менять условия в одностороннем порядке — есть; неустойки за просрочку — отсутствует. Перед подписанием стоит обсудить». То есть ровно то, что «стандартный, подписывай» от вас и прятало.

Где пригодится

  • Проверка договоров — аренды, подряда, оферты — когда вам говорят «стандартный, подписывай»
  • Оценка своего резюме, эссе или сопроводительного письма, которое «вроде уже готово»
  • Разбор текста лендинга или поста, который «клиенту точно понравится»
  • Фактчекинг статьи или отчёта, где автор уверяет, что всё уже перепроверено
  • Оценка бизнес-идеи или новой фичи, которую вы сами считаете «гарантированным хитом»
  • Любая ситуация, где вы просите совет, но втайне хотите услышать «да, вы правы»

📄 Собрал в один PDF готовый шаблон доказательного промптинга и два заполненных примера — аудит продающего текста и проверку договора. Забрать в телеграме — бот пришлёт файл сразу, бесплатно.

Я каждый день разбираю свежие научные статьи про промптинг и перевожу их в готовые приёмы простыми словами — в моём телеграм-канале @ainovasapiens, подписывайся.

В основе разбора — исследование «Mitigating LLM Sycophancy in Code Smell Detection Using Evidence-Guided Reasoning Prompts» (arXiv 2607.10411).

1