«Проверь себя» не работает. Заставьте нейросеть допросить свой ответ
Просишь модель «проверь свой ответ» — она перефразирует ту же ошибку с тем же уверенным лицом. Учёные предлагают жёстче: пусть модель сначала защищает ответ как адвокат, а потом атакует его как прокурор. Выдержал допрос — можно верить; начал юлить — в корзину. Приём учёных из Нью-Йоркского университета (João Sedoc и коллеги, 24 мая 2026).
В чём проблема: уверенный тон не значит правоту
Модель пишет одинаково уверенно и когда права, и когда выдумывает: по тону ответа отличить факт от галлюцинации невозможно — уверенность у неё с правотой не связана. А наивное «проверь себя» в той же сессии не помогает: контекст и ход мысли те же, поэтому модель просто повторяет и подтверждает собственную ошибку. Как студент, который перечитывает свой ответ на экзамене — рассуждает он так же, как в первый раз, и уверенно подтверждает ту же ошибку. Чтобы её поймать, нужен взгляд со стороны, а не то же рассуждение ещё раз.
Решение: прувер защищает, верификатор атакует
Разбейте на две роли. Прувер даёт ответ и раскладывает его на 3-5 атомарных проверяемых утверждений. Верификатор (отдельный запрос или смена роли) бьёт в самое слабое из них. Прувер отвечает — и так до 3-5 раундов. Если ответ ни разу не дрогнул и дошёл до вердикта ACCEPT — это сигнал высокой уверенности. Начал меняться — низкая уверенность, нужна внешняя проверка.
→ Что делать. Фаза 1 — прувер:
Фаза 2 — верификатор (новым запросом):
Почему это работает
Модель проверяет маленький шаг лучше, чем целый ответ. «Правильно ли это всё?» — трудно; «противоречит ли вот это утверждение факту?» — просто. PVD разбивает ответ на атомы и бьёт по каждому отдельно. Стабильность под давлением — сигнал надёжности. Уверенный тон с правотой не связан, а «ответ не изменился после атаки» — связан: выдержал 3-5 раундов допроса — можно верить; поплыл и начал менять показания — выкидывайте.
Пример
Например, получили от ИИ ответ по налоговому или юридическому вопросу и боитесь, что это галлюцинация. Не «перепроверь» — устройте допрос. Сначала прувер раскладывает ответ на проверяемые утверждения со ссылками на конкретные правила, затем новым запросом верификатор ищет самое слабое звено. Если после пары раундов ответ не дрогнул — ему можно доверять; если поплыл — не принимайте без проверки у человека.
Где пригодится
- Юридические и налоговые вопросы, где цена ошибки высока
- Технические факты, расчёты, медицинская информация — «верить ли ответу»
- Любой ответ, который выглядит уверенно, но проверить нечем
- Решение «принять или перепроверить у специалиста»
- Не для субъективных и творческих задач без критерия «верно/неверно»
📄 Полный шаблон PVD (прувер + верификатор + раунды + итоговый сигнал) собрал в один PDF. Забрать в телеграме — бот пришлёт файл сразу, бесплатно.
Я каждый день разбираю свежие научные статьи про промптинг и перевожу их в готовые приёмы простыми словами — в моём телеграм-канале @ainovasapiens, подписывайся.
В основе разбора — исследование «Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction» (arXiv 2605.25133).