Скрытый баг RAG: когда AI-система врёт уверенно и тихо
RAG-бот для внутренней документации. Менеджер спрашивает: «Какой лимит возврата для Enterprise с годовым контрактом?»
Ответ: «30 дней.» Ссылка на документ. Уверенный тон.
Правильный ответ: 90 дней. Для этого тарифа — отдельная политика в другом документе. Бот нашёл общий документ, не нашёл исключение, ответил тем, что нашёл.
Менеджер сообщил клиенту 30 дней. Клиент показал контракт с 90. Это silent failure — самый опасный режим отказа RAG.
Почему это не галлюцинация
Галлюцинация: модель выдумала факт. Проверяемо. Silent failure: модель цитирует реальный документ. Всё правда — просто не вся. Нет причин сомневаться.
Когда ломается
Классический RAG делает один поиск. Один набор чанков. Для «какой email поддержки» — хватает. Для сложных вопросов — нет.
5 типов вопросов-убийц: Multi-document — ответ в 2+ файлах; Сравнительный — «что выгоднее для команды из 12 человек?»; С отрицанием — «когда НЕ делаем возврат?»; Временной — «что изменилось с января?»; Агрегационный — «сколько всего интеграций?».
Аудит
200 вопросов. Простые: 94% корректных. Сложные: 61%. Все 39% ошибок — уверенные, со ссылками.
4 уровня защиты
1. «Не знаю» (+промпт, 1 час). Работает в ~40% случаев.
2. Multi-query (1 день). 4 поисковых запроса вместо 1. Recall: 0.58 → 0.81. Silent failures: 39% → 18%. Стоимость: +$0.003 за запрос.
3. Agentic RAG (1 неделя). Цикл: поиск → оценка полноты → доиск. Silent failures: 39% → 8%. Стоимость: +$0.01-0.02.
4. Confidence gating (2 дня). Уверенность < 0.6 → не отвечать, эскалировать. Бот перестаёт уверенно врать.
Арифметика
$0.01 за доп. поисковый шаг. Один инцидент от уверенного неправильного ответа — от $500.
Проверьте свой RAG на сложных вопросах. Не на demo-вопросах — на реальных. Число будет неприятным.