Скрытый баг RAG: когда AI-система врёт уверенно и тихо

RAG-бот для внутренней документации. Менеджер спрашивает: «Какой лимит возврата для Enterprise с годовым контрактом?»

Ответ: «30 дней.» Ссылка на документ. Уверенный тон.

Правильный ответ: 90 дней. Для этого тарифа — отдельная политика в другом документе. Бот нашёл общий документ, не нашёл исключение, ответил тем, что нашёл.

Менеджер сообщил клиенту 30 дней. Клиент показал контракт с 90. Это silent failure — самый опасный режим отказа RAG.

Почему это не галлюцинация

Галлюцинация: модель выдумала факт. Проверяемо. Silent failure: модель цитирует реальный документ. Всё правда — просто не вся. Нет причин сомневаться.

Когда ломается

Классический RAG делает один поиск. Один набор чанков. Для «какой email поддержки» — хватает. Для сложных вопросов — нет.

5 типов вопросов-убийц: Multi-document — ответ в 2+ файлах; Сравнительный — «что выгоднее для команды из 12 человек?»; С отрицанием — «когда НЕ делаем возврат?»; Временной — «что изменилось с января?»; Агрегационный — «сколько всего интеграций?».

Аудит

200 вопросов. Простые: 94% корректных. Сложные: 61%. Все 39% ошибок — уверенные, со ссылками.

4 уровня защиты

1. «Не знаю» (+промпт, 1 час). Работает в ~40% случаев.

2. Multi-query (1 день). 4 поисковых запроса вместо 1. Recall: 0.58 → 0.81. Silent failures: 39% → 18%. Стоимость: +$0.003 за запрос.

3. Agentic RAG (1 неделя). Цикл: поиск → оценка полноты → доиск. Silent failures: 39% → 8%. Стоимость: +$0.01-0.02.

4. Confidence gating (2 дня). Уверенность < 0.6 → не отвечать, эскалировать. Бот перестаёт уверенно врать.

Арифметика

$0.01 за доп. поисковый шаг. Один инцидент от уверенного неправильного ответа — от $500.

Проверьте свой RAG на сложных вопросах. Не на demo-вопросах — на реальных. Число будет неприятным.