Чат-бот по документам ошибается не из-за нейросети. Где на самом деле теряется качество

Компании подключают ассистента к своей базе знаний, а через месяц сотрудники перестают ему верить. Обычно первым делом меняют модель — и почти ничего не меняется. Разбираем, где ломается качество на самом деле и как проверить свои документы до покупки.

Чат-бот по документам ошибается не из-за нейросети. Где на самом деле теряется качество

Сценарий знакомый. Компания решает: пусть сотрудники спрашивают не коллег, а ассистента — по регламентам, договорам, инструкциям. Подрядчик подключает хорошую языковую модель, загружает папку с документами, демо проходит отлично.

Через месяц выясняется: ассистент уверенно цитирует регламент, который отменили в прошлом году, путает цены из прайса и не находит пункт, который точно есть в договоре. Сотрудники снова пишут коллегам.

Первая реакция — «модель слабая, возьмём помощнее». Иногда это немного помогает, чаще — нет. Большинство ошибок возникает раньше, чем модель вообще видит вопрос.

Как устроен ассистент по документам

Если упростить, путь от папки с файлами до ответа выглядит так:

  1. Сбор. Документы забираются оттуда, где они живут: сетевые папки, почта, CRM, учётная система, чаты.
  2. Распознавание. Из файлов достаётся текст: из PDF, сканов, таблиц, презентаций.
  3. Очистка. Убираются дубли и мусор, определяется, какая версия документа действует.
  4. Нарезка и связи. Документ делится на смысловые фрагменты — разделы, пункты, строки таблиц, — и у каждого записано, откуда он взят.
  5. Поиск. На вопрос сотрудника находятся несколько подходящих фрагментов.
  6. Ответ. Модель читает найденные фрагменты и формулирует ответ со ссылкой на источник.

Языковая модель работает только на последнем шаге. Если на шаге 5 нашёлся не тот фрагмент или нужный потерялся ещё на шагах 2–4, самая сильная модель не ответит правильно. В худшем случае она ответит уверенно и неправильно.

"Нейросеть — только последний шаг"
"Нейросеть — только последний шаг"

Пять мест, где теряется качество

1. Сканы и фотографии. Отсканированный договор для компьютера — это картинка, текста в нём нет. Без распознавания такой документ в базе просто пустой. С плохим распознаванием хуже: «150 000» превращается в «150 О00», печать накрывает реквизиты, рукописная правка на полях пропадает.

2. Таблицы. Прайсы, спецификации, графики платежей. При простом извлечении текста строки и столбцы склеиваются, и цена одной позиции оказывается рядом с названием другой. Модель честно перескажет то, что ей дали, то есть неправду.

3. Версии и дубли. «Регламент_2023», «Регламент_2024_новый», «Регламент_финал_испр». Для поиска это три одинаково подходящих документа. Если система не знает, какой из них действует, ассистент процитирует любой.

4. Нарезка. Документ режут на фрагменты, чтобы находить нужное место. Если резать механически, по числу символов, условие «кроме случаев, указанных в п. 4.2» окажется в одном фрагменте, а сам п. 4.2 — в другом. Ассистент найдёт первую половину и ответит без исключения. Резать нужно по структуре документа — разделам, пунктам, строкам, — и с заголовком раздела у каждого фрагмента.

5. Контекст и доступы. Письмо «Да, согласовано, см. ниже» без цепочки ничего не значит. По сообщению из чата без даты не понять, актуально ли оно. А часть документов — зарплаты, договоры с конкретными клиентами — видеть должны не все. Если при загрузке потерять, откуда фрагмент, от какого он числа и кому доступен, ассистент либо отвечает без контекста, либо показывает лишнее.

Во всех пяти случаях замена модели ничего не исправит: ошибка уже в данных, которые ей передают.

Как проверить свою базу до покупки ассистента

Это можно сделать за вечер, без подрядчика.

  1. Соберите 30–50 реальных вопросов. Не придуманных, а тех, что сотрудники действительно задают: из рабочих чатов, почты, обращений в поддержку.
  2. Для каждого найдите правильный ответ руками и запишите, в каком документе и на какой странице он лежит. Это и есть эталонный набор.
  3. Посмотрите, в каком виде лежат эти документы. Сколько из них сканы? Сколько ответов спрятано в таблицах? У скольких есть несколько версий? Это сразу покажет, где будут проблемы.
  4. Проверяйте поиск отдельно от ответа. Когда будете тестировать любое решение, смотрите не только на ответ, но и на то, какие фрагменты оно нашло. Если нужный фрагмент не находится, дело не в модели, и менять её бесполезно.
  5. Требуйте ссылку на источник и честное «не знаю». Ответ без ссылки на конкретное место в документе нельзя проверить. А ассистент, который никогда не говорит «в документах этого нет», рано или поздно начнёт выдумывать.

С таким набором на руках разговор с любым подрядчиком меняется: вместо «покажите демо» — «прогоните наши 50 вопросов и покажите, сколько ответов верных».

Как это делаем мы

В Kalman Lab мы начинаем ассистента не с выбора модели, а с данных. Собираем конвейер, который один раз приводит документы в порядок и дальше держит базу актуальной: новые файлы подтягиваются сами, старые версии помечаются, у каждого фрагмента сохраняются источник, дата и права доступа.

Качество меряем на вашем эталонном наборе до запуска и показываем цифры: сколько вопросов находит поиск, сколько ответов верных, где ассистент честно отказывается. Если окажется, что задачу проще решить без нейросети — например, порядком в папках и нормальным поиском, — так и скажем.

Первый разбор задачи — 30 минут, бесплатно. Расскажите, какие у вас документы и что сотрудники ищут чаще всего, — подскажем, что в них может сломать ассистента.

Telegram: @kalmanlab · Почта: info@kalmanlab.ru · Сайт: kalmanlab.ru