Кастомный словарь: как научить AI-диктофон профессиональным терминам

Кастомный словарь: как научить AI-диктофон профессиональным терминам

Производители систем распознавания речи любят одну цифру: точность 90+% на бытовой русской речи. Цифра честная - но она измерена на общем корпусе разговоров, а не на вашем конкретном словаре имён, названий и аббревиатур. Разрыв между «в среднем по рынку» и «в моём конкретном случае» - рабочий пример того, почему любой AI-бенчмарк нужно проверять на своих данных, а не переносить с чужого замера.

Один бенчмарк, два разных результата на практике

Замер, который обычно попадает в презентацию продукта, снят на общем потоке бытовых разговоров - там доля неверно распознанных слов держится в районе 8-12% без всякой донастройки. Стоит перейти на закрытую профессиональную лексику - фирменные названия, редкие бренды, узкоспециализированные термины - и та же система начинает промахиваться уже в четверти случаев, вплотную к 25%. Технической поломки тут нет: система обучалась на массиве текстов, где эти конкретные слова попадались редко или не попадались вовсе, и при встрече с ними достраивает наиболее вероятный вариант из того, что видела чаще.

Разница в 8-12% против 25% - это не абстракция. Если ваша работа держится на конкретных именах собственных, аббревиатурах или терминах, которые редко встречаются в обучающей выборке модели, средний по рынку бенчмарк для вас почти бесполезен: он описывает не ваш кейс, а некий средний разговор, которого в вашей практике не бывает.

Два механизма подгонки - и у каждого свой предел

У систем распознавания есть два способа сдвинуть точность на конкретной лексике, и у обоих есть жёсткая граница.

Первый - подсказка перед распознаванием: список ожидаемых слов, который смещает вероятность модели в сторону нужного написания. У неё есть лимит объёма - порядка 200 слов у распространённых моделей, и при превышении список обрезается, причём часто с начала. Практический вывод: приоритетные термины нужно ставить в конец списка, а не как попало - иначе именно они первыми улетят за границу лимита.

Второй механизм действует уже на выходе, а не на входе: постобработка текста меняет заранее заданный шаблонный набор символов на верное написание. Работает предсказуемо, пока связка «искажение → верный вариант» однозначна; как только один и тот же артефакт распознавания должен разворачиваться в два разных термина в зависимости от фразы, шаблонная замена начинает путать их между собой.

Оба механизма живут только внутри одной сессии обработки: ни один из них не переносится в постоянную память системы, и настройку приходится повторять при каждом новом запуске, где термин снова нужен.

Где точность настройками не дотягивается до 100%

Есть категория входных данных, для которой оба инструмента настройки бессильны в равной степени: точные числовые значения на слух, объёмные цитаты слово в слово и разовое упоминание редкого имени в самом начале записи, до которого система ещё не успела приспособиться. В этой зоне единственная работающая процедура - проверить фрагмент по звуковой дорожке вручную, а не пытаться выжать больше точности из настроек.

Это ровно тот случай, когда «докрутить модель ещё немного» не работает как стратегия: технический предел метода, а не недоработка конкретного продукта.

Кастомный словарь: как научить AI-диктофон профессиональным терминам

Что это значит для оценки любого AI-инструмента, не только диктофона

Общий урок шире одной задачи распознавания речи: любой публичный бенчмарк AI-инструмента измерен на чужом распределении данных. Перед тем как опираться на цифру точности в решении - купить/внедрить/довериться - стоит явно проверить, насколько ваш собственный набор входных данных похож на тот, на котором цифра получена. Разрыв в разы (8-12% против 25%) на, казалось бы, той же самой модели - типичный масштаб такого расхождения, а не редкое исключение.

Практика сбора рабочего словаря терминов под свою специфику (15-30 слов на сессию, приоритетные - в конец списка, обновление по факту реальных ошибок, а не «про запас») - не хитрость конкретного диктофона, а рабочий шаблон адаптации любого распознающего AI-инструмента под свой домен, который стоит держать в голове при оценке следующего продукта с обещанной точностью.

Кастомный словарь: как научить AI-диктофон профессиональным терминам

Частые вопросы

Значит ли это, что диктофонам с расшифровкой нельзя доверять на важных записях? Значит, что нужно знать границу метода: на общей бытовой речи точность действительно близка к маркетинговой цифре, а на своей узкой лексике - только после проверки на собственных данных и настройки словаря.

Можно ли раз и навсегда обучить модель своему словарю терминов? Нет - ни подсказка перед распознаванием, ни словарь замен после него не «запоминают» слово навсегда на уровне самой модели. Оба механизма нужно поддерживать заново для новых сессий.

Источники

Внутренние замеры точности систем распознавания на русском (общая бытовая речь против узкой отраслевой лексики).

Полный разбор приёмов настройки словаря - на сайте «Вспомни всё»: «Кастомный словарь: как научить AI-диктофон профессиональным терминам». Каталог AI-диктофонов «Вспомни всё» - vspomni-vse.ru/catalog.