NVIDIA выпустила Nemotron 3 Diarization — модель, которая понимает, кто говорит
NVIDIA открыла веса Nemotron 3 Diarization — модели для диаризации речи, которая определяет, когда и какой участник разговора говорит, включая ситуации с одновременной речью.
Модель рассчитана максимум на 8 участников и работает как с готовыми аудиозаписями, так и в потоковом режиме. При этом она не определяет личности людей, а присваивает им условные метки вроде speaker_0, speaker_1 и т. д.
Главная особенность — работа с перебиваниями. Если два человека говорят одновременно, система может зафиксировать активность сразу в нескольких каналах. Это особенно полезно для созвонов, встреч, подкастов и многоголосых интервью, где обычной расшифровки недостаточно.
По данным опубликованного NVIDIA тестирования, модель заняла 1-е место среди 12 систем в первоначальном Diarization-Bench от VoiceArena. DER составил 14,72% против 19,3% у следующей системы — примерно на 24% меньше относительных ошибок. При этом сама модель содержит около 100 млн параметров.
Есть и режимы с низкой задержкой: рекомендуемые варианты начинаются с 1,04 секунды и доходят до 0,32 секунды буфера. Правда, меньшая задержка может снижать точность и производительность, поэтому конкретный режим зависит от задачи.
Отдельно важно: Nemotron 3 Diarization не заменяет распознавание речи. Она определяет активность и временные интервалы говорящих, а для получения текста её нужно объединять с ASR-моделью.
😛 Модель доступна на Hugging Face, а попробовать её работу можно в интерактивном демо.