FastCosyVoice - ускоренный инференс для CosyVoice3
Выше я писал как получилось разогнать CosyVoice3 для реалтайм синтеза. Немного причесав эксперименты, собрал на гитхаб.
Отличия от оригинала:
- uv в качестве пакетного менеджера
- исправлены несколько тяжелых вычислений
- fp16 применяется к llm тоже, а не только к flow (DiT)
- исправлена конвертация в onnx + trt для flow
- поддержка tensorRT-LLM
- разделены stream и offline режимы
- добавлены примеры инференса и референсный голос для клонирования, чтобы сразу пощупать модель
- добавлен отдельный класс FastCosyVoice и сохранен оригинальный инференс
На RTX 3090 удалось получить такие метрики в стрим режиме:
TTFB: 0.470 sec
RTF: 0.245
В оффлайн режиме:
RTF: 0.01
Линк на гитхаб:
https://github.com/Brakanier/FastCosyVoice
Велкам пощупать - ишьюсы, пул реквесты, звезды приветствуются.
В тг чате канала можем обсудить любые вопросы.
Подписывайтесь на Telegram – xVibeNot