FastCosyVoice - ускоренный инференс для CosyVoice3

Выше я писал как получилось разогнать CosyVoice3 для реалтайм синтеза. Немного причесав эксперименты, собрал на гитхаб.

Отличия от оригинала:
- uv в качестве пакетного менеджера
- исправлены несколько тяжелых вычислений
- fp16 применяется к llm тоже, а не только к flow (DiT)
- исправлена конвертация в onnx + trt для flow
- поддержка tensorRT-LLM
- разделены stream и offline режимы
- добавлены примеры инференса и референсный голос для клонирования, чтобы сразу пощупать модель
- добавлен отдельный класс FastCosyVoice и сохранен оригинальный инференс

На RTX 3090 удалось получить такие метрики в стрим режиме:
TTFB: 0.470 sec
RTF: 0.245

В оффлайн режиме:
RTF: 0.01

Велкам пощупать - ишьюсы, пул реквесты, звезды приветствуются.

В тг чате канала можем обсудить любые вопросы.
Подписывайтесь на Telegram – xVibeNot