Tencent релизнула одну модель на все задачи с речью
Tencent Hunyuan вместе с Шанхайским университетом выложили AuK (https://auk-project.github.io/), открытую базовую модель для генерации и редактирования речи на 1,5 млрд параметров.
Русского языка модель не знает, заявлены только китайский и английский. Авторы, правда, отмечают возможный перенос между языками - какая-то способность возникает сама, но поддержкой это не считается.
AuK (https://huggingface.co/tencent/AuK) принимает на вход текстовый запрос и, если нужно, исходное аудио и на выходе отдаёт готовый звук.
Всего заявлено пять типов задач: синтез речи (клонирование голоса по образцу и генерация по описанию), правка содержания (заменить слово в реплике или строчку в песне), акустика (темп, громкость, высота тона), паралингвистика (эмоция, тембр, акцент, вздохи и смешки, шёпот) и очистка с разделением (шумоподавление, выделение спикера, отделение вокала от музыки).
🟡Механика
Мультимодальная Qwen2.5-Omni читает инструкцию вместе с аудио и превращает её в смысловое условие. Аудио-VAE сжимает звук в компактное представление и потом восстанавливает обратно в волну.
Между ними работает трансформер по подобию FLUX - сначала десять блоков MMDiT, где смысловой и акустический потоки обмениваются информацией, оставаясь раздельными, затем двадцать обычных блоков DiT поверх склеенной последовательности.
🟡Тесты
По замерам Tencent, модель лидирует на Seed-TTS-Eval (разборчивость речи и похожесть на голос образца), InstructTTSEval (насколько точно модель отрабатывает словесное описание тембра), а также на MMAE-Speech и SpeechEditBench, где проверяют правки.
А вот на восстановлении сигнала (DNS Challenge, CHiME-4, Libri2Mix) она только конкурентоспособна, то есть узкоспециализированные модели там по-прежнему сильнее.
Отдельно выложена AuK-Flash (https://huggingface.co/tencent/AuK-Flash) - дистиллированная версия, которая укладывается в четыре шага вместо тридцати двух и работает в 4,5 раза быстрее.
К ней, кстати, нужно будет отдельно качать Qwen2.5-Omni-3B (https://huggingface.co/Qwen/Qwen2.5-Omni-3B) в роли энкодера.
В репозитории есть код установки, инференса на Gradio, ComfyUI (https://github.com/Tencent-Hunyuan/AuK/blob/main/docs/COMFYUI.md), дообучения (https://github.com/Tencent-Hunyuan/AuK#fine-tuning) и шаблоны инструкций с примерами в кукбуке (https://github.com/Tencent-Hunyuan/AuK/blob/main/docs/COOKBOOK.md).
Пощупать можно в демо на Hugging Face (https://huggingface.co/spaces/tencent/AuK) и ModelScope (https://modelscope.cn/studios/Tencent-Hunyuan/AuK).
📌Лицензирование: MIT License
🟡Страница проекта (https://auk-project.github.io/) 🟡Веса (https://huggingface.co/tencent/AuK) 🟡Arxiv (https://arxiv.org/pdf/2609.08936) 🟡Демо (https://huggingface.co/spaces/tencent/AuK) 🖥GitHub (https://github.com/Tencent-Hunyuan/AuK)