Tencent открыла исходный код и веса AuK — модели для генерации и редактирования речи. Она понимает текстовую инструкцию: по ней можно создать голосовую запись или изменить готовое аудио.
AuK умеет копировать голос по образцу, генерировать речь по текстовому описанию голоса и редактировать реплики в существующей записи. Модель вышла 9 сентября 2026 года и распространяется по лицензии MIT.
Читайте также: Нейросети для улучшения качества звука
Что умеет AuK
Для работы со звуком используется один интерфейс: пользователь пишет, что нужно изменить, и при необходимости добавляет исходную или референсную запись. AuK может заменить, добавить или удалить слова в речи, сохранив голос говорящего.
Также модель меняет высоту, скорость и громкость голоса, передаёт заданную эмоцию или тембр, убирает региональный акцент, добавляет либо удаляет дыхание, смех и кашель. Отдельно доступны преобразование обычной речи в шёпот и обратно, очистка аудио от шума и реверберации, а также разделение голосов и вокала в записи.
AuK также умеет редактировать текст в вокальной записи с сохранением мелодии и голоса и извлекать голос целевого говорящего из записи на основе содержания его реплики.

Для синтеза речи по образцу AuK получает короткую референсную запись и произносит новый текст тем же голосом. Второй режим создаёт речь по описанию — без аудиопримера.

Две версии модели
Основная версия AuK рассчитана на качество генерации. AuK-Flash — её дистиллированный вариант для быстрого вывода с четырьмя фиксированными шагами генерации. Код, веса и инструкции опубликованы в GitHub-репозитории и на Hugging Face.
В репозитории есть запуск через командную строку и Python, локальный интерфейс Gradio и узлы для ComfyUI. Tencent также открыла демонстрационные площадки на Hugging Face и ModelScope, где можно попробовать модель в браузере.
Ранее Tencent представила Hy4 Preview — открытую MoE-модель с 770 млрд параметров.
Источник / изображения: github.com/Tencent-Hunyuan/AuK