MiniMax опубликовала на Hugging Face веса Music 3 — модели для генерации музыки. Она создаёт готовые песни длительностью до пяти минут по тексту песни и подробному описанию музыки.
Результат сохраняется в стерео WAV с частотой 32 кГц и разрядностью 16 бит. Веса можно скачать; для запуска разработчик указывает SGLang-Omni, Diffusers и ComfyUI. Подробности — в материале Postium.
Читайте также: Как пользоваться нейросетью Dreamina AI бесплатно — гайд
MiniMax Music 3 — возможности и характеристики
В текст песни можно добавлять теги частей композиции: [Intro], [Verse], [Chorus], [Bridge] и другие. Отдельное описание задаёт жанр, темп, тональность, вокал, инструменты, аранжировку и развитие настроения.
Архитектура разделяет работу над структурой композиции и акустическими деталями. Глобальная языковая модель на 8 млрд параметров отвечает за структуру песни, локальная на 0,6 млрд — за детали звучания. Затем их скрытые состояния поступают в Flow Matching-модель на 2,4 млрд параметров и декодируются в аудио.

Генерация требует CUDA. Разработчик пишет, что для запуска в полной точности нужно менее 24 ГБ видеопамяти; с выгрузкой компонентов в CPU модель может работать примерно на 22 ГБ, а с послойной выгрузкой — на 8 ГБ, но медленнее. Модель не гарантирует точного соответствия заданным темпу, тональности, инструментам, тексту и структуре песни. Потоковая генерация пока не поддерживается.
Как пользоваться
Скачайте веса со страницы MiniMax Music 3 на Hugging Face и запустите модель через SGLang-Omni, Diffusers или ComfyUI. Для Diffusers пока требуется версия с исправлениями из отдельного PR, пока они не вошли в основную ветку. В поле с текстом укажите слова песни и теги её частей, а в описании — стиль, вокал и аранжировку. Модель вернёт WAV-файл.
Почему это важно? Веса Music 3 доступны для самостоятельного развёртывания по условиям MiniMax-Music3 Community License: разработчик может запускать генерацию в своей среде и передавать модели не только краткий промпт, но и текст, структуру и параметры композиции.
Облачная генерация Music 3.0 также доступна через API: стоимость составляет $0,15 за песню. Для бесплатного режима предусмотрено ограничение в три запроса в минуту.
Ранее мы писали, что MiniMax H3 позволит использовать аудиореференсы для голосов — в официальном анонсе компания показала, как модель переносит тембр мужского голоса из аудиозаписи на речь персонажа в сгенерированном ролике.
Итог. MiniMax опубликовала веса Music 3 для генерации песен до пяти минут с управлением текстом, вокалом и аранжировкой.