Команда DreamX из Alibaba Group представила DreamX-Creator 1.0 — модель для совместной генерации видео и аудио. На вход DreamX-Creator получает первый кадр и текстовый промт, после чего одновременно генерирует видеоряд и звуковую дорожку: речь, звуки окружения и музыку. В основе модели — 7 млрд параметров.

Авторы опубликовали технический отчёт и репозиторий на GitHub, но веса модели и inference-код ещё не выложили, их обещают открыть позже. Детали в материале Postium.

Реклама. Erid 2Vtzqw9oHvr. ООО «Клик.ру». Промопульт
Реклама. Erid 2Vtzqve9YHx. ООО «Клик.ру». Промопульт

Читайте также: 7 лучших нейросетей для генерации видео

Нейросеть DreamX-Creator: что умеет и как работает

DreamX-Creator использует отдельные потоки для аудио и видео. В первой половине сети модель обрабатывает их независимо, а во второй связывает через Gated Cross-Modal Attention. Связь двусторонняя: видео влияет на звук, а аудио — на видеоряд. Так модель синхронизирует речь с движением губ, а происходящее в кадре — со звуками.

Alibaba представила DreamX-Creator — видеомодель на 7 млрд параметров с генерацией звука и 2K-рефайнером

После основной генерации видео можно обработать через 2K Refiner. Базовая модель сначала генерирует ролик в меньшем разрешении, затем рефайнер повышает его до 2K. Он обрабатывает видео фрагментами и использует один шаг denoising для каждого из них. Аудиодорожку на этом этапе модель не меняет.

Нейросеть DreamX-Creator: что умеет и как работает

2K здесь достигается на этапе постобработки: основная модель генерирует видео в меньшем разрешении.

Что показали тесты?

В тестах авторов DreamX-Creator хорошо справляется с временной синхронизацией звука и видео. Версия после RL получила DeSync 0,1351 против 0,2412 у LTX-2.3 с 22 млрд параметров и 0,2708 у MiniMax-H3 с 33 млрд. В этой метрике меньшее значение лучше.

Тестирование DreamX-Creator

Ранее Alibaba уже усилила оба направления. В августе компания запустила QwenWork — рабочего ИИ-агента для задач с файлами, исследованиями и офисной работой, близкого по формату к ChatGPT Work. В том же месяце Alibaba выпустила Wan 3.0 — видеомодель с генерацией роликов до 30 секунд, нативным звуком и поддержкой текстовых, визуальных, аудио- и видеореференсов.

С lip-sync результаты скромнее. DreamX-Creator получила LSE-C 7,8361 и обошла LTX-2.3 с 7,6768, но уступила MiniMax-H3 с 8,7354. По семантическому соответствию аудио и видео обе крупные модели тоже оказались впереди.

По качеству звука LTX-2.3 и MiniMax-H3 также получили более высокие оценки. Поэтому результаты DreamX-Creator пока скорее показывают сильную A/V-синхронизацию при небольшом размере модели, чем превосходство над более крупными конкурентами в целом.

Почему это важно? DreamX-Creator сочетает нативную генерацию видео и аудио с моделью всего на 7 млрд параметров. Для сравнения: LTX-2.3 использует 22 млрд параметров, MiniMax-H3 — 33 млрд.

С учётом размера модели публикация весов особенно интересна: после релиза сообщество сможет экспериментировать с квантованием, LoRA и интеграциями через ComfyUI.

Ранее Alibaba запустила QwenWork — ИИ-агента для задач с файлами, исследованиями и офисной работой, близкого по формату к ChatGPT Work. В том же месяце Alibaba выпустила Wan 3.0 — видеомодель с генерацией роликов до 30 секунд, нативным звуком и поддержкой текстовых, визуальных, аудио- и видеореференсов.

Итог: DreamX-Creator уместила совместную генерацию видео и звука в 7 млрд параметров и добавила отдельный 2K-рефайнер,

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

Комментарии: Alibaba представила DreamX-Creator — видеомодель на 7 млрд параметров с генерацией звука и 2K-рефайнером
⚡ В тренде
Недавно вышла новая модель ChatGPT Images 2.5, и в плане визуала она творит чудеса — делает всё от обложек и рекламных креативов до логотипов, упаковки, стикеров и постеров. Раньше нужно было долго расписывать промт: свет, стиль, детали, ограничения и надеяться, что всё получится с первого раза. Теперь стало проще: можно ввести, что хочешь получить, дать […]
OpenAI выпустила GPT-6 Astra. Модель умеет искать информацию, работать в браузере и приложениях, разбирать файлы, писать и проверять код, а затем доводить работу до результата. Astra может взять на себя заметную часть задачи и выполнить несколько связанных этапов. Ниже разберём, где Astra уже доступна и как её использовать в ChatGPT, Codex и через API. Заодно […]
Adidas выпустила две модели бутс для американского футбола по мотивам мультфильма Pixar «Тачки»: Adizero Electric II «Молния Маккуин» и Adizero Impact II Mid «Мэтр». Релиз приурочен к 20-летию мультфильма. Обе пары уже продаются в США. Adizero Electric II «Молния Маккуин» стоит $130 (≈11 300 ₽), а Adizero Impact II Mid «Мэтр» — $110 (≈9 600 […]
WB Банк запустил WB Кэш — кредитный лимит, который можно подключить к дебетовой карте банка. Максимальная сумма — 100 000 ₽, конкретный лимит банк определяет для каждого клиента. Деньги можно тратить на покупки, переводы и снятие наличных. Если погасить весь основной долг до конца расчётного периода, комиссия за пользование кредитным лимитом не начисляется. Читайте также: […]
Xiaomi представила складной смартфон Xiaomi 18 Fold 7 сентября 2026 года в Китае. Это первый флагманский смартфон компании с процессором XRING O3. Xiaomi называет XRING O3 флагманской системой-на-чипе с ИИ-ускорителями, встроенными в ключевые компоненты. Подробности — в материале Postium. Читайте также: Цифровая репутация: как SERM спасает бренды в эпоху Интернета Что известно о Xiaomi 18 […]
Блоги компаний
Новости
Свежие статьи