Команда Wan-AI открыла веса и скрипты Wan-Animate-2 — 14-миллиардной модели для анимации персонажей по исходному изображению и видео с движением.
Модель распространяют по лицензии Apache 2.0. Доступны базовая и дистиллированная версии, а также код для локального запуска. Подробности — в материале Postium.
Читайте также: 9 нейросетей для оживления фото
Нейросеть Wan-Animate-2: что умеет и как работает
Модель получает изображение персонажа и видео с движением. Она переносит движения из ролика на персонажа и формирует новый клип. Отдельный текстовый запрос описывает внешность персонажа и фон.

Разработчики отказались от промежуточных модулей извлечения движения. Они также добавили управление ракурсом через текст: камеру в результате можно задать отдельно от видео-референса.
В работе описана облегчённая версия Wan-Animate-2-Lite. Авторы заявляют, что она сокращает задержку до уровня, необходимого для потоковой анимации.
Как пользоваться
Скачайте код Wan-Animate-2 и создайте окружение Python 3.11. Затем установите PyTorch, зависимости проекта и загрузите веса с Hugging Face или ModelScope.
Для генерации понадобятся изображение персонажа, видео с движением и текстовое описание. В стандартной конфигурации модель рассчитана на восемь ускорителей NVIDIA A800 и выводит видео 720p; вариант 480p разработчики тестировали на двух A800.

Также доступна онлайн-демонстрация в ModelScope Studio. На момент публикации модель не представлена у Hugging Face Inference Providers.
Wan-Animate-2 также поддерживается библиотекой Hugging Face Diffusers. Для базовой и дистиллированной версий доступны отдельные пайплайны.
Что это меняет? Модель можно запускать локально и встраивать в собственный видеопроцесс без обязательного обращения к закрытому API. При этом официальные тесты рассчитаны на серверное оборудование: разработчики указывают конфигурацию с восемью A800 для 720p и двумя A800 для 480p. Требования для потребительских видеокарт в документации не указаны.
Итог: Wan-Animate-2 даёт разработчикам открытые веса для анимации персонажей по изображению и видео-референсу, а также возможность использовать модель через Diffusers и другие инструменты экосистемы.
Ранее Alibaba открыла публичное бета-тестирование Wan3.0. Модель генерирует видео длительностью до 30 секунд за один запуск.