Команда LongCat из Meituan представила новую открытую видеомодель LongCat-Video — мощную архитектуру с 13,6 млрд параметров, которая умеет генерировать видео из текста, изображений и продолжать уже существующие ролики.

Главная особенность — генерация длинных видео. LongCat-Video способна создавать многоминутные ролики 720p/30fps, сохраняя связность сцен, цветовую стабильность и детализацию — без деградации, которая обычно появляется при длинной генерации. Postium собрал ключевые детали.

Реклама. Erid 2Vtzqw9oHvr. ООО «Клик.ру». Промопульт
Реклама. Erid 2Vtzqve9YHx. ООО «Клик.ру». Промопульт

Читайте также: 7 лучших нейросетей для генерации видео

Что умеет нейросеть LongCat-Video

LongCat-Video — это единая архитектура, совмещающая три задачи:

  1. Text-to-Video — создание роликов на основе текстового описания.
  2. Image-to-Video — «оживление» статичных изображений.
  3. Video-Continuation — продолжение видео, включая интерактивное продление по новым промптам.

Раньше такие задачи решались разными моделями, но здесь они объединены в одну — что упрощает использование и делает результат более цельным.

Как работает ИИ-модель LongCat-Video

  1. Архитектура DiT (Diffusion Transformer). Модель построена на плотной (dense) архитектуре без «смеси экспертов» (MoE). Это делает её стабильнее и предсказуемее при длинной генерации.
  2. Обучение на продолжении видео. В отличие от многих конкурентов, LongCat-Video изначально обучалась на задачах Video Continuation. Благодаря этому она уверенно справляется с длинными роликами — не теряя связность кадров, не «дрейфуя» по цвету и не размывая детали.
  3. Быстрая генерация. Используется Coarse-to-Fine pipeline — сначала грубая версия видео, затем уточнение деталей. Плюс Block Sparse Attention, оптимизирующий память и ускоряющий инференс на высоком разрешении. Результат — 189 кадров 720p за 142 секунды на GPU H800 (примерно 16 шагов диффузии с Flash Attention 3).
  4. Повышение качества через RLHF. Обучение шло с подкреплением по методу GRPO (Generalized Rank Preference Optimization) — тому же, что использовался в BLIP3o-NEXT. Это форма RLHF, которая помогает модели выбирать визуально более реалистичные и «человеческие» результаты.

Почему это важно? LongCat-Video приближает открытые модели к уровню коммерческих генераторов вроде Runway Gen-3, Pika и Kling AI.

По качеству и стабильности она уже догоняет лидера опенсорса WAN 2.2, но выигрывает в компактности (13,6B против 28B у WAN) и универсальности — одна модель вместо трёх.

Это также важный шаг в сторону «world models» — нейросетей, способных понимать динамику окружающего мира, а не просто строить кадры по описанию. До LongCat-Video в открытом сегменте видеогенерации доминировали WAN 2.2 (от ByteDance) и VideoCrafter 2, но обе ограничены короткими клипами и требуют отдельных моделей под разные задачи.

Доступность: Модель полностью открыта и бесплатна:

  • Лицензия: MIT.
  • Исходный код и веса: на GitHub и Hugging Face.
  • Поддержка фреймворков: PyTorch, FlashAttention 2/3, xFormers.
  • Примеры использования: готовые скрипты для генерации по тексту, изображению и продолжения видео.

Итог: LongCat-Video выводит опенсорс-видеогенерацию на новый уровень — одна модель создаёт и продолжает длинные ролики без потери качества. Это шаг к «world models» — нейросетям, которые понимают динамику мира, а не просто строят кадры по описанию.

Ранее Tencent запустила нейросеть Hunyuan World 1.1 для создания 3D-сцен.

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

Комментарии: Вышла LongCat-Video — нейросеть создаёт длинные видео по тексту, изображению и продолжает ролики
⚡ В тренде
Недавно вышла новая модель ChatGPT Images 2.5, и в плане визуала она творит чудеса — делает всё от обложек и рекламных креативов до логотипов, упаковки, стикеров и постеров. Раньше нужно было долго расписывать промт: свет, стиль, детали, ограничения и надеяться, что всё получится с первого раза. Теперь стало проще: можно ввести, что хочешь получить, дать […]
OpenAI выпустила GPT-6 Astra. Модель умеет искать информацию, работать в браузере и приложениях, разбирать файлы, писать и проверять код, а затем доводить работу до результата. Astra может взять на себя заметную часть задачи и выполнить несколько связанных этапов. Ниже разберём, где Astra уже доступна и как её использовать в ChatGPT, Codex и через API. Заодно […]
Adidas выпустила две модели бутс для американского футбола по мотивам мультфильма Pixar «Тачки»: Adizero Electric II «Молния Маккуин» и Adizero Impact II Mid «Мэтр». Релиз приурочен к 20-летию мультфильма. Обе пары уже продаются в США. Adizero Electric II «Молния Маккуин» стоит $130 (≈11 300 ₽), а Adizero Impact II Mid «Мэтр» — $110 (≈9 600 […]
WB Банк запустил WB Кэш — кредитный лимит, который можно подключить к дебетовой карте банка. Максимальная сумма — 100 000 ₽, конкретный лимит банк определяет для каждого клиента. Деньги можно тратить на покупки, переводы и снятие наличных. Если погасить весь основной долг до конца расчётного периода, комиссия за пользование кредитным лимитом не начисляется. Читайте также: […]
Xiaomi представила складной смартфон Xiaomi 18 Fold 7 сентября 2026 года в Китае. Это первый флагманский смартфон компании с процессором XRING O3. Xiaomi называет XRING O3 флагманской системой-на-чипе с ИИ-ускорителями, встроенными в ключевые компоненты. Подробности — в материале Postium. Читайте также: Цифровая репутация: как SERM спасает бренды в эпоху Интернета Что известно о Xiaomi 18 […]
Блоги компаний
Новости
Свежие статьи