ByteDance представила SeedRealtime — мультимодальную модель для диалога в формате видео и аудио в реальном времени. Она обрабатывает звук, изображение и текст в единой архитектуре и продолжает анализировать происходящее, пока пользователь говорит или перемещает камеру.
Компания уже подключила SeedRealtime в приложении Doubao (чат-бот) для всех пользователей. ByteDance не уточнила, появится ли модель в других продуктах. Подробности в материале Postium.
Читайте также: 6 нейросетей для озвучки текста голосом
Нейросеть SeedRealtime: что умеет и как работает
SeedRealtime принимает непрерывный поток данных с камеры и микрофона. Модель сопоставляет речь с объектами в кадре, учитывает изменения сцены и определяет, к кому или к чему относится вопрос пользователя.
Например, человек может показать камере меню и спросить о конкретном блюде. Модель распознает его по изображению, учтёт устный вопрос и ответит в рамках того же диалога. SeedRealtime также различает собеседников, связывает голоса с людьми в кадре и сохраняет их пожелания в контексте разговора.

Модель поддерживает полный дуплекс: пользователь и ИИ могут говорить одновременно, перебивать друг друга и продолжать диалог без строгого чередования реплик. SeedRealtime сама определяет момент для ответа, а не полагается только на внешний детектор окончания речи.
По данным ByteDance, во внутренней оценке проблемы с темпом разговора возникали у SeedRealtime вдвое реже, чем у каскадных систем, где распознавание речи, анализ изображения и синтез ответа выполняются отдельными этапами.
Кроме того, модель может продолжать наблюдение без постоянных команд. В одном из тестов её попросили заметить определённый объект, и SeedRealtime сообщила, когда он появился в кадре. В одной из демонстраций модель следила за страницами научной статьи и остановила пользователя на нужном разделе.
Пока ByteDance показывает SeedRealtime только как функцию Doubao. Компания не раскрыла параметры модели, стоимость инфраструктуры, условия лицензирования и планы по доступу для сторонних разработчиков.
Ранее ByteDance выпустила видеомодель Seedance 2.5 и модель для генерации изображений Seedream 5.0 Pro. Обе доступны в Dreamina AI.
Итог: SeedRealtime может следить за непрерывным видеопотоком, учитывать фоновые реплики и отвечать в подходящий момент, не дожидаясь отдельного снимка или завершения голосового сообщения.