ElevenLabs представила новые модели синтеза речи Eleven v4 и Eleven v4 Turbo. Они построены на новой архитектуре и рассчитаны на создание более выразительной озвучки с управлением эмоциями, темпом и манерой подачи прямо в тексте.
Eleven v4 создавали специально для контента, аудиокниг, озвучки персонажей и других сценариев, где важнее всего качество. Версия v4 Turbo сохраняет выразительность основной модели, но оптимизирована для работы в реальном времени — в частности, с голосовыми агентами. По данным ElevenLabs, её медианная задержка инференса составляет около 100 мс, а время до первого звука — около 150 мс.
Читайте также: ТОП-6 нейросетей для озвучки текста голосом
Нейросеть Eleven v4: что умеет и как работает
Одно из ключевых изменений — более точное управление подачей. В текст можно добавлять аудиотеги вроде [whispering], [shouting], [laughing], [sigh] и задавать, как должна звучать конкретная реплика. Модель также учитывает контекст сцены, поэтому может менять эмоциональную подачу в рамках одного текста. ElevenLabs отмечает, что v4 надёжнее следует последовательностям тегов, чем предыдущая версия.

Для длинных материалов используется контекстное сшивание: оно помогает сохранять темп и характер подачи между отдельными генерациями. Компания также заявляет, что голос остаётся стабильным при повторной генерации отдельных фрагментов, что упрощает работу с диалогами и длинной озвучкой.

Клонирование голоса и языки
Eleven v4 поддерживает Instant Voice Cloning — голос можно клонировать по записи длительностью от 10 секунд. Также модель снова поддерживает Professional Voice Clones, которые рассчитаны на более точное воспроизведение исходного голоса. Для использования клона требуется подтверждённое согласие владельца голоса.

Модель работает более чем с 90 языками, включая русский. ElevenLabs отдельно указывает, что v4 может генерировать речь на поддерживаемых языках с одним и тем же голосом.
Eleven v4 и v4 Turbo доступны через ElevenCreative, ElevenAgents и ElevenAPI. Для API предусмотрены как потоковая, так и обычная генерация речи.
Ранее ElevenLabs представила Studio 4.0 с генерацией видео, изображений и звука.
Изображения: elevenlabs.io