Alibaba представила семейство Qwen-Audio-3.1 из пяти моделей: для распознавания речи, синтеза голоса, голосового диалога, создания звуковых сцен и анализа аудиозаписей. Компания обновила ASR, TTS и Realtime и добавила две модели — TTS-Next и ASR-Next.

TTS-Next собирает речь, эффекты и фоновые звуки по сценарию. ASR-Next распознаёт в записи не только слова, но и эмоции и звуки окружения. Отдельная API-документация для ASR-Next пока не опубликована.

Реклама. Erid 2VtzqvEeCCc. ООО «Клик.ру». ИИ-директолог
Реклама. Erid 2VtzqxmQdcp. ООО «Клик.ру». ИИ-директолог

Читайте также: ТОП-7 нейросетей для создания видео

TTS-Next создаёт озвучку со звуковыми эффектами

Qwen-Audio-3.1-TTS-Next принимает текст, временные метки и образцы голосов. По одному заданию модель может озвучить диалог нескольких персонажей и добавить звуки окружения — например, шум улицы под реплики. Такой результат нужен для подкастов, роликов, игр и аудиокниг.

TTS-Next создаёт озвучку со звуковыми эффектами

Согласно документации Alibaba Cloud, модель работает с китайским и английским языками, принимает до трёх эталонных аудиофрагментов и выдаёт WAV, MP3 или PCM. За один запрос можно получить до четырёх минут подкаста; для остальных сценариев предел — две минуты. Модель также поддерживает вывод в 48 кГц и детальный контроль временных меток. Сервис возвращает готовый файл, а не поток звука во время генерации.

ASR-Next анализирует запись, ASR расшифровывает речь

ASR-Next рассчитана на анализ аудио: компания заявляет распознавание эмоций говорящего, фоновых и механических звуков, поиск звуковых событий по времени и ответы на вопросы о записи. Отдельная API-документация для ASR-Next пока не опубликована.

Обновлённая Qwen-Audio-3.1-ASR преобразует речь в текст на 30 языках и 16 китайских диалектах. Она может указать говорящего и время каждой реплики, убрать слова-паразиты и повторы. По данным Qwen, на открытых наборах KeSpeech и WSYue средняя доля ошибочно распознанных иероглифов составила 4,55% на 11 поднаборах. Это результат указанного теста, а не обещанная точность для любой записи.

TTS и Realtime обновили голосовые сценарии

Qwen-Audio-3.1-TTS синтезирует речь и позволяет управлять подачей: задавать эмоцию, темп и манеру произнесения. Компания также заявляет сохранение характера голоса при переключении языка.

Qwen-Audio-3.1-Realtime предназначена для диалога голосом в реальном времени. Ассистента можно перебить во время ответа; модель поддерживает смену языка по ходу разговора и вызов инструментов. Эти функции нужны, например, голосовому помощнику, который отвечает на вопросы и выполняет команды.

Как получить доступ

На Qwen AI Platform опубликованы страницы ASR, TTS, TTS-Next и Realtime. Alibaba Cloud отдельно описала подключение TTS-Next через Model Studio. Отдельная API-документация для ASR-Next пока не опубликована.

Одновременно Qwen сообщила о снижении цен на голосовые модели: ориентировочно на 70% для TTS, на 85% для Realtime и до 95% для ASR. Конкретная стоимость зависит от выбранной модели и площадки подключения.

Ранее Alibaba выпустила Qwen-Image 2.1 с генерацией прозрачных изображений.

Изображение: x.com/Alibaba_Qwen/status/2102687258990026993

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

Комментарии: Alibaba представила Qwen-Audio-3.1: пять моделей для речи и звука
⚡ В тренде
Осенняя фотосессия не обязательно требует поездки в парк, холодной погоды и пары часов на съёмку. Если у вас есть хорошая исходная фотография, нужный кадр можно сделать в нейросети: поза, одежда, композиция и свет задаются прямо в промте. Ниже — готовые промты для осенней ИИ-фотосессии в разных стилях и форматах: для девушек, парней и пар. Их […]
Швейцарский производитель спортивной одежды и обуви On заключил контракт с нападающим «Реала» и сборной Франции Килианом Мбаппе. Футболист сменил экипировщика после 20 лет сотрудничества с Nike — оно началось в 2006 году. Сделка стала частью выхода On на футбольный рынок. Мбаппе будет рекламировать бренд, а также участвовать в разработке и испытаниях бутс и экипировки. Первые […]
Сегодня Starbucks — одна из самых узнаваемых кофейных сетей мира: зелёную сирену знают даже те, кто ни разу не заходил туда за кофе. Но начиналась компания вовсе не с латте, стаканчиков с именами и кофеен на каждом углу. Более того, человек, которого чаще всего связывают с успехом Starbucks, вообще не был её основателем. Рассказываем, как […]
Служба доставки «Ёбидоёби» запустила коллаборацию с Atomic Heart. В меню появился одноимённый набор из 40 роллов в лимитированной упаковке, а к каждому набору добавляют коллекционный брелок с персонажем игры. Набор уже доступен на сайте и в приложении сети. Он стоит 1 699 рублей; скидки, промокоды, акции и оплата бонусами для этой позиции не действуют. Читайте […]
Недавно Apple выпустила iOS 27 — обновление доступно для iPhone 11 и более новых моделей, а также iPhone SE второго поколения и новее. Главное нововведение — Siri AI, но заметно изменились и «Камера», «Фото», Safari, FaceTime и другие системные приложения. В этой статье разберём 13 главных функций iOS 27 для iPhone и покажем, как ими […]
Блоги компаний
Новости
Свежие статьи