Pika представила Pika Audio — семейство из четырёх ИИ-моделей для работы со звуком: Soundtrack, Music, SFX и Speech.
Модели доступны через Pika API. Soundtrack создаёт синхронизированную дорожку для видео, Music генерирует музыку, SFX — звуковые эффекты по текстовому описанию, а Speech — речь с клонированием голоса. Подробности — в материале Postium.
Читайте также: 10 нейросетей для создания сайтов с нуля
Pika Audio — что умеют новые модели
Pika Music генерирует оригинальную музыку по текстовому описанию, тексту песни, музыкальному референсу и образцу голоса. Pika SFX создаёт звуковые эффекты по текстовому промпту.
Pika Speech предназначена для синтеза речи и клонирования голоса. Pika Soundtrack создаёт синхронизированную звуковую дорожку для загруженного видео.

На странице Pika API указаны цены для моделей. При этом конкретные тарифы и условия использования могут зависеть от способа доступа к API.
Как пользоваться
Модели работают через Pika API. Разработчику нужен доступ к API; затем он выбирает нужную модель и передаёт ей текст, аудиореференс или видео — в зависимости от сценария.
Почему это важно? Pika собрала четыре сценария работы со звуком в одной линейке и одном API: музыку по тексту или референсу, эффекты, синтез речи и дорожку, синхронизированную с видео.
Ранее мы писали, что Pika Labs тестирует соцсеть с ИИ-видео из селфи — первую в мире социальную сеть, полностью основанную на ИИ-контенте.
Итог. Pika Audio добавляет в Pika API инструменты для генерации музыки, речи, эффектов и звуковых дорожек к видео.