Google представила Gemini 3.5 Transcribe — модель для распознавания речи и расшифровки аудиозаписей. Она автоматически определяет язык, разделяет реплики спикеров, добавляет временные метки и учитывает заданный словарь терминов. UPD: выпустили гайд по Gemini 3.5 Transcribe.

Разработчикам модель доступна в публичном превью через Gemini API в Google AI Studio и Google Antigravity. Пользователи уже могут работать с ней в приложении Gemini для macOS на английском языке и в функции Rambler на Android в отдельных странах и языках. Подробнее в материале Postium.

Реклама. Erid 2Vtzqw9oHvr. ООО «Клик.ру». Клик.ру
Реклама. Erid 2Vtzqve9YHx. ООО «Клик.ру». Клик.ру

Читайте также: Блокноты в Gemini: что это такое и как создать

Нейросеть Gemini 3.5 Transcribe: что умеет и как работает

Gemini 3.5 Transcribe распознаёт более 85 языков и переключения между ними внутри разговора. В режиме Smart Transcription модель убирает слова-паразиты, обрабатывает самоисправления и автоматически форматирует текст, превращая речь в более читаемый вид.

Что умеет Gemini 3.5 Transcribe

Для готовой записи используется модель gemini-3.5-transcribe: она принимает аудиофайл длительностью до часа, а с разделением спикеров или временными метками — до 30 минут. Модель возвращает текст и метки для отдельных слов. В документации Google указано, что для транскрипции можно распознать до восьми спикеров, но разметка для трёх и более спикеров остаётся экспериментальной. При этом в анонсе Google заявляет точную атрибуцию речи для трёх спикеров.

Что умеет Gemini 3.5 Transcribe

Для поточной расшифровки Google предлагает gemini-3.5-transcribe-live через Live API. Один сеанс длится до 10 минут. По данным Google со ссылкой на Artificial Analysis, время до готовой расшифровки сократилось на 70% по сравнению с Chirp 3.

Как пользоваться Gemini 3.5 Transcribe

Для расшифровки записи откройте Gemini API в Google AI Studio, загрузите аудиофайл и передайте его в запросе модели gemini-3.5-transcribe. Для записи с микрофона или аудиопотока используйте Live API и модель gemini-3.5-transcribe-live.

В бесплатном тарифе Gemini API обе модели можно протестировать без оплаты. В платном тарифе входное аудио для gemini-3.5-transcribe стоит $0,003 за минуту, а выходной текст — ещё $0,002 за минуту. Для gemini-3.5-transcribe-live входное аудио стоит $0,005 за минуту, выходной текст — $0,004 за минуту.

Почему это важно? Раньше Google предлагала Chirp 3 для распознавания речи. Gemini 3.5 Transcribe добавляет обработку готовых записей и аудиопотока через отдельные API, распознавание специальной лексики и режим, который сразу приводит речь к форме текста. По данным Artificial Analysis, модель также обеспечивает более низкую частоту ошибок и на 70% сокращает время до получения готовой расшифровки по сравнению с Chirp 3.

Ранее писали, что Google готовит единый способ работы с Google tag и Google Tag Manager — Сайты с установленным Google tag получат интерфейс Tag Manager.

Итог: Gemini 3.5 Transcribe расшифровывает записи и аудиопоток, распознаёт более 85 языков и доступна в публичном превью через API.

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

Комментарии: Google представила Gemini 3.5 Transcribe — ИИ-модель для расшифровки аудио
⚡ В тренде
adidas представила Harden Vol. 10 «HarDenim» — новую версию именных баскетбольных кроссовок Джеймса Хардена. Вместо гладкого футуристичного верха пара получила чёрный деним, строчку в стиле японской техники сасико и детали, похожие на отделку джинсов из селвидж-денима. adidas пока не назвала дату старта продаж. По предварительным данным, релиз ожидается к праздничному сезону 2026 года по цене […]
Nike представила совместную с One Piece коллекцию обуви и одежды. В неё вошли три версии Nike Air Max Plus, а также джерси, футболки, кепки и жилет. В Токио первые позиции коллекции появятся на поп-апе Dr. B’s RESEARCH LAB, который пройдёт 4–6 сентября 2026 года. Дальше релизы будут проходить поэтапно: отдельные модели и вещи появятся у […]
Яндекс Музыка запустила «Распаковать своё лето» — персональный итог сезона в мобильном приложении. Сервис предлагает вспомнить музыку, с которой прошли летние прогулки, важные моменты и фестивали. Чтобы открыть итог, Яндекс Музыка просит обновить приложение. Условия доступа, регионы и срок работы раздела компания не уточнила. Читайте также: Подписка Яндекс Плюс — что входит в подписку в […]
«Моменты» во ВКонтакте — это подборки сохранённых историй, которые не исчезают после окончания срока показа. По смыслу они похожи на хайлайтсы: в один «Момент» можно объединить несколько историй по одной теме и оставить их на странице. На личной странице и в сообществе «Моменты» работают по-разному. Кроме того, старые инструкции по ВК уже не соответствуют нынешнему […]
MAI-Image-2.6 — ИИ-модель Microsoft для генерации и редактирования изображений. Она умеет создавать картинки по текстовому описанию, работать с загруженными изображениями, рисовать текст внутри кадра, портреты, предметные сцены и сложные композиции. Попробовать модель можно в MAI Playground. Ниже разберём, как пользоваться MAI-Image-2.6, создать изображение с нуля, использовать референсы, добавить текст и отредактировать готовую картинку. Читайте также: […]
Блоги компаний
Новости
Свежие статьи