Google представила Gemini 3.5 Transcribe — модель для распознавания речи и расшифровки аудиозаписей. Она автоматически определяет язык, разделяет реплики спикеров, добавляет временные метки и учитывает заданный словарь терминов. UPD: выпустили гайд по Gemini 3.5 Transcribe.
Разработчикам модель доступна в публичном превью через Gemini API в Google AI Studio и Google Antigravity. Пользователи уже могут работать с ней в приложении Gemini для macOS на английском языке и в функции Rambler на Android в отдельных странах и языках. Подробнее в материале Postium.
Читайте также: Блокноты в Gemini: что это такое и как создать
Нейросеть Gemini 3.5 Transcribe: что умеет и как работает
Gemini 3.5 Transcribe распознаёт более 85 языков и переключения между ними внутри разговора. В режиме Smart Transcription модель убирает слова-паразиты, обрабатывает самоисправления и автоматически форматирует текст, превращая речь в более читаемый вид.

Для готовой записи используется модель gemini-3.5-transcribe: она принимает аудиофайл длительностью до часа, а с разделением спикеров или временными метками — до 30 минут. Модель возвращает текст и метки для отдельных слов. В документации Google указано, что для транскрипции можно распознать до восьми спикеров, но разметка для трёх и более спикеров остаётся экспериментальной. При этом в анонсе Google заявляет точную атрибуцию речи для трёх спикеров.

Для поточной расшифровки Google предлагает gemini-3.5-transcribe-live через Live API. Один сеанс длится до 10 минут. По данным Google со ссылкой на Artificial Analysis, время до готовой расшифровки сократилось на 70% по сравнению с Chirp 3.
Как пользоваться Gemini 3.5 Transcribe
Для расшифровки записи откройте Gemini API в Google AI Studio, загрузите аудиофайл и передайте его в запросе модели gemini-3.5-transcribe. Для записи с микрофона или аудиопотока используйте Live API и модель gemini-3.5-transcribe-live.
В бесплатном тарифе Gemini API обе модели можно протестировать без оплаты. В платном тарифе входное аудио для gemini-3.5-transcribe стоит $0,003 за минуту, а выходной текст — ещё $0,002 за минуту. Для gemini-3.5-transcribe-live входное аудио стоит $0,005 за минуту, выходной текст — $0,004 за минуту.
Почему это важно? Раньше Google предлагала Chirp 3 для распознавания речи. Gemini 3.5 Transcribe добавляет обработку готовых записей и аудиопотока через отдельные API, распознавание специальной лексики и режим, который сразу приводит речь к форме текста. По данным Artificial Analysis, модель также обеспечивает более низкую частоту ошибок и на 70% сокращает время до получения готовой расшифровки по сравнению с Chirp 3.
Ранее писали, что Google готовит единый способ работы с Google tag и Google Tag Manager — Сайты с установленным Google tag получат интерфейс Tag Manager.
Итог: Gemini 3.5 Transcribe расшифровывает записи и аудиопоток, распознаёт более 85 языков и доступна в публичном превью через API.