Google выпустила Gemini 3.5 Transcribe — ИИ-модель для расшифровки речи. В неё можно загрузить аудиозапись или передать речь с микрофона и получить текст с пунктуацией, разделением по спикерам и временными метками. Модель сама определяет язык и поддерживает русский.
Для обычной расшифровки не нужно писать код или подключать платный API — Gemini 3.5 Transcribe доступна в Google AI Studio. Я уже протестировал модель и в этой статье покажу весь процесс на простом примере, плюс разберём расшифровку речи в реальном времени.
Читайте также: Нейросети для озвучки текста голосом
Что умеет Gemini 3.5 Transcribe
Gemini 3.5 Transcribe превращает речь из аудиофайла в готовый текст. Google заявляет поддержку более 85 языков и языковых вариантов, в том числе русский. Модель автоматически определяет язык и умеет распознавать переключение между несколькими языками внутри одной записи.
Это пригодится, например, чтобы:
- расшифровать интервью, подкаст или голосовую заметку;
- получить текст из записи созвона;
- перевести надиктованный черновик статьи или поста в текст;
- разделить реплики нескольких участников;
- получить временные метки для каждого слова;
- точнее распознавать названия компаний, фамилии и профессиональные термины.
Для последних трёх задач у модели есть специальные настройки. Speaker labels разделяет запись по спикерам, Word timestamps добавляет временные метки, а Custom vocabulary позволяет заранее указать слова, которые модель должна распознавать особенно внимательно. В словарь можно добавить до 1000 терминов, хотя Google рекомендует ограничиваться примерно сотней наиболее важных.
Есть режим Smart transcription. Обычная расшифровка старается сохранить речь максимально близко к оригиналу, включая повторы и слова-паразиты. Smart transcription очищает текст: убирает лишние «э-э», повторы и оговорки, расставляет пунктуацию и может оформить продиктованное перечисление как список.
Для длинных записей есть ограничение: Gemini 3.5 Transcribe принимает до одного часа аудио за запрос. Если включить разделение по спикерам или временные метки для слов, лимит снижается до 30 минут.
Это интересно: Как сделать пост-карусель с помощью ИИ
Как пользоваться Gemini 3.5 Transcribe бесплатно
Gemini 3.5 Transcribe можно бесплатно протестировать в Google AI Studio. На момент написания статьи мне удалось просто выбрать модель в Playground и запустить расшифровку без подключения платного API. Проверял на короткой записи на русском языке — модель распознала речь корректно.
Точные лимиты бесплатного режима Google в интерфейсе AI Studio не показывает, поэтому рассчитывать на него как на безлимитный сервис не стоит.
Шаг 1. Откройте Gemini 3.5 Transcribe
Зайдите на сайт Google AI Studio и откройте Playground.
На панели справа нажмите на название текущей модели. Откроется окно Model selection. Выберите раздел Audio и найдите Gemini 3.5 Transcribe. Код модели — gemini-3.5-transcribe.

После выбора откроется отдельный интерфейс для работы с аудио: в центре появится блок Turn speech to transcriptions, а справа — настройки расшифровки.
Шаг 2. Настройте расшифровку
Справа находятся основные параметры.

Primary language — язык записи. Можно оставить Detect, тогда Gemini определит его автоматически. Если заранее знаете язык, его можно указать вручную.
Word timestamps — временные метки для отдельных слов.
Speaker labels — разделение реплик по участникам. Gemini 3.5 Transcribe поддерживает до восьми спикеров, хотя Google пока называет распознавание трёх и более участников экспериментальным.
Smart transcription — очистка разговорной речи и автоматическое форматирование текста.
Custom vocabulary — собственный словарь. Сюда стоит добавить сложные фамилии, названия брендов, продуктов, сервисов или профессиональные термины, которые модель может услышать неправильно.
Для обычной голосовой заметки ничего менять не обязательно: оставьте автоматическое определение языка и запустите расшифровку.
Шаг 3. Добавьте аудио
Запись можно добавить тремя способами:
- Drive — выбрать файл с Google Диска;
- Upload — загрузить аудиофайл с компьютера;
- Record Audio — записать голос прямо в AI Studio.
Для быстрого теста удобнее последний вариант — нажмите Record Audio.

Затем Start recording и произнесите несколько фраз.

После остановки записи её можно прослушать. Если всё нормально, нажмите Add to prompt.

Аудиофайл появится в списке Selected files.
Шаг 4. Нажмите Transcribe
После добавления записи нажмите Transcribe.

Gemini обработает аудио и покажет текст ниже. Если включены Speaker labels, рядом с репликами появятся обозначения спикеров. При включённых временных метках модель также вернёт время произнесения слов.

Например, в моём тесте была записана фраза: «Всем привет. Это Telegram-канал Промты и точка. Здесь я рассказываю про новинки ИИ».
Gemini 3.5 Transcribe распознала её корректно и сразу добавила пунктуацию.
Как расшифровывать речь в режиме реального времени?
У Gemini 3.5 Transcribe есть версия для живой речи — Gemini 3.5 Transcribe Live, код модели gemini-3.5-transcribe-live. Она принимает звук с микрофона или другого аудиопотока и выдаёт текст по мере того, как человек говорит.

В Google AI Studio снова откройте выбор моделей, перейдите в Audio и выберите Gemini 3.5 Transcribe Live. После запуска разрешите сайту доступ к микрофону и начинайте говорить — распознанный текст будет появляться в интерфейсе во время разговора.
Live-версия тоже сама определяет язык, поддерживает собственный словарь и Smart transcription. Но по сравнению с обработкой аудиофайлов здесь есть ограничения: нет разделения по спикерам и временных меток для каждого слова, а одна сессия длится максимум 10 минут.
В моём тесте обычная Gemini 3.5 Transcribe расшифровала короткую русскую запись быстро и точно. Live-режим работал менее стабильно и местами задерживал распознавание.
Цена API для Gemini 3.5 Transcribe
В Google AI Studio обе модели можно протестировать бесплатно. Если подключать модели через платный Gemini API, расценки такие:
— Gemini 3.5 Transcribe — $2 за 1 млн входных аудиотокенов и $12 за 1 млн выходных текстовых токенов. Google оценивает итоговую стоимость примерно в $0,005 за минуту расшифровки;
— Gemini 3.5 Transcribe Live — $3,50 за 1 млн входных аудиотокенов и $21 за 1 млн выходных текстовых токенов, или около $0,009 за минуту при расчётном объёме токенов Google.
Чтобы подключить модель к своему приложению или скрипту, нужен ключ Gemini API. Его можно получить в Google AI Studio.
Что делать дальше
Сначала проверьте Gemini 3.5 Transcribe на своих записях: голосовых сообщениях, интервью, созвонах или подкастах. Для записей с несколькими участниками включите разделение по спикерам, а сложные названия, фамилии и термины добавьте в Custom vocabulary.
Если качество устраивает, подключите модель через Gemini API. Так можно автоматически расшифровывать загруженные аудиофайлы, переводить голосовые сообщения в текст, готовить стенограммы встреч или обрабатывать речь в реальном времени.
Больше гайдов по работе с ИИ: