Google выпустила Gemini 3.5 Transcribe — ИИ-модель для расшифровки речи. В неё можно загрузить аудиозапись или передать речь с микрофона и получить текст с пунктуацией, разделением по спикерам и временными метками. Модель сама определяет язык и поддерживает русский.

Для обычной расшифровки не нужно писать код или подключать платный API — Gemini 3.5 Transcribe доступна в Google AI Studio. Я уже протестировал модель и в этой статье покажу весь процесс на простом примере, плюс разберём расшифровку речи в реальном времени.

Реклама. Erid 2Vtzqw9oHvr. ООО «Клик.ру». Клик.ру
Реклама. Erid 2Vtzqve9YHx. ООО «Клик.ру». Клик.ру

Читайте также: Нейросети для озвучки текста голосом

Что умеет Gemini 3.5 Transcribe

Gemini 3.5 Transcribe превращает речь из аудиофайла в готовый текст. Google заявляет поддержку более 85 языков и языковых вариантов, в том числе русский. Модель автоматически определяет язык и умеет распознавать переключение между несколькими языками внутри одной записи.

Это пригодится, например, чтобы:

  • расшифровать интервью, подкаст или голосовую заметку;
  • получить текст из записи созвона;
  • перевести надиктованный черновик статьи или поста в текст;
  • разделить реплики нескольких участников;
  • получить временные метки для каждого слова;
  • точнее распознавать названия компаний, фамилии и профессиональные термины.

Для последних трёх задач у модели есть специальные настройки. Speaker labels разделяет запись по спикерам, Word timestamps добавляет временные метки, а Custom vocabulary позволяет заранее указать слова, которые модель должна распознавать особенно внимательно. В словарь можно добавить до 1000 терминов, хотя Google рекомендует ограничиваться примерно сотней наиболее важных.

Есть режим Smart transcription. Обычная расшифровка старается сохранить речь максимально близко к оригиналу, включая повторы и слова-паразиты. Smart transcription очищает текст: убирает лишние «э-э», повторы и оговорки, расставляет пунктуацию и может оформить продиктованное перечисление как список.

Для длинных записей есть ограничение: Gemini 3.5 Transcribe принимает до одного часа аудио за запрос. Если включить разделение по спикерам или временные метки для слов, лимит снижается до 30 минут.

Это интересно: Как сделать пост-карусель с помощью ИИ

Как пользоваться Gemini 3.5 Transcribe бесплатно

Gemini 3.5 Transcribe можно бесплатно протестировать в Google AI Studio. На момент написания статьи мне удалось просто выбрать модель в Playground и запустить расшифровку без подключения платного API. Проверял на короткой записи на русском языке — модель распознала речь корректно.

Точные лимиты бесплатного режима Google в интерфейсе AI Studio не показывает, поэтому рассчитывать на него как на безлимитный сервис не стоит.

Шаг 1. Откройте Gemini 3.5 Transcribe

Зайдите на сайт Google AI Studio и откройте Playground.

На панели справа нажмите на название текущей модели. Откроется окно Model selection. Выберите раздел Audio и найдите Gemini 3.5 Transcribe. Код модели — gemini-3.5-transcribe.

Как пользоваться Gemini 3.5 Transcribe бесплатно

После выбора откроется отдельный интерфейс для работы с аудио: в центре появится блок Turn speech to transcriptions, а справа — настройки расшифровки.

Шаг 2. Настройте расшифровку

Справа находятся основные параметры.

Настройка расшифровки

Primary language — язык записи. Можно оставить Detect, тогда Gemini определит его автоматически. Если заранее знаете язык, его можно указать вручную.

Word timestamps — временные метки для отдельных слов.

Speaker labels — разделение реплик по участникам. Gemini 3.5 Transcribe поддерживает до восьми спикеров, хотя Google пока называет распознавание трёх и более участников экспериментальным.

Smart transcription — очистка разговорной речи и автоматическое форматирование текста.

Custom vocabulary — собственный словарь. Сюда стоит добавить сложные фамилии, названия брендов, продуктов, сервисов или профессиональные термины, которые модель может услышать неправильно.

Для обычной голосовой заметки ничего менять не обязательно: оставьте автоматическое определение языка и запустите расшифровку.

Шаг 3. Добавьте аудио

Запись можно добавить тремя способами:

  • Drive — выбрать файл с Google Диска;
  • Upload — загрузить аудиофайл с компьютера;
  • Record Audio — записать голос прямо в AI Studio.

Для быстрого теста удобнее последний вариант — нажмите Record Audio.

Как записать аудио

Затем Start recording и произнесите несколько фраз.

Как расшифровать аудио с помощью ИИ

После остановки записи её можно прослушать. Если всё нормально, нажмите Add to prompt.

Расшифровка речи

Аудиофайл появится в списке Selected files.

Шаг 4. Нажмите Transcribe

После добавления записи нажмите Transcribe.

Транскрибация речи с помощью ИИ

Gemini обработает аудио и покажет текст ниже. Если включены Speaker labels, рядом с репликами появятся обозначения спикеров. При включённых временных метках модель также вернёт время произнесения слов.

Как превратить аудио в текст

Например, в моём тесте была записана фраза: «Всем привет. Это Telegram-канал Промты и точка. Здесь я рассказываю про новинки ИИ».

Gemini 3.5 Transcribe распознала её корректно и сразу добавила пунктуацию.

Как расшифровывать речь в режиме реального времени?

У Gemini 3.5 Transcribe есть версия для живой речи — Gemini 3.5 Transcribe Live, код модели gemini-3.5-transcribe-live. Она принимает звук с микрофона или другого аудиопотока и выдаёт текст по мере того, как человек говорит.

Gemini 3.5 Transcribe Live

В Google AI Studio снова откройте выбор моделей, перейдите в Audio и выберите Gemini 3.5 Transcribe Live. После запуска разрешите сайту доступ к микрофону и начинайте говорить — распознанный текст будет появляться в интерфейсе во время разговора.

Live-версия тоже сама определяет язык, поддерживает собственный словарь и Smart transcription. Но по сравнению с обработкой аудиофайлов здесь есть ограничения: нет разделения по спикерам и временных меток для каждого слова, а одна сессия длится максимум 10 минут.

В моём тесте обычная Gemini 3.5 Transcribe расшифровала короткую русскую запись быстро и точно. Live-режим работал менее стабильно и местами задерживал распознавание.

Цена API для Gemini 3.5 Transcribe

В Google AI Studio обе модели можно протестировать бесплатно. Если подключать модели через платный Gemini API, расценки такие:

— Gemini 3.5 Transcribe — $2 за 1 млн входных аудиотокенов и $12 за 1 млн выходных текстовых токенов. Google оценивает итоговую стоимость примерно в $0,005 за минуту расшифровки;

— Gemini 3.5 Transcribe Live — $3,50 за 1 млн входных аудиотокенов и $21 за 1 млн выходных текстовых токенов, или около $0,009 за минуту при расчётном объёме токенов Google.

Чтобы подключить модель к своему приложению или скрипту, нужен ключ Gemini API. Его можно получить в Google AI Studio.

Что делать дальше

Сначала проверьте Gemini 3.5 Transcribe на своих записях: голосовых сообщениях, интервью, созвонах или подкастах. Для записей с несколькими участниками включите разделение по спикерам, а сложные названия, фамилии и термины добавьте в Custom vocabulary.

Если качество устраивает, подключите модель через Gemini API. Так можно автоматически расшифровывать загруженные аудиофайлы, переводить голосовые сообщения в текст, готовить стенограммы встреч или обрабатывать речь в реальном времени.

Больше гайдов по работе с ИИ:

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

⭐ Наш Telegram-канал, где мы показываем, как применять ИИ в работе: промты, кейсы, гайды и рабочие схемы. Подписывайтесь → «Промты — и точка».

Комментарии: Нейросеть Gemini 3.5 Transcribe — как бесплатно расшифровать аудио, как подключить API
⚡ В тренде
Яндекс Музыка запустила «Распаковать своё лето» — персональный итог сезона в мобильном приложении. Сервис предлагает вспомнить музыку, с которой прошли летние прогулки, важные моменты и фестивали. Чтобы открыть итог, Яндекс Музыка просит обновить приложение. Условия доступа, регионы и срок работы раздела компания не уточнила. Читайте также: Подписка Яндекс Плюс — что входит в подписку в […]
adidas представила Harden Vol. 10 «HarDenim» — новую версию именных баскетбольных кроссовок Джеймса Хардена. Вместо гладкого футуристичного верха пара получила чёрный деним, строчку в стиле японской техники сасико и детали, похожие на отделку джинсов из селвидж-денима. adidas пока не назвала дату старта продаж. По предварительным данным, релиз ожидается к праздничному сезону 2026 года по цене […]
Nike представила совместную с One Piece коллекцию обуви и одежды. В неё вошли три версии Nike Air Max Plus, а также джерси, футболки, кепки и жилет. В Токио первые позиции коллекции появятся на поп-апе Dr. B’s RESEARCH LAB, который пройдёт 4–6 сентября 2026 года. Дальше релизы будут проходить поэтапно: отдельные модели и вещи появятся у […]
«Моменты» во ВКонтакте — это подборки сохранённых историй, которые не исчезают после окончания срока показа. По смыслу они похожи на хайлайтсы: в один «Момент» можно объединить несколько историй по одной теме и оставить их на странице. На личной странице и в сообществе «Моменты» работают по-разному. Кроме того, старые инструкции по ВК уже не соответствуют нынешнему […]
QwenWork — это новый ИИ-агент от Alibaba, который доступен на сайте и через отдельное приложение. По принципу работы он похож на режим Work в ChatGPT: вы описываете задачу обычным текстом, а агент разбивает её на этапы, работает с файлами, создаёт страницы и может подключаться к другим сервисам. В этой статье разберём веб-версию QwenWork: как зарегистрироваться, […]
Блоги компаний
Новости
Свежие статьи