API
Google запускает Gemini 3.5 Transcribe
Модель «создана для того, чтобы улавливать естественный стиль речи пользователя, лучше понимать его намерения и распознавать пользовательскую лексику».
Google представила Gemini 3.5 Transcribe — свою «самую точную модель преобразования речи в текст на сегодняшний день», которая уже используется в нескольких собственных продуктах компании.
В отличие от традиционных моделей распознавания речи, которые часто плохо справляются с фоновым шумом, сложной терминологией и речевыми сбоями, Gemini 3.5 Transcribe преобразует исходную аудиозапись непосредственно в точный, очищенный и отформатированный текст.
Модель «создана для того, чтобы улавливать естественный стиль речи пользователя, лучше понимать его намерения и распознавать пользовательскую лексику». Как уже видно на примере Rambler, Gemini 3.5 Transcribe умеет обрабатывать самокоррекции вроде «давай встретимся во вторник — нет, в среду», удалять из итогового текста слова-паразиты вроде «эм» и «э-э», автоматически форматировать текст и поддерживать естественное редактирование голосом.
Google также выделяет несколько ключевых возможностей.
- Более точная расшифровка. По данным Artificial Analysis, средний Word Error Rate составляет 4,0% для потокового режима и 2,6% для непотокового. Модель хорошо работает в шумной реальной обстановке и точно распознаёт буквенно-цифровые данные, например почтовые индексы и идентификаторы заказов.
- Пользовательский словарь. Модель умеет учитывать специализированную терминологию и нестандартные написания, адаптируя расшифровку к переданной пользователем лексике.
- Глобальная поддержка языков. Автоматически определяет и расшифровывает более 85 языков, включая различные региональные акценты и диалекты.
- Определение нескольких говорящих. В предварительно записанном аудио модель может точно разделять речь до трёх участников и добавлять временные метки. Поддержка более трёх говорящих пока экспериментальная.
По производительности Gemini 3.5 Transcribe, как утверждает Google, представляет собой «существенный шаг вперёд» по сравнению с моделью Chirp 3 образца 2025 года: улучшились возможности, снизился уровень ошибок и заметно уменьшилась задержка.
Например, по данным Artificial Analysis, время до получения окончательной расшифровки сократилось на 70%. В тесте FLEURS на наборе популярных языков и регионов модель также показывает более высокую точность, чем Chirp 3: Word Error Rate составляет 5,50% в потоковом режиме и 5,04% в непотоковом.

Ещё одна задача Gemini 3.5 Transcribe — дать пользователям возможность выполнять действия голосом. Поддержка function calling позволяет модели «передавать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini». Это уже можно увидеть в функции Speak to Window в приложении Gemini для macOS.
Помимо приложения Gemini для macOS и Gboard Rambler на Android, Gemini 3.5 Transcribe доступна через микрофон в поле ввода Google Antigravity. Там, с разрешения пользователя, модель учитывает контекст экрана и историю чата, чтобы точнее распознавать имена файлов, рассуждения агентов и активные документы.
Следующим станет браузер Chrome. В нём можно будет говорить вместо печати в любом веб-поле — например, диктовать ответы, писать публикации или формулировать запросы к Gemini голосом.
Gemini 3.5 Transcribe уже доступна:
- Для разработчиков: в режиме публичной предварительной версии через Gemini API в Google AI Studio и Google Antigravity.
- Для корпоративных клиентов: в публичной предварительной версии через Gemini Enterprise Agent Platform; позже модель появится и в Gemini Enterprise for Customer Experience.
-
Новости4 недели назадВидео и подкасты о мобильной разработке 2026.31
-
Аналитика промо-кампаний4 недели назадКак проверить, упоминают ли нейросети ваш бренд: обзор пяти сервисов
-
Разработка4 недели назад50 вопросов о System Design, ответы на которые должен знать каждый Senior iOS-разработчик: часть 4
-
Новости3 недели назадВидео и подкасты о мобильной разработке 2026.32
