Site icon AppTractor

Google запускает Gemini 3.5 Transcribe

Google представила Gemini 3.5 Transcribe — свою «самую точную модель преобразования речи в текст на сегодняшний день», которая уже используется в нескольких собственных продуктах компании.

В отличие от традиционных моделей распознавания речи, которые часто плохо справляются с фоновым шумом, сложной терминологией и речевыми сбоями, Gemini 3.5 Transcribe преобразует исходную аудиозапись непосредственно в точный, очищенный и отформатированный текст.

Модель «создана для того, чтобы улавливать естественный стиль речи пользователя, лучше понимать его намерения и распознавать пользовательскую лексику». Как уже видно на примере Rambler, Gemini 3.5 Transcribe умеет обрабатывать самокоррекции вроде «давай встретимся во вторник — нет, в среду», удалять из итогового текста слова-паразиты вроде «эм» и «э-э», автоматически форматировать текст и поддерживать естественное редактирование голосом.

Google также выделяет несколько ключевых возможностей.

По производительности Gemini 3.5 Transcribe, как утверждает Google, представляет собой «существенный шаг вперёд» по сравнению с моделью Chirp 3 образца 2025 года: улучшились возможности, снизился уровень ошибок и заметно уменьшилась задержка.

Например, по данным Artificial Analysis, время до получения окончательной расшифровки сократилось на 70%. В тесте FLEURS на наборе популярных языков и регионов модель также показывает более высокую точность, чем Chirp 3: Word Error Rate составляет 5,50% в потоковом режиме и 5,04% в непотоковом.

Ещё одна задача Gemini 3.5 Transcribe — дать пользователям возможность выполнять действия голосом. Поддержка function calling позволяет модели «передавать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini». Это уже можно увидеть в функции Speak to Window в приложении Gemini для macOS.

Помимо приложения Gemini для macOS и Gboard Rambler на Android, Gemini 3.5 Transcribe доступна через микрофон в поле ввода Google Antigravity. Там, с разрешения пользователя, модель учитывает контекст экрана и историю чата, чтобы точнее распознавать имена файлов, рассуждения агентов и активные документы.

Следующим станет браузер Chrome. В нём можно будет говорить вместо печати в любом веб-поле — например, диктовать ответы, писать публикации или формулировать запросы к Gemini голосом.

Gemini 3.5 Transcribe уже доступна:

Exit mobile version