Connect with us

API

Google запускает Gemini 3.5 Transcribe

Модель «создана для того, чтобы улавливать естественный стиль речи пользователя, лучше понимать его намерения и распознавать пользовательскую лексику».

Опубликовано

/

     
     

Google представила Gemini 3.5 Transcribe — свою «самую точную модель преобразования речи в текст на сегодняшний день», которая уже используется в нескольких собственных продуктах компании.

В отличие от традиционных моделей распознавания речи, которые часто плохо справляются с фоновым шумом, сложной терминологией и речевыми сбоями, Gemini 3.5 Transcribe преобразует исходную аудиозапись непосредственно в точный, очищенный и отформатированный текст.

Модель «создана для того, чтобы улавливать естественный стиль речи пользователя, лучше понимать его намерения и распознавать пользовательскую лексику». Как уже видно на примере Rambler, Gemini 3.5 Transcribe умеет обрабатывать самокоррекции вроде «давай встретимся во вторник — нет, в среду», удалять из итогового текста слова-паразиты вроде «эм» и «э-э», автоматически форматировать текст и поддерживать естественное редактирование голосом.

Google также выделяет несколько ключевых возможностей.

  • Более точная расшифровка. По данным Artificial Analysis, средний Word Error Rate составляет 4,0% для потокового режима и 2,6% для непотокового. Модель хорошо работает в шумной реальной обстановке и точно распознаёт буквенно-цифровые данные, например почтовые индексы и идентификаторы заказов.
  • Пользовательский словарь. Модель умеет учитывать специализированную терминологию и нестандартные написания, адаптируя расшифровку к переданной пользователем лексике.
  • Глобальная поддержка языков. Автоматически определяет и расшифровывает более 85 языков, включая различные региональные акценты и диалекты.
  • Определение нескольких говорящих. В предварительно записанном аудио модель может точно разделять речь до трёх участников и добавлять временные метки. Поддержка более трёх говорящих пока экспериментальная.

По производительности Gemini 3.5 Transcribe, как утверждает Google, представляет собой «существенный шаг вперёд» по сравнению с моделью Chirp 3 образца 2025 года: улучшились возможности, снизился уровень ошибок и заметно уменьшилась задержка.

Например, по данным Artificial Analysis, время до получения окончательной расшифровки сократилось на 70%. В тесте FLEURS на наборе популярных языков и регионов модель также показывает более высокую точность, чем Chirp 3: Word Error Rate составляет 5,50% в потоковом режиме и 5,04% в непотоковом.

Google запускает Gemini 3.5 Transcribe

Ещё одна задача Gemini 3.5 Transcribe — дать пользователям возможность выполнять действия голосом. Поддержка function calling позволяет модели «передавать сложные задачи, такие как генерация изображений и анализ файлов, другим моделям Gemini». Это уже можно увидеть в функции Speak to Window в приложении Gemini для macOS.

Помимо приложения Gemini для macOS и Gboard Rambler на Android, Gemini 3.5 Transcribe доступна через микрофон в поле ввода Google Antigravity. Там, с разрешения пользователя, модель учитывает контекст экрана и историю чата, чтобы точнее распознавать имена файлов, рассуждения агентов и активные документы.

Следующим станет браузер Chrome. В нём можно будет говорить вместо печати в любом веб-поле — например, диктовать ответы, писать публикации или формулировать запросы к Gemini голосом.

Gemini 3.5 Transcribe уже доступна:

Если вы нашли опечатку - выделите ее и нажмите Ctrl + Enter! Для связи с нами вы можете использовать info@apptractor.ru.
Telegram

Популярное

Сообщить об опечатке

Текст, который будет отправлен нашим редакторам: