Новости

Google опубликовал свою систему разделения спикеров

Диаризация (или разделение дикторов) — процесс разделения входящего аудиопотока на однородные сегменты в соответствии с принадлежностью аудиопотока тому или иному говорящему.

Опубликовано

8 лет назад

13.11.2018

Автор:

AppTractor

Диаризация повышает качество текстов при автоматическом транскрибировании, а также может использоваться совместно с системой распознавания речи, значительно её улучшая. Диаризация используется для ответа на вопрос «Кто сейчас говорит?».

Исследователи Google опубликовали работу по диаризации под названием «Полностью обучаемое разделение спикеров» и открыли соответствующий проект на GitHub.

По данным инженеров, их новая AI-система, работающая в реальном времени, может достигать 7.6% ошибок, против 8.8% у предыдущего метода. Основана она на рекуррентных нейронных сетях, причем каждому говорящему выделяется своя, а система объединяет их.

Если вы нашли опечатку - выделите ее и нажмите Ctrl + Enter! Для связи с нами вы можете использовать info@apptractor.ru.