MWS AI открыла инструмент RESON для оценки моделей распознавания речи

MWS AI (входит в МТС Web Services) выложила в открытый доступ RESON — инструмент для оценки моделей автоматического распознавания речи. Он сравнивает модели по более чем 10 метрикам и формирует интерактивный HTML-отчёт. Вместе с ним опубликован русскоязычный бенчмарк MWS RESON ASR OSD.

Главное
  • RESON доступен как открытая Python-библиотека, его можно развернуть в закрытом контуре компании.
  • Инструмент поддерживает более 10 метрик, включая WER, CER, MWA и собственную метрику WIS от MWS AI.
  • Бенчмарк MWS RESON ASR OSD включает более 12 тыс. размеченных аудиозаписей общей длительностью около 38 часов.

MWS AI (входит в МТС Web Services) выложила в открытый доступ RESON (Research Engine for Speech Observation & Notes) — инструмент для комплексной оценки качества моделей автоматического распознавания речи (ASR). Это первая открытая разработка MWS AI в области распознавания речи.

RESON позволяет сравнивать модели по более чем 10 метрикам и автоматически формирует интерактивный HTML-отчёт с результатами анализа. Чтобы воспользоваться инструментом, нужно загрузить результаты распознавания модели и эталонные расшифровки. RESON приводит тексты к единым правилам, чтобы некритичные различия в написании слов не влияли на оценку, а затем считает метрики и сравнивает результаты.

Метрики и возможности

Среди доступных метрик — WER (Word Error Rate, количество ошибок при распознавании слов), CER (Character Error Rate, ошибки на уровне символов) и MWA (Mean Word Accuracy, одинаковый вес для каждого уникального слова). MWS AI также разработала собственную метрику WIS (Word Importance Score): она помогает находить слова, которые почти не влияют на общий результат, но важны для конкретного сценария — например названия брендов, продуктов и англицизмы.

RESON доступен в формате открытой Python-библиотеки. Его можно встроить в существующие процессы разработки через командную строку или Python API и развернуть в собственной инфраструктуре компании, в том числе в закрытом контуре. Инструмент рассчитан на команды, которые сравнивают разные версии моделей, и на компании, выбирающие между решениями разных разработчиков.

Бенчмарк MWS RESON ASR OSD

Вместе с RESON MWS AI опубликовала MWS RESON ASR OSD — открытый бенчмарк с готовыми русскоязычными аудиоданными для оценки качества моделей распознавания речи. Он включает более 12 тыс. размеченных аудиозаписей общей длительностью около 38 часов и ориентирован в том числе на сценарии голосовой связи и контакт-центров.

В бенчмарке представлены два типа данных: разговорная речь и фразы с числами и числовыми последовательностями. В него входят обращения в поддержку, автоматические уведомления и бытовые звонки, а также телефонные номера, счета, даты и суммы. Записи представлены как без выраженных помех, так и с акустическим шумом и фоновой речью — например звуками телевизора или посторонними голосами. В данных также встречаются англицизмы и названия компаний, банков, операторов связи, цифровых сервисов, устройств и приложений.

Результаты замеров

В рамках публикации бенчмарка MWS AI провела замеры качества открытых моделей Сбербанка, Alpha Cephei, Nvidia и OpenAI. Модели сравнивали по WER. Среди моделей, протестированных на всех четырёх наборах данных, лучший средний результат показала GigaAM v3 от Сбера: средний WER составил 7,42%. У Vosk показатель составил 11,07%, у Nvidia Parakeet — 15,83%, у Nvidia Nemotron — 25,52%. GigaAM допускала более чем вдвое меньше ошибок, чем Nvidia Parakeet, и более чем втрое меньше, чем Nvidia Nemotron. На втором месте по точности — другая российская разработка, Vosk от Alpha Cephei.

«RESON изначально создавался для внутренних задач команды. Раньше оценка качества фактически собиралась из нескольких инструментов: отдельно считались метрики, отдельно разбирались ошибки, а результаты приходилось сводить вручную. RESON объединил этот процесс в одной системе — от подготовки данных до сравнения моделей и разбора конкретных ошибок. Анализ, который раньше мог занимать несколько часов, сократился до 10–15 минут. Сейчас мы открываем этот подход индустрии — это наш вклад в формирование общего подхода к оценке ASR-моделей, как минимум на русскоязычных данных», — сказал руководитель команды распознавания речи MWS AI Александр Шевченко.
Для профиТехнические детали: архитектура, цифры, ссылки

RESON — открытая Python-библиотека для оценки ASR-моделей. Поддерживает более 10 метрик: WER, CER, MWA, WIS (разработка MWS AI) и другие. Формирует интерактивный HTML-отчёт. Встраивается через командную строку или Python API, разворачивается в закрытом контуре.

MWS RESON ASR OSD — открытый бенчмарк с русскоязычными аудиоданными: более 12 тыс. размеченных записей общей длительностью около 38 часов. Два типа данных: разговорная речь и фразы с числами. Сценарии — голосовая связь и контакт-центры, записи с шумом и фоновой речью.

Результаты замеров по WER (средний показатель на всех четырёх наборах данных):

  • GigaAM v3 (Сбер) — 7,42%
  • Vosk (Alpha Cephei) — 11,07%
  • Nvidia Parakeet — 15,83%
  • Nvidia Nemotron — 25,52%

Что это значит для России

RESON и бенчмарк MWS RESON ASR OSD выложены в открытый доступ и ориентированы в том числе на русскоязычные данные. Инструмент можно развернуть в закрытом контуре компании. В замерах на бенчмарке лучший результат показала российская модель GigaAM v3 от Сбера, второе место — у Vosk от Alpha Cephei.

Вопросы и ответы

Что такое RESON?
Открытый инструмент MWS AI для оценки качества моделей распознавания речи. Сравнивает модели по более чем 10 метрикам и формирует интерактивный HTML-отчёт.
Какие модели показали лучший результат на бенчмарке?
Лучший средний WER — 7,42% — у GigaAM v3 от Сбера. На втором месте Vosk от Alpha Cephei с 11,07%.
Можно ли использовать RESON в закрытом контуре?
Да, инструмент доступен как Python-библиотека и разворачивается в собственной инфраструктуре компании, в том числе в закрытом контуре.

Источники

Материал подготовлен редакцией на основе указанных источников. Как мы работаем