MWS AI открыла инструмент RESON для оценки моделей распознавания речи
MWS AI (входит в МТС Web Services) выложила в открытый доступ RESON — инструмент для оценки моделей автоматического распознавания речи. Он сравнивает модели по более чем 10 метрикам и формирует интерактивный HTML-отчёт. Вместе с ним опубликован русскоязычный бенчмарк MWS RESON ASR OSD.
- RESON доступен как открытая Python-библиотека, его можно развернуть в закрытом контуре компании.
- Инструмент поддерживает более 10 метрик, включая WER, CER, MWA и собственную метрику WIS от MWS AI.
- Бенчмарк MWS RESON ASR OSD включает более 12 тыс. размеченных аудиозаписей общей длительностью около 38 часов.
MWS AI (входит в МТС Web Services) выложила в открытый доступ RESON (Research Engine for Speech Observation & Notes) — инструмент для комплексной оценки качества моделей автоматического распознавания речи (ASR). Это первая открытая разработка MWS AI в области распознавания речи.
RESON позволяет сравнивать модели по более чем 10 метрикам и автоматически формирует интерактивный HTML-отчёт с результатами анализа. Чтобы воспользоваться инструментом, нужно загрузить результаты распознавания модели и эталонные расшифровки. RESON приводит тексты к единым правилам, чтобы некритичные различия в написании слов не влияли на оценку, а затем считает метрики и сравнивает результаты.
Метрики и возможности
Среди доступных метрик — WER (Word Error Rate, количество ошибок при распознавании слов), CER (Character Error Rate, ошибки на уровне символов) и MWA (Mean Word Accuracy, одинаковый вес для каждого уникального слова). MWS AI также разработала собственную метрику WIS (Word Importance Score): она помогает находить слова, которые почти не влияют на общий результат, но важны для конкретного сценария — например названия брендов, продуктов и англицизмы.
RESON доступен в формате открытой Python-библиотеки. Его можно встроить в существующие процессы разработки через командную строку или Python API и развернуть в собственной инфраструктуре компании, в том числе в закрытом контуре. Инструмент рассчитан на команды, которые сравнивают разные версии моделей, и на компании, выбирающие между решениями разных разработчиков.
Бенчмарк MWS RESON ASR OSD
Вместе с RESON MWS AI опубликовала MWS RESON ASR OSD — открытый бенчмарк с готовыми русскоязычными аудиоданными для оценки качества моделей распознавания речи. Он включает более 12 тыс. размеченных аудиозаписей общей длительностью около 38 часов и ориентирован в том числе на сценарии голосовой связи и контакт-центров.
В бенчмарке представлены два типа данных: разговорная речь и фразы с числами и числовыми последовательностями. В него входят обращения в поддержку, автоматические уведомления и бытовые звонки, а также телефонные номера, счета, даты и суммы. Записи представлены как без выраженных помех, так и с акустическим шумом и фоновой речью — например звуками телевизора или посторонними голосами. В данных также встречаются англицизмы и названия компаний, банков, операторов связи, цифровых сервисов, устройств и приложений.
Результаты замеров
В рамках публикации бенчмарка MWS AI провела замеры качества открытых моделей Сбербанка, Alpha Cephei, Nvidia и OpenAI. Модели сравнивали по WER. Среди моделей, протестированных на всех четырёх наборах данных, лучший средний результат показала GigaAM v3 от Сбера: средний WER составил 7,42%. У Vosk показатель составил 11,07%, у Nvidia Parakeet — 15,83%, у Nvidia Nemotron — 25,52%. GigaAM допускала более чем вдвое меньше ошибок, чем Nvidia Parakeet, и более чем втрое меньше, чем Nvidia Nemotron. На втором месте по точности — другая российская разработка, Vosk от Alpha Cephei.
«RESON изначально создавался для внутренних задач команды. Раньше оценка качества фактически собиралась из нескольких инструментов: отдельно считались метрики, отдельно разбирались ошибки, а результаты приходилось сводить вручную. RESON объединил этот процесс в одной системе — от подготовки данных до сравнения моделей и разбора конкретных ошибок. Анализ, который раньше мог занимать несколько часов, сократился до 10–15 минут. Сейчас мы открываем этот подход индустрии — это наш вклад в формирование общего подхода к оценке ASR-моделей, как минимум на русскоязычных данных», — сказал руководитель команды распознавания речи MWS AI Александр Шевченко.
Для профиТехнические детали: архитектура, цифры, ссылки
RESON — открытая Python-библиотека для оценки ASR-моделей. Поддерживает более 10 метрик: WER, CER, MWA, WIS (разработка MWS AI) и другие. Формирует интерактивный HTML-отчёт. Встраивается через командную строку или Python API, разворачивается в закрытом контуре.
MWS RESON ASR OSD — открытый бенчмарк с русскоязычными аудиоданными: более 12 тыс. размеченных записей общей длительностью около 38 часов. Два типа данных: разговорная речь и фразы с числами. Сценарии — голосовая связь и контакт-центры, записи с шумом и фоновой речью.
Результаты замеров по WER (средний показатель на всех четырёх наборах данных):
- GigaAM v3 (Сбер) — 7,42%
- Vosk (Alpha Cephei) — 11,07%
- Nvidia Parakeet — 15,83%
- Nvidia Nemotron — 25,52%
Что это значит для России
RESON и бенчмарк MWS RESON ASR OSD выложены в открытый доступ и ориентированы в том числе на русскоязычные данные. Инструмент можно развернуть в закрытом контуре компании. В замерах на бенчмарке лучший результат показала российская модель GigaAM v3 от Сбера, второе место — у Vosk от Alpha Cephei.
Вопросы и ответы
- Что такое RESON?
- Открытый инструмент MWS AI для оценки качества моделей распознавания речи. Сравнивает модели по более чем 10 метрикам и формирует интерактивный HTML-отчёт.
- Какие модели показали лучший результат на бенчмарке?
- Лучший средний WER — 7,42% — у GigaAM v3 от Сбера. На втором месте Vosk от Alpha Cephei с 11,07%.
- Можно ли использовать RESON в закрытом контуре?
- Да, инструмент доступен как Python-библиотека и разворачивается в собственной инфраструктуре компании, в том числе в закрытом контуре.


