MWS AI открыла инструмент RESON для сравнения моделей распознавания речи

Вместе с ним компания представила набор русскоязычных аудиоданных для тестирования ASR-моделей в одинаковых условиях

MWS AI, входящая в МТС Web Services, опубликовала в открытом доступе RESON — инструмент для оценки моделей автоматического распознавания речи. Он позволяет сравнивать их по более чем 10 метрикам и формирует интерактивный отчет с результатами анализа.

Источник изображения: ИИ Grok Imagine

Для проверки модели в RESON загружаются ее расшифровки и эталонные тексты. Система приводит данные к единому формату, рассчитывает выбранные показатели и помогает выявлять типичные ошибки. Среди доступных метрик — WER и CER, оценивающие ошибки на уровне слов и символов, а также MWA и разработанный MWS AI показатель WIS, учитывающий значимость отдельных слов для конкретного сценария.

RESON распространяется как открытая Python-библиотека. Его можно запускать через командную строку или API и использовать внутри собственной инфраструктуры, включая закрытые контуры.

Одновременно MWS AI представила набор данных MWS RESON ASR OSD для сопоставления моделей в одинаковых условиях. Он включает более 12 тыс. русскоязычных аудиозаписей общей продолжительностью около 38 часов. В выборке есть разговоры, телефонные номера, даты, суммы, названия компаний и сервисов, а также записи с шумом и фоновой речью.

На четырех наборах данных лучшей среди протестированных моделей стала GigaAM v3 от Сбера со средним WER 7,42%. У Vosk показатель составил 11,07%, у Nvidia Parakeet — 15,83%, у Nvidia Nemotron — 25,52%.