Microsoft представила первую потоковую модель транскрибации MAI-Transcribe-2-Streaming

Microsoft расширила семейство моделей MAI, представив первую потоковую модель транскрибации MAI-Transcribe-2-Streaming и две модели синтеза речи — MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Они предназначены для голосовых агентов, которые слушают пользователя и отвечают почти мгновенно.

Главное
  • MAI-Transcribe-2-Streaming выдаёт первые гипотезы транскрипта в среднем за 320 миллисекунд и стоит 54 цента за час аудио
  • Модель поддерживает более 60 языков и автоматически определяет язык говорящего
  • MAI-Voice-2.1 стоит $22 за миллион символов, Flash-версия — $15, обе поддерживают 23 языка
Логотип Microsoft AI и модели семейства MAI для голосовых агентов
Фото: SiliconANGLE AI

Microsoft представила три новые модели семейства MAI. Главная из них — MAI-Transcribe-2-Streaming, первая потоковая модель транскрибации компании. Она принимает речь через WebSocket и непрерывно обновляет транскрипт, пока человек говорит, а после завершения речи подтверждает финальный результат.

По данным Microsoft, модель поддерживает более 60 языков и умеет автоматически определять, на каком языке говорит человек. Первые гипотезы транскрипта появляются в среднем через 320 миллисекунд, хотя компания отмечает, что скорость зависит от сети и системы, генерирующей ответ. Модель доступна на Vercel AI Gateway по цене 54 цента за час аудио.

Вместе с ней вышли две модели синтеза речи: MAI-Voice-2.1 для более выразительного и качественного звучания и MAI-Voice-2.1-Flash — более быстрая и дешёвая. Обе поддерживают 23 языка. По данным Vercel AI Gateway, MAI-Voice-2.1 стоит $22 за миллион символов, Flash-версия — $15.

Microsoft уже выпускала модель транскрибации MAI-Transcribe-2 в прошлом месяце по цене 10 центов за час аудио. Потоковая версия дороже более чем в пять раз, потому что обрабатывает аудио непрерывно и возвращает промежуточные результаты, тогда как обычная модель ждёт окончания речи.

Новые релизы показывают, что Microsoft ускоряет переход от сторонних поставщиков моделей, таких как OpenAI и Anthropic, хотя остаётся крупным инвестором в обе компании. В июле сообщалось, что глава Microsoft AI Мустафа Сулейман обеспокоен расходами на мощные модели OpenAI и Anthropic. Он поручил исследователям Microsoft сосредоточиться на семействе MAI, чтобы в перспективе использовать эти модели в агентах Copilot в Excel и Outlook. «Мы платим Anthropic большие деньги, так что наша цель — сократить и в конечном счёте устранить эти расходы», — сказал Сулейман в интервью Bloomberg.

Для голосовых агентов нужны три компонента: распознавание речи, принятие решения и генерация ответа. MAI-Transcribe-2-Streaming отвечает за первое, модели MAI-Voice — за третье, а между ними работает reasoning-модель Mai-Thinking-1, которая читает транскрипт и решает, что делать агенту. Использование трёх отдельных моделей даёт разработчикам больше контроля над качеством, задержкой и стоимостью.

Для профиТехнические детали: архитектура, цифры, ссылки
  • MAI-Transcribe-2-Streaming: потоковая транскрибация через WebSocket, 60+ языков с автоопределением, первые гипотезы в среднем за 320 мс, цена 54 цента за час аудио, доступна на Vercel AI Gateway.
  • MAI-Voice-2.1: синтез речи с упором на выразительность и точность, 23 языка, $22 за миллион символов.
  • MAI-Voice-2.1-Flash: синтез речи с упором на скорость и низкую стоимость, 23 языка, $15 за миллион символов.
  • MAI-Transcribe-2 (предыдущая): не потоковая, 10 центов за час аудио.
  • Для принятия решений в голосовых агентах используется reasoning-модель Mai-Thinking-1.

Вопросы и ответы

Сколько стоит MAI-Transcribe-2-Streaming?
54 цента за час аудио на Vercel AI Gateway.
Сколько языков поддерживает модель?
Более 60 языков с автоматическим определением.
Чем потоковая версия отличается от обычной MAI-Transcribe-2?
Она обрабатывает аудио непрерывно и возвращает промежуточные результаты, поэтому стоит дороже — 54 цента против 10 центов за час.