Тема

голосовые агенты

Все материалы по теме в хронологическом порядке.

2 октября

Microsoft представила первую потоковую модель транскрибации MAI-Transcribe-2-Streaming

Microsoft расширила семейство моделей MAI, представив первую потоковую модель транскрибации MAI-Transcribe-2-Streaming и две модели синтеза речи — MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Они предназначены для голосовых агентов, которые слушают пользователя и отвечают почти мгновенно.

2 минДля профи
29 сентября

ElevenLabs выпустила модель речи Eleven v4 с задержкой 150 мс

ElevenLabs выпустила Eleven v4 — модель синтеза речи, которая точнее следует указаниям и сохраняет голос на протяжении длинных записей. Версия Turbo для голосовых агентов начинает говорить за 150 миллисекунд.

3 минДля профи