Suno запустила генерацию речи в публичной бете
Suno запустила функцию Speech в публичной бете на веб- и мобильных платформах. Она генерирует речь и фоновую музыку одновременно в одном треке. Максимальная длительность — около восьми минут.
Все материалы по теме в хронологическом порядке.
Suno запустила функцию Speech в публичной бете на веб- и мобильных платформах. Она генерирует речь и фоновую музыку одновременно в одном треке. Максимальная длительность — около восьми минут.
ElevenLabs выпустила Eleven v4 — модель синтеза речи, которая точнее следует указаниям и сохраняет голос на протяжении длинных записей. Версия Turbo для голосовых агентов начинает говорить за 150 миллисекунд.
Nvidia представила Nemotron 3 Diarization — бесплатную ИИ-модель, которая определяет, кто говорит в каждый момент разговора. Она различает до восьми голосов, работает с записями и живым аудио и лидирует в бенчмарке VoiceArena.
На конференции Connect 2026 Meta показала первые умные очки без камеры — Ray-Ban Meta Audio. Устройство работает только со звуком, стоит от $349 и открывает предзаказ 13 октября.