Reka AI выпустила омни-модель Rho-1 для текста, видео и роботов

Reka AI выпустила исследовательскую версию Rho-1 — омни-модели на 19 млрд параметров, которая обрабатывает текст, изображения, видео и команды для роботов в одной нейросети. Модель работает без вызова внешних инструментов и генерирует видео в реальном времени.

Главное
  • Rho-1 — омни-модель на 19 млрд параметров, обрабатывающая текст, изображения, видео и управление роботами в единой нейросети.
  • Модель генерирует непрерывное видео в реальном времени и реагирует на новые инструкции без перезапуска.
  • Rho-1 обучена на 320 GPU H100 примерно за три месяца.
Иллюстрация омни-модели Rho-1 от Reka AI, обрабатывающей текст, изображения, видео и управление роботами
Фото: The Decoder

Reka AI представила исследовательскую версию Rho-1 — омни-модели на 19 млрд параметров. Она обрабатывает и генерирует текст, изображения, видео и команды управления роботами в одной нейросети. В отличие от большинства систем, которые направляют задачи к специализированным моделям, Rho-1 работает со всеми модальностями как с токенами в едином контекстном окне, без вызова инструментов и внешних моделей.

Модель генерирует непрерывное видео в реальном времени и реагирует на новые инструкции на лету, без перезапуска. Те же веса, что предсказывают изображения с камеры, управляют и движениями робота.

Чтобы обойти нехватку данных для обучения роботов, Reka AI построила модель обратной динамики, которая извлекает управляющие сигналы из обычных интернет-видео. Обучение Rho-1 проходило на 320 GPU H100 примерно за три месяца.

Reka AI уже выпускала мультимодальные модели: в апреле 2024 года компания представила Reka Core, которая конкурировала с GPT-4, Claude 3 и Gemini Ultra на бенчмарках. Новый релиз вписывается в общий тренд исследований в области так называемых world models.

Для профиТехнические детали: архитектура, цифры, ссылки

Архитектура: 19 млрд параметров, единое контекстное окно для всех модальностей, без вызова инструментов и внешних моделей. Обрабатывает текст, изображения, видео и действия управления роботами.

Обучение: 320 GPU H100, около трёх месяцев. Для обучения управлению роботами использована модель обратной динамики, извлекающая сигналы из интернет-видео.

Возможности: генерация непрерывного видео в реальном времени, реакция на новые инструкции без перезапуска. Одни и те же веса предсказывают изображения с камеры и управляют движениями робота.

Статус: research preview. Дополнительные детали (лицензия, цены API) в источнике не указаны.

Вопросы и ответы

Что такое Rho-1?
Омни-модель от Reka AI на 19 млрд параметров, которая обрабатывает текст, изображения, видео и управляет роботами в единой нейросети.
Чем Rho-1 отличается от других мультимодальных моделей?
Она работает со всеми модальностями как с токенами в одном контекстном окне, без вызова внешних инструментов и специализированных моделей.
Как обучали Rho-1?
На 320 GPU H100 около трёх месяцев. Для управления роботами использовали модель обратной динамики, извлекающую сигналы из интернет-видео.