Скала^р добавила платформу Спектр ИИ для управления GPU-кластерами

Группа Rubytech расширила Машину искусственного интеллекта Скала^р, добавив в неё платформу управления ИИ-инфраструктурой Спектр ИИ. По данным компании, решение поднимает загрузку GPU с типичных 30–40% до 70–85%.

Главное
  • Платформа Спектр ИИ — собственная разработка Группы Rubytech, включена в состав Машины искусственного интеллекта Скала^р
  • Утилизация GPU-ускорителей вырастает с 30–40% до 70–85% без потери производительности
  • Решение поддерживает масштабирование до 32 узлов по 8 GPU в каждом

Группа Rubytech расширила возможности Машины искусственного интеллекта Скала^р, включив в её состав платформу управления ИИ-инфраструктурой Спектр ИИ. Это программный продукт собственной разработки. По данным компании, решение позволяет увеличить загрузку уже приобретённых GPU-ускорителей с типичных 30–40% до 70–85% и сократить затраты на закупку нового оборудования.

Машина искусственного интеллекта Скала^р — программно-аппаратный комплекс для построения масштабируемой инфраструктуры разработки, обучения и исполнения моделей ИИ с гарантированной производительностью. В его составе — совместимое оборудование из реестра Минпромторга и ПО из реестра Минцифры. Ключевые системные компоненты, операционные системы и платформа контейнерной виртуализации, имеют сертификаты ФСТЭК России, что упрощает аттестацию Машины в защищённых контурах.

Что делает Спектр ИИ

Платформа отвечает за централизованное управление ИИ-инфраструктурой, мониторинг и распределение ресурсов GPU при работе с моделями машинного обучения и большими языковыми моделями. Она также обеспечивает развёртывание и эксплуатацию моделей, ИИ-приложений, агентских систем и рабочих сред для Data Science-специалистов.

На типовой инсталляции утилизация GPU редко превышает 30–40%: ресурсы используют разные подразделения с разной интенсивностью, и больше половины оплаченных мощностей простаивает. Спектр ИИ работает с GPU-узлами в рамках единого управляемого кластера, планирует и перераспределяет нагрузку между командами. Встроенный планировщик управляет очередями и приоритетами задач, а разделение GPU на части обеспечивает мультитенантность.

Основные функции платформы:

  • управление рабочими узлами с предварительной конфигурацией;
  • управление приоритетами ИИ-задач в кластере по заданной конфигурации очередей;
  • создание контейнеров с аппаратным ускорением GPU для быстрого развёртывания решений, приложений и моделей;
  • запуск и оркестрация контейнеров с ИИ-нагрузками на основе ролевой модели;
  • распределение нагрузок как на целых GPU, так и на их частях;
  • полный цикл управления сервисами: запуск, остановка, очистка ресурсов;
  • управление корпоративным каталогом моделей и приложений из внешних ресурсов (Hugging Face) и внутренних репозиториев;
  • сбор и визуализация показателей нагрузки системы для выбранного узла;
  • отображение данных о количестве токенов, потребляемых и генерируемых языковыми моделями;
  • разграничение прав доступа к запускаемым языковым моделям;
  • проверка развёрнутой модели в диалоговом режиме.

Платформа разворачивается на кластере под управлением Deckhouse Kubernetes Platform и работает на операционных системах «РЕД ОС» и Astra Linux. Управление ресурсами и очередями ведётся из одного интерфейса по единой ролевой модели, с возможностью бронирования мощностей под критичные задачи. Решение поддерживает масштабирование до 32 узлов по 8 GPU в каждом.

«Сегодня бизнес может по-разному использовать инфраструктуру ИИ: например, развернуть на ней локальную языковую модель, которая обрабатывает внутренние документы и предоставляет ответы на запросы сотрудников, или организовать одновременную работу нескольких команд ИИ-разработки на одном GPU-кластере. В любом случае компании необходима высокая производительность и надёжность. Спектр ИИ предоставляет возможность создания каталога моделей компании, управляет инференсом, ограничивает доступ в соответствии с политиками безопасности, подсчитывает токены по пользователям и позволяет контролировать загрузку ресурсов GPU. Это решение, которое превращает дорогостоящие GPU-ускорители в гибко управляемый и прозрачно контролируемый ресурс, приносящий реальную эффективность», — комментирует Вадим Солдатов, директор по ИИ-продуктам Скала^р (Группа Rubytech).
Для профиТехнические детали: архитектура, цифры, ссылки

Состав и совместимость. Платформа Скала^р Спектр ИИ разворачивается на кластере под управлением Deckhouse Kubernetes Platform. Поддерживаемые ОС — «РЕД ОС» и Astra Linux. Оборудование входит в реестр Минпромторга, ПО — в реестр Минцифры; ключевые системные компоненты (операционные системы и платформа контейнерной виртуализации) имеют сертификаты ФСТЭК России.

Масштабирование и утилизация. Решение поддерживает до 32 узлов по 8 GPU в каждом. Заявленная утилизация ускорителей — 70–85% против типичных 30–40% на стандартных инсталляциях. Разделение GPU на части обеспечивает мультитенантность, планировщик управляет очередями и приоритетами задач, доступно бронирование мощностей под критичные задачи.

Управление моделями. Корпоративный каталог моделей и приложений пополняется как с внешних ресурсов (Hugging Face), так и из внутренних репозиториев. Платформа считает потребляемые и генерируемые токены, разграничивает права доступа к языковым моделям и позволяет проверить развёрнутую модель в диалоговом режиме.

Что это значит для России

Скала^р — российское решение: оборудование комплекса входит в реестр Минпромторга, ПО — в реестр Минцифры, а ключевые системные компоненты имеют сертификаты ФСТЭК России. Это упрощает аттестацию Машины в защищённых контурах, где она обязательна по требованиям регуляторов, и делает комплекс применимым в госсекторе и компаниях с повышенными требованиями к безопасности.

Платформа работает на российских ОС «РЕД ОС» и Astra Linux, что снижает зависимость от зарубежного системного ПО. Заявленная экономия — за счёт более полной загрузки уже купленных GPU-ускорителей вместо закупки новых.

Вопросы и ответы

Насколько вырастает загрузка GPU со Спектр ИИ?
С типичных 30–40% до 70–85% без потери производительности, по данным Группы Rubytech.
На каких операционных системах работает платформа?
На «РЕД ОС» и Astra Linux, на кластере под управлением Deckhouse Kubernetes Platform.
До какого размера масштабируется решение?
До 32 узлов по 8 GPU в каждом.

Источники

Материал подготовлен редакцией на основе указанных источников. Как мы работаем