Alibaba PPU Zhenwu 810E: тест китайского AI-ускорителя для LLM
MLOps-инженер Selectel протестировал AI-ускоритель PPU Zhenwu 810E от Alibaba. Выяснилось, что стек полностью суверенный, а библиотеки вроде vLLM отстают от актуальных версий.
- Сервер с 16 PPU Zhenwu 810E имеет 1536 ГБ HBM2e и интерконнект ICN до 700 ГБ/с на ускоритель.
- Для работы с PPU нужен PPU SDK: код CUDA компилируется заново, нативные библиотеки NVIDIA несовместимы.
- Актуальная сборка vLLM для PPU — v0.23.0, тогда как на NVIDIA доступна v0.27.0.

MLOps-инженер компании Selectel Дмитрий протестировал AI-ускоритель PPU Zhenwu 810E от Alibaba Group. Устройство разработано подразделением T-HEAD (Pingtou Ge Semiconductor Co., Ltd.) и позиционируется как отдельный класс ускорителей — Parallel Processing Unit. Тестирование проводилось на AI-станции, предоставленной Chaitex, с 16 такими ускорителями.
Аппаратно Zhenwu 810E оснащён 96 ГБ HBM2e с пропускной способностью 2 765 ГБ/с, интерфейсом PCIe 5.0 x16 и собственным межчиповым интерконнектом ICN с пропускной способностью до 700 ГБ/с на ускоритель. Суммарный объём видеопамяти на сервере — 1 536 ГБ.
Совместимость и стек
Весь программный стек PPU суверенный: нативные библиотеки NVIDIA не работают. Для портирования CUDA-кода используется PPU SDK, который компилирует исходники под PPU. Привычные PyTorch, Transformers, flashattention, vLLM и другие инструменты должны быть портированы силами T-HEAD. Документация доступна в основном на китайском языке, актуальные версии — только на китайском портале Alibaba Cloud.
Портированный стек поставляется в виде Docker-образа с определённым тегом. Основной риск — задержка в поддержке новых моделей и версий библиотек. Например, на 26 августа 2026 года актуальный образ vLLM для PPU имеет версию v0.23.0, тогда как на NVIDIA доступна v0.27.0.
Квантизация и модели
PPU поддерживает FP32, BF16, FP16, а также схемы квантизации W8A8 (INT8), AWQ (W4A16) и GPTQ (W4A16, W8A16). Alibaba рекомендует использовать W8A8. Среди адаптированных моделей — DeepSeek R1, DeepSeek v3.2, Kimi-K2-Instruct, Qwen3–235B-A22B, GLM-5, MiniMax-M2.5 и Qwen3.5–397B-A17B. Веса моделей от T-HEAD выкладываются на китайском аналоге Hugging Face — Modelscope.cn, на глобальной версии их нет.
Для мониторинга есть аналог nvidia-smi — ppu-smi, который показывает 16 устройств, метрики утилизации, версию драйвера и возможный MIG-профиль. Однако найти rpm-пакет ppu-dcgm (аналог DCGM) автору не удалось.
Для профиТехнические детали: архитектура, цифры, ссылки
Характеристики PPU Zhenwu 810E: 96 ГБ HBM2e, пропускная способность 2 765 ГБ/с, PCIe 5.0 x16, интерконнект ICN до 700 ГБ/с. Сервер: 16 ускорителей, суммарно 1 536 ГБ HBM2e.
Программный стек: PPU SDK, компиляция CUDA-кода под PPU. Портируются PyTorch, Transformers, flashattention, vLLM. Актуальная сборка vLLM для PPU — v0.23.0 (на NVIDIA — v0.27.0).
Квантизация: FP32, BF16, FP16, W8A8 (INT8), AWQ (W4A16), GPTQ (W4A16, W8A16). Рекомендуется W8A8.
Модели: DeepSeek R1, DeepSeek v3.2, Kimi-K2-Instruct, Qwen3–235B-A22B, GLM-5, MiniMax-M2.5, Qwen3.5–397B-A17B. Веса на Modelscope.cn.
Утилиты: ppu-smi (аналог nvidia-smi). rpm-пакет ppu-dcgm (аналог DCGM) найти не удалось.
Вопросы и ответы
- Что такое PPU Zhenwu 810E?
- AI-ускоритель от Alibaba (подразделение T-HEAD), класс Parallel Processing Unit, с 96 ГБ HBM2e и интерконнектом ICN до 700 ГБ/с.
- Какие модели поддерживаются?
- DeepSeek R1, DeepSeek v3.2, Kimi-K2-Instruct, Qwen3–235B-A22B, GLM-5, MiniMax-M2.5, Qwen3.5–397B-A17B с квантизацией W8A8.
- Можно ли использовать CUDA-код?
- Да, но его нужно компилировать под PPU с помощью PPU SDK. Нативные библиотеки NVIDIA не работают.


