Модель

Qwen3.8-27B

Все материалы по теме в хронологическом порядке.

2 октября
26 сентября

Qwen3.8–27B на двух RTX 3060 ускорили с 9 до 40 токенов/с

Энтузиаст разогнал локальную Qwen3.8–27B Q4 на двух RTX 3060 12 ГБ с 9 до 39,6 токенов/с в реальной сессии OpenCode при контексте 128K. Ключевым изменением стал переход с распределения по слоям на тензорное распараллеливание в llama.cpp.

2 минДля профи
25 сентября

Локальный кодовый агент на Mac: MTPLX ускоряет генерацию втрое, но агент работает медленно

Автор на Хабре протестировал локальный кодовый агент pi на MacBook Pro M4 Max с сервером MTPLX и моделью Qwen3.8–27B. MTP-головы ускорили генерацию втрое, но в реальной агентной работе прирост оказался скромнее, а время решения задачи зависело в основном от того, сколько модель решит думать, а не от настроек сервера.

2 минДля профи