Продукт

llama.cpp

Все материалы по теме в хронологическом порядке.

30 сентября

Ollama против llama.cpp: сравнили запуск Gemma 4 на сервере

Автор развернул Gemma 4 26B A4B в Q4-кванте на облачном сервере с RTX 4090 и запустил её двумя способами — через Ollama и напрямую через llama.cpp. Он описал установку, настройку HTTP API и подготовку к замерам скорости.

2 минДля профи
28 сентября

Ollivo 0.3: программа для Windows оценивает, потянет ли компьютер нейросеть, до скачивания

Разработчик выпустил Ollivo 0.3 — программу для Windows, в которой локальные нейросети запускаются как обычное приложение. Главная функция — оценка, потянет ли компьютер модель, ещё до её скачивания.

3 минДля профи
26 сентября

Qwen3.8–27B на двух RTX 3060 ускорили с 9 до 40 токенов/с

Энтузиаст разогнал локальную Qwen3.8–27B Q4 на двух RTX 3060 12 ГБ с 9 до 39,6 токенов/с в реальной сессии OpenCode при контексте 128K. Ключевым изменением стал переход с распределения по слоям на тензорное распараллеливание в llama.cpp.

2 минДля профи