Анатомия AI-инфраструктуры: почему LLM не работает на одной видеокарте
На Хабре вышла статья о том, как устроена инфраструктура для запуска больших языковых моделей. Автор объясняет, почему расчёт «размер модели делить на память одной карты» не работает и какие компоненты определяют скорость ответа.

