Хабр разобрал механизмы внимания в современных LLM
На Хабре вышла статья о механизмах внимания в современных LLM. Автор объясняет, как MHA, MQA, GQA и MLA влияют на размер KV cache и скорость декода.
Все материалы по теме в хронологическом порядке.
На Хабре вышла статья о механизмах внимания в современных LLM. Автор объясняет, как MHA, MQA, GQA и MLA влияют на размер KV cache и скорость декода.