Механизмы внимания в современных LLM

Habr ·

Механизмы внимания в современных LLM

Почему современные LLM больше не используют один «обычный» Attention? Разбираем эволюцию механизмов внимания: MHA, GQA, MLA, local и sparse attention, linear/recurrent подходы и гибридные архитектуры вроде Qwen3.8 и DeepSeek. Смотрим, что происходит с KV‑cache, почему длинный контекст так дорого обходится и как современные модели пытаются совместить качество retrieval с быстрым inference. Читать далее

Почему современные LLM больше не используют один «обычный» Attention? Разбираем эволюцию механизмов внимания: MHA, GQA, MLA, local и sparse attention, linear/recurrent подходы и гибридные архитектуры вроде Qwen3.8 и DeepSeek. Смотрим, что происходит с KV‑cache, почему длинный контекст так дорого обходится и как современные модели пытаются совместить качество retrieval с быстрым inference. Читать далее

Источник: Habr