Attention

PagedAttention

PagedAttention — алгоритм управления KV-cache в vLLM: разбивка на блоки, устранение фрагментации памяти, prefix caching. Настройка и практические эффекты.