Vllm
Tensor Parallelism
Tensor Parallelism в vLLM: как веса разрезаются между GPU, PCIe против NVLink, таблица TP-градусов по размеру модели и почему 27B работает на 2×RTX 3090 по PCIe 4.0.
Continuous Batching
Continuous batching в vLLM: как scheduler добавляет запросы на каждой итерации decode, параметры max_num_seqs и max_num_batched_tokens, prefill/decode-баланс и компромисс с 256K контекстом.
PagedAttention
PagedAttention — алгоритм управления KV-cache в vLLM: разбивка на блоки, устранение фрагментации памяти, prefix caching. Настройка и практические эффекты.