Kv-Cache
vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS
Часть 3 серии «Наш опыт»: 4 итерации тюнинга vLLM — MTP-декодирование, KV-cache на 256K, OMP_NUM_THREADS=1, mamba-cache-mode. Полный финальный конфиг и бенчмарк до/после.
Мы написали балансировщик для 3 реплик vLLM: почему NGINX не работает для LLM
Часть 4 серии «Наш опыт»: почему round-robin убивает throughput LLM-инференса и как 400 строк Go (least-loaded + prefix-aware routing) дали P99 3.2s против 8.7s у NGINX.
Continuous Batching
Continuous batching в vLLM: как scheduler добавляет запросы на каждой итерации decode, параметры max_num_seqs и max_num_batched_tokens, prefill/decode-баланс и компромисс с 256K контекстом.
PagedAttention
PagedAttention — алгоритм управления KV-cache в vLLM: разбивка на блоки, устранение фрагментации памяти, prefix caching. Настройка и практические эффекты.