Kv-Cache

vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS

Часть 3 серии «Наш опыт»: 4 итерации тюнинга vLLM — MTP-декодирование, KV-cache на 256K, OMP_NUM_THREADS=1, mamba-cache-mode. Полный финальный конфиг и бенчмарк до/после.

Мы написали балансировщик для 3 реплик vLLM: почему NGINX не работает для LLM

Часть 4 серии «Наш опыт»: почему round-robin убивает throughput LLM-инференса и как 400 строк Go (least-loaded + prefix-aware routing) дали P99 3.2s против 8.7s у NGINX.

Continuous Batching

Continuous batching в vLLM: как scheduler добавляет запросы на каждой итерации decode, параметры max_num_seqs и max_num_batched_tokens, prefill/decode-баланс и компромисс с 256K контекстом.

PagedAttention

PagedAttention — алгоритм управления KV-cache в vLLM: разбивка на блоки, устранение фрагментации памяти, prefix caching. Настройка и практические эффекты.