Tensor-Parallelism

vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS

Часть 3 серии «Наш опыт»: 4 итерации тюнинга vLLM — MTP-декодирование, KV-cache на 256K, OMP_NUM_THREADS=1, mamba-cache-mode. Полный финальный конфиг и бенчмарк до/после.

Tensor Parallelism

Tensor Parallelism в vLLM: как веса разрезаются между GPU, PCIe против NVLink, таблица TP-градусов по размеру модели и почему 27B работает на 2×RTX 3090 по PCIe 4.0.