Mtp
Как мы выбрали Qwen3.8-27B из 12 моделей: бенчмарки, MTP и почему 27B — sweet spot
Часть 2 серии «Наш опыт»: сравнение 12 моделей на 2×RTX 3090 — Terminal-Bench, DeepSWE, MTP, VRAM. Почему 27B — оптимум для агентного кодинга.
vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS
Часть 3 серии «Наш опыт»: 4 итерации тюнинга vLLM — MTP-декодирование, KV-cache на 256K, OMP_NUM_THREADS=1, mamba-cache-mode. Полный финальный конфиг и бенчмарк до/после.