Qwen3.8-27B
Почему мы собрали LLM-сервер, который жжёт миллиард токенов в сутки
Часть 1 серии «Наш опыт»: мотивация self-hosted LLM-инференса и путь железа от ноутбука с RTX 2060 до 3×(2×RTX 3090) — с цифрами на каждой фазе.
Как мы выбрали Qwen3.8-27B из 12 моделей: бенчмарки, MTP и почему 27B — sweet spot
Часть 2 серии «Наш опыт»: сравнение 12 моделей на 2×RTX 3090 — Terminal-Bench, DeepSWE, MTP, VRAM. Почему 27B — оптимум для агентного кодинга.
vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS
Часть 3 серии «Наш опыт»: 4 итерации тюнинга vLLM — MTP-декодирование, KV-cache на 256K, OMP_NUM_THREADS=1, mamba-cache-mode. Полный финальный конфиг и бенчмарк до/после.
Мы написали балансировщик для 3 реплик vLLM: почему NGINX не работает для LLM
Часть 4 серии «Наш опыт»: почему round-robin убивает throughput LLM-инференса и как 400 строк Go (least-loaded + prefix-aware routing) дали P99 3.2s против 8.7s у NGINX.
1 млрд токенов/сутки: финальная архитектура, тономика и что мы бы сделали по-другому
Часть 5 серии «Наш опыт»: финальная схема 3×(2×RTX 3090), честный расчёт 1 млрд токенов/сутки, тономика ($3,200/год против $20–73K API, payback ~1.5 месяца) и 5 уроков пути.
Qwen 27B на 2×RTX 3090
Бенчмарк Qwen3.8-27B-AWQ-MTP на 2×RTX 3090 (TP=2): 100 tok/s, TTFT 1.8s, контекст 256K. До/после тюнинга vLLM и полный конфиг.
Observability для vLLM
Observability для vLLM: ключевые метрики (throughput, TTFT, TPOT, GPU, KV-cache), настройка Prometheus и Grafana, алерты и цена двух недель без мониторинга в референс-деплое.
Multi-tenant Serving
Multi-tenant serving для vLLM: fair scheduling, изоляция ресурсов, приоритеты, request-level и token-level scheduling, и как 3 реплики + Go-балансировщик решают это в референс-деплое.
AWQ
AWQ: activation-aware квантизация весов до INT4 — как выделяются критические каналы, сравнение с GPTQ и FP8, запуск в vLLM и почему 27B в AWQ влезает в 2×RTX 3090.
Tensor Parallelism
Tensor Parallelism в vLLM: как веса разрезаются между GPU, PCIe против NVLink, таблица TP-градусов по размеру модели и почему 27B работает на 2×RTX 3090 по PCIe 4.0.
Continuous Batching
Continuous batching в vLLM: как scheduler добавляет запросы на каждой итерации decode, параметры max_num_seqs и max_num_batched_tokens, prefill/decode-баланс и компромисс с 256K контекстом.