A100 vs RTX 4090
4×RTX 4090 за ~$1,200/мес даёт throughput, сопоставимый с A100 80GB за ~$3,000/мес. Расчёт цены за 1M токенов и когда consumer-железо выигрывает.
Статьи об инфраструктуре LLM-инференса: observability, deployment patterns, monitoring.
4×RTX 4090 за ~$1,200/мес даёт throughput, сопоставимый с A100 80GB за ~$3,000/мес. Расчёт цены за 1M токенов и когда consumer-железо выигрывает.
Результаты бенчмарка Qwen3.8-27B на 2×RTX 3090: 100 tok/s decode, TTFT 1.8s при 8K промпте, 256K контекст — с полным конфигом vLLM.
Какие метрики следить в vLLM (throughput, TTFT/TPOT, GPU, KV-cache), как настроить Prometheus + Grafana и что стоит 2 недели без мониторинга.
Как организовать multi-tenant serving для vLLM: fair scheduling, изоляция, приоритеты и почему несколько реплик с балансировщиком отказоустойчивее одного инстанса.
FP8 даёт 2x экономию памяти против FP16 с минимальной потерей — но только на Hopper/Blackwell. Почему на RTX 3090 он недоступен и что использовать вместо него.
AWQ квантует веса до INT4 с потерей < 1 BLEU point, сокращая память в 4 раза. Как работает, чем отличается от GPTQ/FP8 и когда выбирать.
TP делит веса между GPU: когда нужен какой TP-градус, почему PCIe 4.0 достаточно для 27B на 2×3090 и где коммуникация съедает выигрыш.
Continuous batching даёт 2–10x throughput против static batching. Как работает scheduler vLLM, какие параметры настраивать и почему 256K контекст забирает параллельность.
Как PagedAttention решает проблему фрагментации KV-cache, даёт 2–4x throughput и как prefix caching превращается в бесплатный прирост скорости.