Какой движок инференса выбрать: vLLM, SGLang, TensorRT-LLM, llama.cpp, Ollama, TGI, LMDeploy
Почему путь до 1 млрд токенов — Ollama → llama.cpp → vLLM: сложность против возможностей, форматы и путь модели через RAM в VRAM.
Подбор моделей по задачам и размерным классам: от 3B OCR и ASR до 35B агентского кодинга.
Почему путь до 1 млрд токенов — Ollama → llama.cpp → vLLM: сложность против возможностей, форматы и путь модели через RAM в VRAM.
Принцип «одна задача = одна модель в своём размерном классе»: от Mellum-4b, MinerU и bge-m3 до Qwen3.8-27B-AWQ-MTP и T-pro-it-2.1.
LLM-запрос — это не HTTP-запрос: он весит в 100 раз больше соседа, а кэш — состояние на ноде. Балансировать надо стоимость и локальность кэша, а не число запросов.
VRAM — это бюджет: weights + KV × concurrency + overhead ≤ VRAM × gpu-memory-utilization. Алгоритм подбора и лестница при OOM.
IT прошла путь от wild west до heavily regulated industry: consent, localization, breach notification 72ч/24ч, DPO, TIA, AI governance. Self-hosted закрывает эту корзину рисков.
Почему 80–100 tok/s и 256K — минимум 2026: dogfooding, опросы r/LocalLLaMA и тред «I’m done with local LLMs for coding» (648 upvotes).
4×RTX 4090 за ~$1,200/мес даёт throughput, сопоставимый с A100 80GB за ~$3,000/мес. Расчёт цены за 1M токенов и когда consumer-железо выигрывает.
Результаты бенчмарка Qwen3.8-27B на 2×RTX 3090: 100 tok/s decode, TTFT 1.8s при 8K промпте, 256K контекст — с полным конфигом vLLM.
Какие метрики следить в vLLM (throughput, TTFT/TPOT, GPU, KV-cache), как настроить Prometheus + Grafana и что стоит 2 недели без мониторинга.
Как организовать multi-tenant serving для vLLM: fair scheduling, изоляция, приоритеты и почему несколько реплик с балансировщиком отказоустойчивее одного инстанса.
FP8 даёт 2x экономию памяти против FP16 с минимальной потерей — но только на Hopper/Blackwell. Почему на RTX 3090 он недоступен и что использовать вместо него.
AWQ квантует веса до INT4 с потерей < 1 BLEU point, сокращая память в 4 раза. Как работает, чем отличается от GPTQ/FP8 и когда выбирать.
TP делит веса между GPU: когда нужен какой TP-градус, почему PCIe 4.0 достаточно для 27B на 2×3090 и где коммуникация съедает выигрыш.
Continuous batching даёт 2–10x throughput против static batching. Как работает scheduler vLLM, какие параметры настраивать и почему 256K контекст забирает параллельность.
Как PagedAttention решает проблему фрагментации KV-cache, даёт 2–4x throughput и как prefix caching превращается в бесплатный прирост скорости.