Это не теория и не «best practices из документации». Это история реального production-деплоя, который мы построили и эксплуатируем: от ноутбука с RTX 2060 до четырех узлов по 2×RTX 3090, 12 протестированных моделей, 25 итераций тюнинга vLLM и собственный балансировщик для LLM трафика.
Серия из пяти частей. Каждая читается отдельно, вместе они образуют полный путь: 0 → 1 млрд токенов/сутки на consumer-железе.
Мы пишем честно: про crash на MTP, про KV-cache, который «не влезает», про 2 недели без мониторинга и про то, что мы бы сделали по-другому. Именно это — компромиссы, ошибки и конкретные цифры — делает историю полезной.