Наш опыт

Референс-деплой CodeOnTime: 1 млрд токенов/сутки на 3×(2×RTX 3090). Пять частей — от железа и подбора модели до тюнинга vLLM, собственного балансировщика и тономики.

1 млрд токенов/сутки (пиковая нагрузка)
100 tok/s на каждого пользователя
3 ₽ за 1M токенов
2.5 кВт мощность фермы

Это не теория и не «best practices из документации». Это история реального production-деплоя, который мы построили и эксплуатируем: от ноутбука с RTX 2060 до четырех узлов по 2×RTX 3090, 12 протестированных моделей, 25 итераций тюнинга vLLM и собственный балансировщик для LLM трафика.

Серия из пяти частей. Каждая читается отдельно, вместе они образуют полный путь: 0 → 1 млрд токенов/сутки на consumer-железе.

Мы пишем честно: про crash на MTP, про KV-cache, который «не влезает», про 2 недели без мониторинга и про то, что мы бы сделали по-другому. Именно это — компромиссы, ошибки и конкретные цифры — делает историю полезной.

Серия — 5 частей

Часть 1

Почему мы собрали LLM-сервер, который жжёт миллиард токенов в сутки

Мотивация и железо: от 12 tok/s на ноутбуке до 6 GPU. Почему API не подошёл и какой путь мы прошли, чтобы дойти 1 млрд токенов/сутки.

Часть 2

Как мы выбрали Qwen3.8-27B из 12 моделей: бенчмарки, MTP и почему 27B — sweet spot

Процесс отбора модели: критерии, таблица бенчмарков 12 моделей и почему MTP решает всё на 3090.

Часть 3

vLLM на 2×RTX 3090: от 18 до 100 tok/s — MTP, TP, KV-cache, OMP_NUM_THREADS

4 параметра в конфиге и 2 дня отладки, которые дали ×4.2 скорости: от 18 до 100 tok/s. Все итерации, crash на MTP и финальный конфиг.

Часть 4

Мы написали балансировщик для 3 реплик vLLM: почему NGINX не работает для LLM

Архитектура собственного балансировщика (Go, Gin) для 3 реплик vLLM: health check, least-loaded, prefix-aware и context-aware routing, failover — и бенчмарк против NGINX.

Часть 5

1 млрд токенов/сутки: финальная архитектура, тономика и что мы бы сделали по-другому

Финальная архитектура, расчёт 1 млрд токенов/сутки (пик 1B, средний 400M), тономика и 5 вещей, которые мы бы сделали иначе.

Хотите, чтобы мы сделали это для вашей компании?

Мы тюнингуем production-инференс на vLLM под конкретное железо и SLA: от аудита и бенчмарков до нагрузочного тестирования. Обсудим вашу инфраструктуру.

Обсудить проект