Хук: $3,200/год против API
1 млрд токенов в сутки. В пике. Если бы весь этот объём шёл через API, он стоил бы $20–73K в год в зависимости от провайдера и blended-тарифа. На нашем железе — $3,200/год. Вот как мы дошли до этой цифры — и как ловили себя на нечестных расчётах по пути.
Финальная архитектура
[pi.dev / Cursor / Kilo Code]
│
▼
[Балансировщик (Go, Gin)]
│
┌────┼────┐
▼ ▼ ▼
[R1] [R2] [R3]
2×3090 2×3090 2×3090
vLLM vLLM vLLM
TP=2 TP=2 TP=2
MTP MTP MTP
│ │ │
└────┼────┘
│
[GPUStack]
(auto-restart, monitoring)
Собрать детали: железо (часть 1), модель (часть 2), конфиг vLLM (часть 3), балансировщик (часть 4).
Цифры: как мы считаем 1 млрд токенов/сутки
Считаем честно, по частям:
- 3 реплики × 100 tok/s = 225 tok/s (aggregate decode).
- 225 tok/s × 86,400s = 19.4M output-токенов/сутки — теоретический максимум генерации.
- Реальный decode — ~60% utilization (есть prefill, idle, TTFT) → ~11.6M output-токенов/сутки.
А теперь — момент честности. Мы сначала считали «1 млрд» как 700M input + 300M output. И поняли, что это не сходится: 300M output-токенов при 225 tok/s — это 1,333,333 секунд, то есть 15.4 дня, а не сутки.
Отсюда правильный вывод: 1 млрд — это total (input + output), и в агентных нагрузках доминирует input. Контекст 256K, RAG, tool calls — это сотни тысяч input-токенов на запрос при генерации в 1–5K. Prefill такого объёма проходит на порядки быстрее decode.
Итог, как мы считаем:
- 1 млрд токенов/сутки — пиковая нагрузка (агентный кодинг, 8–12 часов пиковой активности).
- В среднем — 300–500M/сутки (типично ~400M).
- Пик — это то, что определяет размер инфраструктуры. Средний — то, что определяет экономику.
Тономика (ROI)
| Параметр | Значение |
|---|---|
| Железо (3×2×RTX 3090, б/у) | ~$4,200 (разово) |
| Электричество (6×350W, 24/7) | ~$1,800/год |
| Амортизация (3 года) | ~$1,400/год |
| Итого/год | ~$3,200/год |
| Средний объём | ~400M токенов/сутки (~146B/год) |
| Пиковый объём | ~1B токенов/сутки |
| API-эквивалент (blended $0.14–0.50/1M) | ~$20–73K/год |
| Стоимость 1M токенов локально (при пике) | ~$0.009 |
| Payback period | ~1.5 месяца |
Расчёт payback: при среднем объёме API-эквивалент — $20–73K/год, локально — $3.2K/год. Экономия при blended-тарифе ~$0.25/1M — порядка $2.7–2.8K/месяц; $4,200 железа окупаются за ~1.5 месяца.
$0.009/1M — это стоимость при пиковой загрузке ($3,200/год ÷ 365B токенов/год). При среднем объёме — ~$0.02/1M. И то, и другое на порядок дешевле API-диапазона $0.14–0.50/1M.
Что мы бы сделали по-другому (уроки)
- Железо: взяли бы 4×3090 (TP=4) вместо 3×(2×3090). Один узел — проще, нет меж-узловой сети. Но 4×3090 в одной матерке — это 1.4kW: наш блок питания не потянул. Пришлось 3 узла.
- Модель: не тестировали бы 12 моделей. Взяли бы Qwen3.8, DeepSeek-V3.2 (если влезает) и GLM-4.6. 3 модели, 3 дня, решение.
- vLLM: сразу поставили бы 0.28.0. 2 недели на нестабильном 0.27.1 — потерянное время.
- Балансировщик: не писали бы свой. Взяли бы GPUStack + NGINX и не парились. И не делали бы prefix-aware routing — это 20% кода, которое даёт ~5% gain.
- Мониторинг: с первого дня поставили бы Prometheus + Grafana. 2 недели мы летали вслепую: crash на MTP обнаружили по логам, а не по алерту. Подробности — в Observability.
Что дальше (roadmap)
- Qwen4 (когда выйдет): MTP + 40B — 3090 не потянет. Нужен 4090 (48GB) или H100.
- RAG-сервис: bge-m3-legal-ru + reranker (BGE-reranker-v2-m3).
- Quorix: AI Gateway поверх этой инфраструктуры (pre-execution enforcement).
Эта статья — не конец. Это checkpoint. Через 6 месяцев мы перепишем её заново.
Финал
1 млрд токенов в сутки — это не про железо. Это про то, что мы перестали быть пользователями API и стали операторами инфраструктуры. Наш код-агент работает 24/7, без лимитов, без счетов, без зависимости от чужого uptime. И это стоит $3,200/год. Не $20–73K, как через API.
Читать серию с начала — или обсудить, как сделать то же самое для вашей компании.