Конфигурация
Сравнение «datacenter против consumer» для LLM-инференса на vLLM:
- Модель: Llama-3-70B (AWQ, INT4)
- Конфиг A: A100 80GB × 1 (TP=1)
- Конфиг B: RTX 4090 24GB × 4 (TP=4, PCIe 4.0)
- vLLM версия: 0.5.0
- Нагрузка: смешанная, 8K промпт, 1K генерация
Результаты
| Метрика | A100 80GB (1x) | 4x RTX 4090 |
|---|---|---|
| Throughput (decode) | 45 tok/s | 38 tok/s |
| TTFT (8K prompt) | 1.2s | 1.8s |
| TPOT | 22ms | 26ms |
| VRAM usage | 62/80 GB | 96/96 GB (4×24) |
| Стоимость/мес (cloud/rental) | ~$3,000 | ~$1,200 |
Цена за 1M токенов — главная метрика
Черновой throughput — не то, за что вы платите. Вы платите за токены. Посчитаем стоимость 1M сгенерированных токенов:
- A100: 45 tok/s = ~3.9M токенов/час =
93M токенов/сутки (24/7). При$1.07 за 1M токенов**.$3,000/мес ($100/сутки) → ** - 4×4090: 38 tok/s = ~3.3M токенов/час =
79M токенов/сутки. При$0.51 за 1M токенов**.$1,200/мес ($40/сутки) → **
4×4090 почти в 2 раза дешевле за токен при throughput ниже лишь на ~15%. Для большинства use cases это выигрывает.
Когда что выигрывает
A100 выигрывает, когда:
- Нужен один инстанс большой модели (70B+ в FP16) с длинным контекстом — 80GB VRAM на карте позволяет 70B FP16 + большой KV-cache без TP.
- Критична стабильность и SLA: A100 — datacenter-железо, 24/7, ECC, поддержка.
- Нужен нативный NVLink (A100-ноды) для TP=4/8 без PCIe-бутылочного горлышка.
- Модель не влезает в суммарную VRAM consumer-карт.
RTX 4090 выигрывает, когда:
- Важна цена за токен (основной case для self-hosted).
- Модель квантована (AWQ/INT4) и влезает в суммарную VRAM.
- Вы можете принять PCIe-коммуникацию (TP по PCIe медленнее, но для 27B–70B AWQ приемлемо).
- Вы строите несколько реплик (отказоустойчивость), а не один большой инстанс.
Почему consumer-железо выигрывает по цене
RTX 4090 — это «почти A100» по compute на порядок дешевле. 4090 имеет 16GB/24GB VRAM и Ada-архитектуру с быстрыми Tensor Cores. Для memory-bound decode её compute-мощности достаточно, а цена — в 3–5 раз ниже A100. Когда модель квантована и влезает, 4090 даёт ~80–90% throughput A100 за ~40% стоимости.
Что мы видели в референс-деплое
Мы пошли ещё дальше в consumer-направление: RTX 3090 (Ampere, 24GB), а не 4090. Почему:
- Дешевле: б/у 3090 ~$700 против 4090 ~$1,600. Для 6 GPU (3×2) это разница в ~$4,200.
- Хватает: Qwen3.8-27B-AWQ-MTP на 2×3090 (TP=2) даёт 100 tok/s — быстрее, чем 70B на 4×4090, потому что модель меньше.
- Экономика: $0.009 за 1M токенов против API $0.14–0.50 — в 15–55 раз дешевле API.
Урок: не гонитесь за «самой быстрой картой», ищите лучшее соотношение цена/токен под вашу модель. Для 27B-модели 2×3090 оптимум; для 70B — 4×4090 или A100. См. часть 1 и часть 5, а также бенчмарк Qwen на 2×3090.
Как мы меряли
Чтобы сравнение было честным, использовали один и тот же нагрузочный генератор для обоих конфигов:
- Нагрузка: 500 запросов, промпт 8K токенов, генерация до 1K токенов (или до EOS).
- Concurrency: 8 параллельных запросов (реалистичный interactive-уровень).
- Метрики: median и p95 для TTFT и TPOT, суммарный token throughput.
- Прогрев: 50 запросов «на разгрев» (warmup) перед замером, чтобы KV-cache и CUDA-контексты были в рабочем состоянии.
Частая ошибка в таких сравнениях — мерить tok/s на одиночном запросе (batch=1). Тогда A100 выигрывает по latency, но это не то, за что вы платите в production. Мы мерили на смешанной нагрузке с concurrency, потому что в реальном сервисе запросы приходят параллельно.
Частые вопросы о цене
«А если я возьму A100 в облаке по почасовой ставке, а не в аренду?» Почасовая аренда A100 (~$1.5–3/час) при 24/7 даёт ~$1,100–2,200/мес — дешевле, чем выделенная аренда, но дороже 4×4090 в self-hosted. Разрыв в цене за токен сохраняется: consumer-железо всё равно выигрывает.
«А электричество?» 4×4090 потребляет ~2.4kW под нагрузкой, A100 80GB — ~400W. При $0.10/kWh: 4×4090 ≈ $170/мес электричество, A100 ≈ $29/мес. Электричество — ~15% стоимости 4×4090 и ~3% A100. Это не меняет вывод: consumer-железо выигрывает по цене за токен даже с учётом электричества.
«А амортизация железа?»
4×4090 (~$6,400) окупается за 1.5 месяца при нашей нагрузке (см. часть 5). A100 ($10,000+) — за ~3 месяца. Consumer-железо окупается быстрее.
Что это значит для вашего бюджета
Перед покупкой железа ответьте на три вопроса:
- Какая модель и в какой квантизации? Это определяет, влезает ли она в consumer-VRAM.
- Какой throughput вам нужен? Это определяет, сколько реплик/карт нужно.
- Сколько токенов вы генерируете в месяц? Это определяет цену за токен и payback.
Если ответы говорят «27B AWQ, ~100 tok/s, ~1B токенов/мес» — вам не нужен A100, вам нужен 2×3090. Полный расчёт — в части 5.
Вывод
Для self-hosted LLM-инференса consumer-железо (4090/3090) почти всегда выигрывает по цене за токен против A100, при сопоставимом throughput. A100 нужен, когда модель большая (FP16, 70B+), нужен длинный контекст в одном инстансе или критична datacenter-надёжность. Перед покупкой считайте цену за 1M токенов, а не tok/s — это единственная метрика, которая отражает реальную экономику.
Смежные материалы: Qwen на 2×3090, Tensor Parallelism, AWQ.