Конфигурация

Сравнение «datacenter против consumer» для LLM-инференса на vLLM:

  • Модель: Llama-3-70B (AWQ, INT4)
  • Конфиг A: A100 80GB × 1 (TP=1)
  • Конфиг B: RTX 4090 24GB × 4 (TP=4, PCIe 4.0)
  • vLLM версия: 0.5.0
  • Нагрузка: смешанная, 8K промпт, 1K генерация

Результаты

МетрикаA100 80GB (1x)4x RTX 4090
Throughput (decode)45 tok/s38 tok/s
TTFT (8K prompt)1.2s1.8s
TPOT22ms26ms
VRAM usage62/80 GB96/96 GB (4×24)
Стоимость/мес (cloud/rental)~$3,000~$1,200

Цена за 1M токенов — главная метрика

Черновой throughput — не то, за что вы платите. Вы платите за токены. Посчитаем стоимость 1M сгенерированных токенов:

  • A100: 45 tok/s = ~3.9M токенов/час = 93M токенов/сутки (24/7). При $3,000/мес ($100/сутки) → **$1.07 за 1M токенов**.
  • 4×4090: 38 tok/s = ~3.3M токенов/час = 79M токенов/сутки. При $1,200/мес ($40/сутки) → **$0.51 за 1M токенов**.

4×4090 почти в 2 раза дешевле за токен при throughput ниже лишь на ~15%. Для большинства use cases это выигрывает.

Когда что выигрывает

A100 выигрывает, когда:

  • Нужен один инстанс большой модели (70B+ в FP16) с длинным контекстом — 80GB VRAM на карте позволяет 70B FP16 + большой KV-cache без TP.
  • Критична стабильность и SLA: A100 — datacenter-железо, 24/7, ECC, поддержка.
  • Нужен нативный NVLink (A100-ноды) для TP=4/8 без PCIe-бутылочного горлышка.
  • Модель не влезает в суммарную VRAM consumer-карт.

RTX 4090 выигрывает, когда:

  • Важна цена за токен (основной case для self-hosted).
  • Модель квантована (AWQ/INT4) и влезает в суммарную VRAM.
  • Вы можете принять PCIe-коммуникацию (TP по PCIe медленнее, но для 27B–70B AWQ приемлемо).
  • Вы строите несколько реплик (отказоустойчивость), а не один большой инстанс.

Почему consumer-железо выигрывает по цене

RTX 4090 — это «почти A100» по compute на порядок дешевле. 4090 имеет 16GB/24GB VRAM и Ada-архитектуру с быстрыми Tensor Cores. Для memory-bound decode её compute-мощности достаточно, а цена — в 3–5 раз ниже A100. Когда модель квантована и влезает, 4090 даёт ~80–90% throughput A100 за ~40% стоимости.

Что мы видели в референс-деплое

Мы пошли ещё дальше в consumer-направление: RTX 3090 (Ampere, 24GB), а не 4090. Почему:

  1. Дешевле: б/у 3090 ~$700 против 4090 ~$1,600. Для 6 GPU (3×2) это разница в ~$4,200.
  2. Хватает: Qwen3.8-27B-AWQ-MTP на 2×3090 (TP=2) даёт 100 tok/s — быстрее, чем 70B на 4×4090, потому что модель меньше.
  3. Экономика: $0.009 за 1M токенов против API $0.14–0.50 — в 15–55 раз дешевле API.

Урок: не гонитесь за «самой быстрой картой», ищите лучшее соотношение цена/токен под вашу модель. Для 27B-модели 2×3090 оптимум; для 70B — 4×4090 или A100. См. часть 1 и часть 5, а также бенчмарк Qwen на 2×3090.

Как мы меряли

Чтобы сравнение было честным, использовали один и тот же нагрузочный генератор для обоих конфигов:

  • Нагрузка: 500 запросов, промпт 8K токенов, генерация до 1K токенов (или до EOS).
  • Concurrency: 8 параллельных запросов (реалистичный interactive-уровень).
  • Метрики: median и p95 для TTFT и TPOT, суммарный token throughput.
  • Прогрев: 50 запросов «на разгрев» (warmup) перед замером, чтобы KV-cache и CUDA-контексты были в рабочем состоянии.

Частая ошибка в таких сравнениях — мерить tok/s на одиночном запросе (batch=1). Тогда A100 выигрывает по latency, но это не то, за что вы платите в production. Мы мерили на смешанной нагрузке с concurrency, потому что в реальном сервисе запросы приходят параллельно.

Частые вопросы о цене

«А если я возьму A100 в облаке по почасовой ставке, а не в аренду?» Почасовая аренда A100 (~$1.5–3/час) при 24/7 даёт ~$1,100–2,200/мес — дешевле, чем выделенная аренда, но дороже 4×4090 в self-hosted. Разрыв в цене за токен сохраняется: consumer-железо всё равно выигрывает.

«А электричество?» 4×4090 потребляет ~2.4kW под нагрузкой, A100 80GB — ~400W. При $0.10/kWh: 4×4090 ≈ $170/мес электричество, A100 ≈ $29/мес. Электричество — ~15% стоимости 4×4090 и ~3% A100. Это не меняет вывод: consumer-железо выигрывает по цене за токен даже с учётом электричества.

«А амортизация железа?» 4×4090 (~$6,400) окупается за 1.5 месяца при нашей нагрузке (см. часть 5). A100 ($10,000+) — за ~3 месяца. Consumer-железо окупается быстрее.

Что это значит для вашего бюджета

Перед покупкой железа ответьте на три вопроса:

  1. Какая модель и в какой квантизации? Это определяет, влезает ли она в consumer-VRAM.
  2. Какой throughput вам нужен? Это определяет, сколько реплик/карт нужно.
  3. Сколько токенов вы генерируете в месяц? Это определяет цену за токен и payback.

Если ответы говорят «27B AWQ, ~100 tok/s, ~1B токенов/мес» — вам не нужен A100, вам нужен 2×3090. Полный расчёт — в части 5.

Вывод

Для self-hosted LLM-инференса consumer-железо (4090/3090) почти всегда выигрывает по цене за токен против A100, при сопоставимом throughput. A100 нужен, когда модель большая (FP16, 70B+), нужен длинный контекст в одном инстансе или критична datacenter-надёжность. Перед покупкой считайте цену за 1M токенов, а не tok/s — это единственная метрика, которая отражает реальную экономику.

Смежные материалы: Qwen на 2×3090, Tensor Parallelism, AWQ.

← Qwen 27B на 2×RTX 3090 1 млрд токенов/сутки: финальная архитектура, тономика и что мы бы сделали по-другому →