A100 80GB
A100 vs RTX 4090
Бенчмарк A100 80GB против 4×RTX 4090 для LLM-инференса на vLLM: throughput, latency, стоимость/мес и цена за 1M токенов. Когда consumer-железо выигрывает у datacenter.
FP8 квантизация
FP8 (E4M3/E5M2): нативная 8-битная квантизация на H100/B200, сравнение с AWQ, почему FP8 недоступен на RTX 3090 (Ampere) и когда он оправдан.
Tensor Parallelism
Tensor Parallelism в vLLM: как веса разрезаются между GPU, PCIe против NVLink, таблица TP-градусов по размеру модели и почему 27B работает на 2×RTX 3090 по PCIe 4.0.