Quantization
FP8 квантизация
FP8 (E4M3/E5M2): нативная 8-битная квантизация на H100/B200, сравнение с AWQ, почему FP8 недоступен на RTX 3090 (Ampere) и когда он оправдан.
AWQ
AWQ: activation-aware квантизация весов до INT4 — как выделяются критические каналы, сравнение с GPTQ и FP8, запуск в vLLM и почему 27B в AWQ влезает в 2×RTX 3090.