Python

Мы написали балансировщик для 4 реплик vLLM: почему NGINX не работает для LLM

Часть 4 серии «Наш опыт»: почему round-robin убивает throughput LLM-инференса и как собственный Python-балансировщик (soft sticky + least-loaded + health без user traffic) держит сессии на тёплой KV-cache. Четыре production-инцидента, которые сформировали алгоритм.