Load-Balancing
Мы написали балансировщик для 3 реплик vLLM: почему NGINX не работает для LLM
Часть 4 серии «Наш опыт»: почему round-robin убивает throughput LLM-инференса и как 400 строк Go (least-loaded + prefix-aware routing) дали P99 3.2s против 8.7s у NGINX.
Multi-tenant Serving
Multi-tenant serving для vLLM: fair scheduling, изоляция ресурсов, приоритеты, request-level и token-level scheduling, и как 3 реплики + Go-балансировщик решают это в референс-деплое.