Fairness

Multi-tenant Serving

Multi-tenant serving для vLLM: fair scheduling, изоляция ресурсов, приоритеты, request-level и token-level scheduling, и как 3 реплики + Go-балансировщик решают это в референс-деплое.