Architecture
Мы написали балансировщик для 3 реплик vLLM: почему NGINX не работает для LLM
Часть 4 серии «Наш опыт»: почему round-robin убивает throughput LLM-инференса и как 400 строк Go (least-loaded + prefix-aware routing) дали P99 3.2s против 8.7s у NGINX.
1 млрд токенов/сутки: финальная архитектура, тономика и что мы бы сделали по-другому
Часть 5 серии «Наш опыт»: финальная схема 3×(2×RTX 3090), честный расчёт 1 млрд токенов/сутки, тономика ($3,200/год против $20–73K API, payback ~1.5 месяца) и 5 уроков пути.