Gpu
Почему мы собрали LLM-сервер, который жжёт миллиард токенов в сутки
Часть 1 серии «Наш опыт»: мотивация self-hosted LLM-инференса и путь железа от ноутбука с RTX 2060 до 3×(2×RTX 3090) — с цифрами на каждой фазе.
1 млрд токенов/сутки: финальная архитектура, тономика и что мы бы сделали по-другому
Часть 5 серии «Наш опыт»: финальная схема 3×(2×RTX 3090), честный расчёт 1 млрд токенов/сутки, тономика ($3,200/год против $20–73K API, payback ~1.5 месяца) и 5 уроков пути.