Как сформулированы требования
Не из опроса, а через dogfooding: наша команда первые месяцы работала через эту инфраструктуру, и «боль» стала списком требований. Поиск по Reddit и блогам 2026 показал: это не «завышенные» запросы, а стандарт года.
Шесть параметров 2026
| Параметр | Ожидание |
|---|---|
| Скорость | 80–100 ток/сек |
| Контекст | 256k токенов |
| Объём | 50M токенов/сутки на чел. |
| Качество | ≥ Claude 3.5 Sonnet |
| API | OpenAI / Anthropic-совместимый |
| Управление | Статистика и управление доступами |
Скорость: 80–100 tok/s — нижняя граница «не раздражает»
- Опрос r/LocalLLaMA: 8–12 tok/s — минимум для кода, 15–25 — «терпимо для чата».
- 8000 токенов при 16 tok/s = 8 минут на один ответ — точка, где бросают локальные модели.
- Overthinking (Qwen3.8, Simon Willison, 2026-08-16): 5–10× больше output = 5–10× дольше ожидание.
Конкурентность: 3–10 параллельных запросов на человека
- 3–4 человека одновременно без просадки — стандарт 2026 для команды 3–4 разработчиков.
- Агенты (pi.dev, Cursor, Kilo) создают 3–10 параллельных запросов на человека, а не 1.
- Люди прощают, что один запрос медленнее, но не прощают, что все запросы одновременно становятся медленными.
- Порог: «4+ concurrent users — vLLM batching wins» (Ollama 12 vs vLLM 80 tok/s).
Контекст: 256K — минимум, а не «фича»
- 256K — минимум для агентов-кодеров. Qwen3.6/3.8: 262K — дефолт.
- Реальное ожидание — 256K + стабильное качество на всём протяжении («gets dumber as context fills») + быстрый prefill (TTFT < 2–3 с на 100K input).
- Типичный агентский цикл: 50–100K input, 5K output, пик 200K.
Объём: точка, где self-hosting становится бизнес-кейсом
- 100M токенов/день/человек — верхняя граница «агентского кодинга» (1–2M/день — уже реальность).
- 100M/день = $570K/год на API = ~$1M+/год экономии при масштабе.
- Для команды 3–4 человека — 300–400M токенов/день на кластер. Это точка, где стоимость API превышает стоимость железа.
API: OpenAI/Anthropic-совместимый
Код-агенты (pi.dev, Cursor, Kilo) подключаются без смены клиента. В 2026 это де-факто стандарт, а не «фича».
Статистика и управление доступами
Счётчики токенов и запросов по пользователям и моделям, API-ключи — кто сколько сжёг и на какой модели (в нашем стеке — GPUStack).
Главная боль 2026
Тред «I’m done with local LLMs for coding» (648 upvotes): боль — не «локальная модель хуже Claude», а «локальная модель медленнее и менее предсказуема». Люди готовы на локальную модель, если:
- скорость ≥ 80–100 tok/s — стабильные, не «иногда 30, иногда 5»;
- контекст 256K без деградации;
- tool use на уровне Claude Code.
Что мы видели в референс-деплое
Наша финальная конфигурация закрывает все шесть параметров: 80–100 tok/s на человека, контекст 256K (262144), 10 сотрудников по 3 параллельных потока (средний 600–750M токенов/сутки, пик 1B), Qwen3.8-27B (Terminal-Bench 73.0, DeepSWE 42.2), OpenAI-совместимый API через GPUStack, счётчики по пользователям и API-ключам. Подробности — в части 5 серии «Наш опыт».
Вывод
В 2026 «локальная LLM» — это не «медленная версия облака». Стандарт — скорость и предсказуемость облака при данных внутри компании. Инфраструктура, которая не закрывает эти шесть параметров, — не инфраструктура, а демо.
Смежные материалы: Почему мы собрали свой LLM-сервер (часть 1 серии «Наш опыт»), Матрица моделей по размерным классам.