Как сформулированы требования

Не из опроса, а через dogfooding: наша команда первые месяцы работала через эту инфраструктуру, и «боль» стала списком требований. Поиск по Reddit и блогам 2026 показал: это не «завышенные» запросы, а стандарт года.

Шесть параметров 2026

ПараметрОжидание
Скорость80–100 ток/сек
Контекст256k токенов
Объём50M токенов/сутки на чел.
Качество≥ Claude 3.5 Sonnet
APIOpenAI / Anthropic-совместимый
УправлениеСтатистика и управление доступами

Скорость: 80–100 tok/s — нижняя граница «не раздражает»

  • Опрос r/LocalLLaMA: 8–12 tok/s — минимум для кода, 15–25 — «терпимо для чата».
  • 8000 токенов при 16 tok/s = 8 минут на один ответ — точка, где бросают локальные модели.
  • Overthinking (Qwen3.8, Simon Willison, 2026-08-16): 5–10× больше output = 5–10× дольше ожидание.

Конкурентность: 3–10 параллельных запросов на человека

  • 3–4 человека одновременно без просадки — стандарт 2026 для команды 3–4 разработчиков.
  • Агенты (pi.dev, Cursor, Kilo) создают 3–10 параллельных запросов на человека, а не 1.
  • Люди прощают, что один запрос медленнее, но не прощают, что все запросы одновременно становятся медленными.
  • Порог: «4+ concurrent users — vLLM batching wins» (Ollama 12 vs vLLM 80 tok/s).

Контекст: 256K — минимум, а не «фича»

  • 256K — минимум для агентов-кодеров. Qwen3.6/3.8: 262K — дефолт.
  • Реальное ожидание — 256K + стабильное качество на всём протяжении («gets dumber as context fills») + быстрый prefill (TTFT < 2–3 с на 100K input).
  • Типичный агентский цикл: 50–100K input, 5K output, пик 200K.

Объём: точка, где self-hosting становится бизнес-кейсом

  • 100M токенов/день/человек — верхняя граница «агентского кодинга» (1–2M/день — уже реальность).
  • 100M/день = $570K/год на API = ~$1M+/год экономии при масштабе.
  • Для команды 3–4 человека — 300–400M токенов/день на кластер. Это точка, где стоимость API превышает стоимость железа.

API: OpenAI/Anthropic-совместимый

Код-агенты (pi.dev, Cursor, Kilo) подключаются без смены клиента. В 2026 это де-факто стандарт, а не «фича».

Статистика и управление доступами

Счётчики токенов и запросов по пользователям и моделям, API-ключи — кто сколько сжёг и на какой модели (в нашем стеке — GPUStack).

Главная боль 2026

Тред «I’m done with local LLMs for coding» (648 upvotes): боль — не «локальная модель хуже Claude», а «локальная модель медленнее и менее предсказуема». Люди готовы на локальную модель, если:

  • скорость ≥ 80–100 tok/s — стабильные, не «иногда 30, иногда 5»;
  • контекст 256K без деградации;
  • tool use на уровне Claude Code.

Что мы видели в референс-деплое

Наша финальная конфигурация закрывает все шесть параметров: 80–100 tok/s на человека, контекст 256K (262144), 10 сотрудников по 3 параллельных потока (средний 600–750M токенов/сутки, пик 1B), Qwen3.8-27B (Terminal-Bench 73.0, DeepSWE 42.2), OpenAI-совместимый API через GPUStack, счётчики по пользователям и API-ключам. Подробности — в части 5 серии «Наш опыт».

Вывод

В 2026 «локальная LLM» — это не «медленная версия облака». Стандарт — скорость и предсказуемость облака при данных внутри компании. Инфраструктура, которая не закрывает эти шесть параметров, — не инфраструктура, а демо.

Смежные материалы: Почему мы собрали свой LLM-сервер (часть 1 серии «Наш опыт»), Матрица моделей по размерным классам.

← A100 vs RTX 4090 Право и ИИ: локализация данных и регуляторика 2000–2026 →