Qwen3.8-27B-AWQ-MTP

Почему мы собрали LLM-сервер, который жжёт миллиард токенов в сутки

Часть 1 серии «Наш опыт»: мотивация self-hosted LLM-инференса и путь железа от Tesla M40 до 4×(2×RTX 3090) — с цифрами на каждой фазе.

Какой движок инференса выбрать: vLLM, SGLang, TensorRT-LLM, llama.cpp, Ollama, TGI, LMDeploy

Сравнение движков инференса по сложности и возможностям: vLLM, SGLang, TensorRT-LLM, llama.cpp, Ollama, TGI, LMDeploy. Форматы GGUF vs AWQ/FP8 и путь модели disk → RAM 1.2X → VRAM 1–2X.

Матрица моделей по размерным классам: одна задача — одна модель

Какие модели брать по размерным классам: ≤3B — документы и аудио, ≤8B — RAG и поиск, ≤15B — рефакторинг, ≤35B — агентский кодинг. Конкретные модели и почему наш выбор — Qwen3.8-27B-AWQ-MTP.

Подбор модели под железо: VRAM-бюджет

Как посчитать, влезет ли модель: 6-шаговый алгоритм, формулы для весов и KV-cache, форматы под GPU-архитектуру (Ampere → AWQ, Hopper → FP8, CPU → GGUF) и лестница снижений при OOM.