Qwen3.8-27B-AWQ-MTP
Почему мы собрали LLM-сервер, который жжёт миллиард токенов в сутки
Часть 1 серии «Наш опыт»: мотивация self-hosted LLM-инференса и путь железа от Tesla M40 до 4×(2×RTX 3090) — с цифрами на каждой фазе.
Какой движок инференса выбрать: vLLM, SGLang, TensorRT-LLM, llama.cpp, Ollama, TGI, LMDeploy
Сравнение движков инференса по сложности и возможностям: vLLM, SGLang, TensorRT-LLM, llama.cpp, Ollama, TGI, LMDeploy. Форматы GGUF vs AWQ/FP8 и путь модели disk → RAM 1.2X → VRAM 1–2X.
Матрица моделей по размерным классам: одна задача — одна модель
Какие модели брать по размерным классам: ≤3B — документы и аудио, ≤8B — RAG и поиск, ≤15B — рефакторинг, ≤35B — агентский кодинг. Конкретные модели и почему наш выбор — Qwen3.8-27B-AWQ-MTP.
Подбор модели под железо: VRAM-бюджет
Как посчитать, влезет ли модель: 6-шаговый алгоритм, формулы для весов и KV-cache, форматы под GPU-архитектуру (Ampere → AWQ, Hopper → FP8, CPU → GGUF) и лестница снижений при OOM.