Принцип

Размерный класс → класс задач. Одна задача = одна модель в своём размерном классе. Consumer-железо (RTX 3090/4090, 24–48 GB VRAM) — работаем с моделями до 35B. Крупные (100B+) — только эксперименты.

≤ 3B — документы, аудио, спецзадачи

Узкие, быстрые, дешёвые:

МодельЗадачаДетали
JetBrains/Mellum-4b-sft-python (4B)Автодополнение кода (Python)Обучена на 4T токенов, контекст 8K, ultra-low latency в IDE
MinerU 2.5 (1.2B)PDF/DOCX → Markdown/JSONТаблицы, формулы, reading order; 11/12 в бенчмарке парсеров 2026
PaddleOCR-VL (0.9B)VLM OCR96.33 OmniDocBench v1.6 (лидер 2026), 109 языков, Apache-2.0, ~2 GB VRAM
DeepSeek-OCR (~3B MoE, ~570M active)Batch OCRMIT, MoE-роутинг — лучший cost per page для больших партий документов
bond005/whisper-podlodka-turbo (~800M)ASR (русский)Whisper-large-v3-turbo, файнтюн под русскую речь, убирает ложные срабатывания на шумы

Ключевой принцип: каждая спецзадача — своя маленькая модель. Не тащим 27B для OCR.

≤ 8B — RAG, поиск

МодельЗадачаДетали
BAAI/bge-m3 (568M)Hybrid retrievaldense + sparse + ColBERT multi-vector в одном forward pass, 8K контекст, 100+ языков, MIT
Qwen/Qwen3-Embedding (0.6B/4B/8B)Embedding32K контекст, MRL (Matryoshka — урезание dims без переобучения), instruction-aware, Apache-2.0; 8B — No.1 MTEB multilingual (70.58) и MTEB-Code 80.68
Qwen/Qwen3-Reranker-4B (4B)RerankingCross-encoder, 32K контекст, Apache-2.0, MTEB-Code 81.2
TryDotAtwo/ruBERT-ruLaw (~110M)Юридический RAG (русский)Pre-trained на законах, sliding window 128, MLU-тест на судебных решениях

RAG-пайплайн = embedding + reranker + LLM для генерации — каждый компонент в своём размерном классе.

≤ 15B — рефакторинг, базовый SDLC

МодельЗадачаДетали
JetBrains/Mellum2-12B-A2.5B-Instruct (12B total / 2.5B active, MoE)Оркестрация задач, выполнение команд64 experts, 8 active per token, SWA + full attention, GGUF Q8_0
unsloth/Devstral-Small-2-24B-Instruct-2512 (24B, на границе)Agentic coding, refactoringMistral, Q5_K_M/Q6_K на 24 GB, OpenHands-ready
DeepSeek Coder V2 Lite (16B total / 2.4B active, MoE)Repo-level рефакторингMIT, сильна в fill-in-the-middle и multi-file задачах

MoE (12B/2.5B, 16B/2.4B) даёт качество dense-класса при скорости inference в разы выше — «серебряная середина» для рефакторинга.

≤ 35B — проектирование и реализация

МодельЗадачаДетали
shawnw3i/Qwen3.8-27B-AWQ-MTP (27B dense)Агентский кодинг, multi-stepНаш выбор
t-tech/T-pro-it-2.1 (32B, на базе Qwen3)RU RAG и чатПревосходит Qwen3-32B в tool calling (ruBFCL 66.0 vs 57.3, enBFCL 72.3 vs 69.2), 32K контекст, Apache-2.0, EAGLE speculative decoding

Почему Qwen3.8-27B для агентского кодинга

  • Dense 27B с гибридной архитектурой: Gated DeltaNet (linear attention) на 48 из 64 слоёв + Gated Attention.
  • MTP (Multi-Token Prediction) — встроенный speculative decoding head, ~2× ускорение decode (измерено: 76 → 176 tok/s).
  • 262K нативный контекст (расширяется до 1M через YaRN).
  • Vision tower — мультимодальность из коробки. Apache-2.0 — полная свобода для self-hosted.

Бенчмарки (Qwen3.6-27B → Qwen3.8-27B):

БенчмаркQwen3.6-27BQwen3.8-27B
Terminal-Bench 2.163.473.0
DeepSWE13.342.2
SWE-bench Pro53.561.7
QwenSWEBench49.379.0
LiveCodeBench v683.990.3

Почему не другие 35B для кодинга:

  • T-pro-it-2.1 (32B) — лучшая RU-модель для RAG и чата, но по agentic coding бенчмарки Qwen3.8 сильнее.
  • Qwen3-Coder-32B (32B) — хороший coder, но без MTP, 262K контекста и vision.
  • Devstral-Small-2-24B — хороший coder, но нет MTP, нет 256K контекста, Mistral license.
  • Qwen3.6-27B (предшественник) — −9.6 Terminal-Bench, −28.9 DeepSWE — поколение назад.

Почему именно AWQ-MTP квант

  • W4A16 AWQ — 4-bit weights, 16-bit activations: ~16 GB весов + KV cache.
  • MTP head сохранён в квантизации → speculative decoding работает.
  • 2× RTX 3090 (48 GB) — комфортно: 16 GB weights + до ~32 GB KV cache (256K контекст).

Что мы видели в референс-деплое

Для агентского кодинга — Qwen3.8-27B-AWQ-MTP на 2×RTX 3090 (vLLM, TP=2, MTP). Полный процесс отбора из 12 моделей — в части 2 серии «Наш опыт», подбор кванта под VRAM — в статье VRAM-бюджет.

Вывод

Не ищите «одну лучшую модель». Ищите модель в размерном классе каждой задачи: OCR — 1–3B, RAG — 0.5–8B, рефакторинг — MoE 12–24B, агентский кодинг — до 35B с MTP.

Смежные материалы: Как мы выбрали Qwen3.8-27B из 12 моделей (часть 2), VRAM-бюджет, AWQ.

← Особенности LLM-трафика: почему round-robin не работает Какой движок инференса выбрать: vLLM, SGLang, TensorRT-LLM, llama.cpp, Ollama, TGI, LMDeploy →