Принцип
Размерный класс → класс задач. Одна задача = одна модель в своём размерном классе. Consumer-железо (RTX 3090/4090, 24–48 GB VRAM) — работаем с моделями до 35B. Крупные (100B+) — только эксперименты.
≤ 3B — документы, аудио, спецзадачи
Узкие, быстрые, дешёвые:
| Модель | Задача | Детали |
|---|---|---|
| JetBrains/Mellum-4b-sft-python (4B) | Автодополнение кода (Python) | Обучена на 4T токенов, контекст 8K, ultra-low latency в IDE |
| MinerU 2.5 (1.2B) | PDF/DOCX → Markdown/JSON | Таблицы, формулы, reading order; 11/12 в бенчмарке парсеров 2026 |
| PaddleOCR-VL (0.9B) | VLM OCR | 96.33 OmniDocBench v1.6 (лидер 2026), 109 языков, Apache-2.0, ~2 GB VRAM |
| DeepSeek-OCR (~3B MoE, ~570M active) | Batch OCR | MIT, MoE-роутинг — лучший cost per page для больших партий документов |
| bond005/whisper-podlodka-turbo (~800M) | ASR (русский) | Whisper-large-v3-turbo, файнтюн под русскую речь, убирает ложные срабатывания на шумы |
Ключевой принцип: каждая спецзадача — своя маленькая модель. Не тащим 27B для OCR.
≤ 8B — RAG, поиск
| Модель | Задача | Детали |
|---|---|---|
| BAAI/bge-m3 (568M) | Hybrid retrieval | dense + sparse + ColBERT multi-vector в одном forward pass, 8K контекст, 100+ языков, MIT |
| Qwen/Qwen3-Embedding (0.6B/4B/8B) | Embedding | 32K контекст, MRL (Matryoshka — урезание dims без переобучения), instruction-aware, Apache-2.0; 8B — No.1 MTEB multilingual (70.58) и MTEB-Code 80.68 |
| Qwen/Qwen3-Reranker-4B (4B) | Reranking | Cross-encoder, 32K контекст, Apache-2.0, MTEB-Code 81.2 |
| TryDotAtwo/ruBERT-ruLaw (~110M) | Юридический RAG (русский) | Pre-trained на законах, sliding window 128, MLU-тест на судебных решениях |
RAG-пайплайн = embedding + reranker + LLM для генерации — каждый компонент в своём размерном классе.
≤ 15B — рефакторинг, базовый SDLC
| Модель | Задача | Детали |
|---|---|---|
| JetBrains/Mellum2-12B-A2.5B-Instruct (12B total / 2.5B active, MoE) | Оркестрация задач, выполнение команд | 64 experts, 8 active per token, SWA + full attention, GGUF Q8_0 |
| unsloth/Devstral-Small-2-24B-Instruct-2512 (24B, на границе) | Agentic coding, refactoring | Mistral, Q5_K_M/Q6_K на 24 GB, OpenHands-ready |
| DeepSeek Coder V2 Lite (16B total / 2.4B active, MoE) | Repo-level рефакторинг | MIT, сильна в fill-in-the-middle и multi-file задачах |
MoE (12B/2.5B, 16B/2.4B) даёт качество dense-класса при скорости inference в разы выше — «серебряная середина» для рефакторинга.
≤ 35B — проектирование и реализация
| Модель | Задача | Детали |
|---|---|---|
| shawnw3i/Qwen3.8-27B-AWQ-MTP (27B dense) | Агентский кодинг, multi-step | Наш выбор |
| t-tech/T-pro-it-2.1 (32B, на базе Qwen3) | RU RAG и чат | Превосходит Qwen3-32B в tool calling (ruBFCL 66.0 vs 57.3, enBFCL 72.3 vs 69.2), 32K контекст, Apache-2.0, EAGLE speculative decoding |
Почему Qwen3.8-27B для агентского кодинга
- Dense 27B с гибридной архитектурой: Gated DeltaNet (linear attention) на 48 из 64 слоёв + Gated Attention.
- MTP (Multi-Token Prediction) — встроенный speculative decoding head, ~2× ускорение decode (измерено: 76 → 176 tok/s).
- 262K нативный контекст (расширяется до 1M через YaRN).
- Vision tower — мультимодальность из коробки. Apache-2.0 — полная свобода для self-hosted.
Бенчмарки (Qwen3.6-27B → Qwen3.8-27B):
| Бенчмарк | Qwen3.6-27B | Qwen3.8-27B |
|---|---|---|
| Terminal-Bench 2.1 | 63.4 | 73.0 |
| DeepSWE | 13.3 | 42.2 |
| SWE-bench Pro | 53.5 | 61.7 |
| QwenSWEBench | 49.3 | 79.0 |
| LiveCodeBench v6 | 83.9 | 90.3 |
Почему не другие 35B для кодинга:
- T-pro-it-2.1 (32B) — лучшая RU-модель для RAG и чата, но по agentic coding бенчмарки Qwen3.8 сильнее.
- Qwen3-Coder-32B (32B) — хороший coder, но без MTP, 262K контекста и vision.
- Devstral-Small-2-24B — хороший coder, но нет MTP, нет 256K контекста, Mistral license.
- Qwen3.6-27B (предшественник) — −9.6 Terminal-Bench, −28.9 DeepSWE — поколение назад.
Почему именно AWQ-MTP квант
- W4A16 AWQ — 4-bit weights, 16-bit activations: ~16 GB весов + KV cache.
- MTP head сохранён в квантизации → speculative decoding работает.
- 2× RTX 3090 (48 GB) — комфортно: 16 GB weights + до ~32 GB KV cache (256K контекст).
Что мы видели в референс-деплое
Для агентского кодинга — Qwen3.8-27B-AWQ-MTP на 2×RTX 3090 (vLLM, TP=2, MTP). Полный процесс отбора из 12 моделей — в части 2 серии «Наш опыт», подбор кванта под VRAM — в статье VRAM-бюджет.
Вывод
Не ищите «одну лучшую модель». Ищите модель в размерном классе каждой задачи: OCR — 1–3B, RAG — 0.5–8B, рефакторинг — MoE 12–24B, агентский кодинг — до 35B с MTP.
Смежные материалы: Как мы выбрали Qwen3.8-27B из 12 моделей (часть 2), VRAM-бюджет, AWQ.