Guide / decision matrix
Выбор модели
Не начинайте с максимального числа параметров. Сначала определите задачу, контекст и бюджет памяти.
Decision tree
Ответьте на четыре вопроса
Какой результат нужен?
Короткий ответ, structured extraction, code patch, embedding или многошаговое рассуждение.
Сколько контекста требуется?
Для документа до 16K подойдёт compact profile. Для репозитория или отчёта нужен chunking и retrieval.
Какой бюджет памяти?
Оставьте минимум 20% RAM под KV cache и запас операционной системы.
Нужна ли offline reproducibility?
Фиксируйте manifest, seed и формат; иначе обновление runtime может изменить результат.
Comparison
Короткая матрица
| Модель | Лучший сценарий | Context | Стартовый RAM | Формат |
|---|---|---|---|---|
| Aster-8B | Ассистент, extraction, JSON | 32K | 8 GB | Q4 / Q8 / BF16 |
| Nyx-14B Code | Code review, diff, repo | 64K | 12 GB | Q4 / Q8 / BF16 |
| Orion-32B | Reasoning, planning | 128K | 24 GB | Q4 / BF16 |
| Mica-Embed | RAG, search, clustering | 8K | 4 GB | Q8 / BF16 |
| Quartz-Vision | PDF, schema, screenshot | 16K | 8 GB | Q4 / BF16 |
Anti-patterns
Чего лучше не делать
- Выбирать модель только по числу параметров.
- Использовать BF16 на машине, где достаточно Q4.
- Увеличивать context без chunking и retrieval.
- Смешивать старый prompt с новым tokenizer revision.
- Считать cold-start обычной задержкой.