Runtime notes
От выбора карточки до устойчивого локального runtime: память, форматы, контекст, RAG, диагностика и воспроизводимые manifests.
Четыре шага до первого ответа
Выберите карточку
Сопоставьте задачу с family, context window и минимальной памятью. Для быстрого ассистента начните с Aster-8B.
Получите manifest
Используйте только revision, указанный в карточке. Не смешивайте tokenizer и quantization из разных релизов.
Запустите smoke test
Проверьте загрузку, первый token, JSON mode и максимальный context. Сохраните вывод runtime.
Зафиксируйте профиль
Положите локальный config в репозиторий проекта. Он должен содержать model revision, format и memory budget.
Hardware map
| Окружение | Рекомендуемый класс | Бюджет контекста | Проверка |
|---|---|---|---|
| 8 GB RAM | Mica, Aster | 8–16K | batch smoke |
| 12–16 GB RAM | Nyx, Quartz | 16–32K | latency + JSON |
| 24 GB+ RAM | Orion | 32–64K | reasoning budget |
| 32+ GB VRAM | Orion / Helio | 64–128K | batch replay |
Значения памяти включают runtime, KV cache и запас под операционную систему. Для длинного контекста используйте chunking вместо простого увеличения окна.
Минимальный рабочий контур
vertex-runtime verify ./model.manifest.json
vertex-runtime inspect --profile balanced
vertex-runtime serve --manifest ./model.manifest.json --max-tokens 2048
vertex-runtime replay ./eval/smoke.jsonl --report ./report.json
Команды показывают локальный workflow: проверка, инспекция, запуск и воспроизводимый replay. Workspace-артефакты не нужны для чтения документации.
Специальные сценарии
Quantization
Как выбрать Q4, Q8 или BF16 и не потерять качество структурированного ответа.
Context & RAG
Chunking, embeddings, retrieval budget и длинные документы.
Troubleshooting
OOM, медленный warm-up, нестабильный JSON и ошибки checksum.
Model selection
Сравнение моделей по задаче, памяти и формату, а не по названию.