Quickstart
От пустого runtime до первого проверенного ответа — без лишней инфраструктуры.
Проверьте окружение
Перед загрузкой весов проверьте доступную RAM/VRAM, версию runtime и свободное место. Для Aster-8B заложите минимум 8 GB RAM, для Nyx-14B — 12 GB.
vertex-runtime doctor
vertex-runtime hardware --json > hardware.json
vertex-runtime config validate ./runtime.yamlСохраните вывод вместе с manifest: при переносе на другую машину это помогает понять, изменился ли runtime, а не модель.
Положите manifest рядом с артефактами
Manifest содержит revision, формат, checksum и параметры tokenizer. Не переименовывайте файл и не редактируйте checksum вручную.
./model/
├── model.manifest.json
├── tokenizer/
├── weights/
└── profile.yamlЗапустите минимальный запрос
Warm-up
Первый запуск может загружать kernels и allocator. Не сравнивайте cold-start с обычной задержкой.
Ответ
Проверьте обычный текст, JSON mode и ограничение max tokens.
Повтор
Запустите тот же запрос второй раз и сохраните latency и checksum runtime.
vertex-runtime smoke \
--manifest ./model.manifest.json \
--prompt "Return a JSON object with status and model." \
--format jsonСохраните рабочий профиль
В профиле должны быть явно зафиксированы модель, формат, context, batch и seed. Это позволит повторить запуск после обновления железа.
model: aster-8b
revision: 1.8.3
format: q4
context: 16384
max_tokens: 2048
seed: 17Перейти к runtime profiles →