Guide / first run

Quickstart

От пустого runtime до первого проверенного ответа — без лишней инфраструктуры.

01 / Preflight

Проверьте окружение

Перед загрузкой весов проверьте доступную RAM/VRAM, версию runtime и свободное место. Для Aster-8B заложите минимум 8 GB RAM, для Nyx-14B — 12 GB.

vertex-runtime doctor vertex-runtime hardware --json > hardware.json vertex-runtime config validate ./runtime.yaml

Сохраните вывод вместе с manifest: при переносе на другую машину это помогает понять, изменился ли runtime, а не модель.

02 / Manifest

Положите manifest рядом с артефактами

Manifest содержит revision, формат, checksum и параметры tokenizer. Не переименовывайте файл и не редактируйте checksum вручную.

./model/ ├── model.manifest.json ├── tokenizer/ ├── weights/ └── profile.yaml
Важно: один и тот же checkpoint может иметь разные tokenizer или quantization metadata. Manifest — источник истины.
03 / Smoke test

Запустите минимальный запрос

Warm-up

Первый запуск может загружать kernels и allocator. Не сравнивайте cold-start с обычной задержкой.

Ответ

Проверьте обычный текст, JSON mode и ограничение max tokens.

Повтор

Запустите тот же запрос второй раз и сохраните latency и checksum runtime.

vertex-runtime smoke \ --manifest ./model.manifest.json \ --prompt "Return a JSON object with status and model." \ --format json
04 / Save profile

Сохраните рабочий профиль

В профиле должны быть явно зафиксированы модель, формат, context, batch и seed. Это позволит повторить запуск после обновления железа.

model: aster-8b revision: 1.8.3 format: q4 context: 16384 max_tokens: 2048 seed: 17Перейти к runtime profiles →