0, termina el servicio como failed — y reemplaza un servicio fallido u obsoleto creando uno nuevo.
Antes de comenzar
Necesitas:
Los servicios pasan por
requested → allocating → provisioning → ready, y permanecen ahí hasta que algo termina la ejecución:
- Un fallo en cualquier fase, incluida la salida de la carga de trabajo después de
ready, desmonta el servicio a través determinatinghastafailed. - Una terminación explícita, un límite alcanzado o un presupuesto de organización agotado terminan en
terminateden su lugar.
ready significa que la sonda pasó.
Sin una, solo significa que la carga de trabajo se lanzó; no hace ninguna afirmación de salud a nivel de aplicación, así que declara una sonda siempre que la imagen ofrezca una ruta de salud.
Paso 1 - Guarda la clave del endpoint como un secreto
Pasa la clave de API de la carga de trabajo mediantesecret_env, no en línea en el comando, para que nunca aparezca en las especificaciones de pod del proveedor.
sec_... devuelto para el cuerpo de creación, y el valor de la clave en sí para tus clientes.
Paso 2 - Crea el servicio
Crea el servicio con el encabezado obligatorioIdempotency-Key, exactamente igual que con los trabajos.
Este ejemplo sirve Qwen2.5-0.5B-Instruct con el servidor compatible con OpenAI de vLLM, replicando la prueba de humo de la plataforma:
Como con los trabajos,
201 significa que la solicitud fue aceptada; los problemas de capacidad y aprovisionamiento aparecen después a través de state, reason, los registros y los eventos.
Paso 3 - Espera a que esté listo
provisioning antes de que la sonda de preparación pase.
Un servicio listo incluye sus endpoints públicos:
failed, lee reason, y luego GET .../logs?source=user para la salida del propio servidor y source=system para problemas de asignación y arranque — la misma superficie de registros y eventos que los trabajos.
Paso 4 - Llama a tu endpoint
El endpoint es vLLM puro: una API compatible con OpenAI autenticada con la clave que guardaste en el Paso 1.curl
Paso 5 - Regístralo en el gateway LLM
Opcionalmente, registra el endpoint como un modelo propio (bring-your-own) en el gateway LLM de MKA1, para que se pueda llamar a través de la API/responses de la plataforma con claves normales de la plataforma.
Agrega el endpoint a tu catálogo de modelos:
curl
curl
completions se aceptan en /responses; el gateway maneja por ti el upstream de chat-completions.
Por eso el cuerpo de creación del Paso 2 pasó los flags de tool-choice a vLLM.
Paso 6 - Termina el servicio
Un servicio se ejecuta, y factura, hasta que lo detienes.Servir un modelo desde mka1-repos
Para servir pesos desde mka1-repos — como la salida fusionada de un trabajo de ajuste fino, o pesos que subiste por git — cambia solo el identificador del modelo y las credenciales. Compute siempre inyectaHF_ENDPOINT en cada carga de trabajo, apuntando al endpoint de artefactos configurado para tu clúster, y vLLM resuelve los identificadores de modelo contra él.
mka1-repos autentica con tu clave de API de MKA1, inyectada como HF_TOKEN mediante secret_env:
Supervisar el gasto
El gasto de los servicios se acumula por minuto completo desde la asignación y aparece junto a los trabajos en el endpoint de uso:limits se termina sin periodo de gracia.
Referencia de API
Para ver el esquema completo de solicitud y respuesta, abre los grupos de Compute en la Referencia de API.Ver también
- Ejecutar un trabajo de ajuste fino - produce los pesos que este servicio sirve.
- Gestionar repositorios - crea y gestiona los repositorios de los que este servicio obtiene los pesos.
- Usar repositorios con Compute - sube pesos por git y sírvelos por referencia.
- Generar una respuesta - llama a tu modelo registrado a través de la API
/responsesde la plataforma.