Registre el modelo con la puerta de enlace LLM
Ponga el modelo de la implementación disponible para inferencia: lo registra en el registro de modelos de la puerta de enlace LLM bajo el nombre de la implementación. La implementación debe estar lista. El registro está deliberadamente desacoplado de la implementación para que se puedan configurar los precios, los presupuestos y los límites de velocidad antes de que el modelo pueda ser invocado.
Autorizaciones
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Encabezados
Optional external end-user identifier forwarded by the API gateway.
Parámetros de ruta
Respuesta
Respuesta Exitosa
Un servidor de inferencia desplegado.
Una solicitud de acelerador de hardware — GPU, NPU, TPU o similar.
Solicita un acelerador por tipo y cantidad, con tipos de reserva opcionales.
Motor de inferencia que respalda una implementación.
vllm, sglang Revisión actual de la configuración
Configuración de autoescalado para una implementación.
pending, provisioning, ready, scaling, updating, degraded, failed, stopped, deleted Dónde y cómo llamar al modelo; configurado mientras está registrado en la pasarela
ID de modelo que los consumidores envían a los endpoints de inferencia de la puerta de enlace; se establece mientras la implementación está registrada en la puerta de enlace (véase Registrar), nulo cuando no está registrada