Registre o modelo no gateway de LLM
Torne o modelo da implantação disponível para inferência: registre-o no registro de modelos do gateway de LLM sob o nome da implantação. A implantação deve estar pronta. O registro é deliberadamente desacoplado da implantação para que preços, orçamentos e limites de taxa possam ser configurados antes que o modelo se torne acionável.
Autorizações
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Cabeçalhos
Optional external end-user identifier forwarded by the API gateway.
Parâmetros de caminho
Resposta
Resposta Bem-Sucedida
Um servidor de inferência implantado.
Uma solicitação de acelerador de hardware — GPU, NPU, TPU ou مشابه.
Solicite um acelerador por tipo e quantidade, com tipos de fallback opcionais.
Motor de inferência que dá suporte a uma implantação.
vllm, sglang Revisão de configuração atual
Configuração de escalonamento automático para uma implantação.
pending, provisioning, ready, scaling, updating, degraded, failed, stopped, deleted Onde e como chamar o modelo; definido enquanto registrado no gateway
ID do modelo que os consumidores passam para os endpoints de inferência da gateway; definido enquanto a implantação está registrada com a gateway (veja Registrar), nulo quando não estiver registrada