0, termina o serviço como failed — e substitua um serviço que falhou ou ficou desatualizado criando um novo.
Antes de começar
Você precisa de:
Os serviços passam por
requested → allocating → provisioning → ready e permanecem lá até algo encerrar a execução:
- Uma falha em qualquer fase, incluindo a carga de trabalho sair depois de
ready, desmonta o serviço porterminatingatéfailed. - Encerramento explícito, um limite atingido ou um orçamento da organização esgotado termina em
terminated.
ready significa que a sonda passou.
Sem uma, significa apenas que a carga de trabalho foi lançada; não faz nenhuma afirmação de saúde no nível da aplicação, então declare uma sonda sempre que a imagem oferecer uma rota de health check.
Passo 1 - Armazene a chave do endpoint como um segredo
Passe a chave de API da carga de trabalho através desecret_env, não inline no comando, para que ela nunca apareça nas especificações de pod do provedor.
sec_... retornado para o corpo de criação, e o valor da chave em si para seus clientes.
Passo 2 - Crie o serviço
Crie o serviço com um cabeçalhoIdempotency-Key obrigatório, exatamente como para jobs.
Este exemplo serve o Qwen2.5-0.5B-Instruct com o servidor compatível com OpenAI do vLLM, reproduzindo o smoke test da plataforma:
Como nos jobs,
201 significa que a requisição foi aceita; problemas de capacidade e provisionamento aparecem depois através de state, reason, logs e eventos.
Passo 3 - Aguarde ficar pronto
provisioning antes de a sonda de prontidão passar.
Um serviço pronto carrega seus endpoints públicos:
failed, leia o reason, depois GET .../logs?source=user para a saída do próprio servidor e source=system para problemas de alocação e bootstrap — a mesma superfície de logs e eventos dos jobs.
Passo 4 - Chame seu endpoint
O endpoint é vLLM puro: uma API compatível com OpenAI autenticada com a chave que você armazenou no Passo 1.curl
Passo 5 - Registre no gateway de LLM
Opcionalmente, registre o endpoint como um modelo bring-your-own no gateway de LLM da MKA1, para que ele possa ser chamado através da API/responses da plataforma com chaves normais da plataforma.
Adicione o endpoint ao seu catálogo de modelos:
curl
curl
completions são aceitos em /responses; o gateway conduz o upstream de chat-completions por você.
É por isso que o corpo de criação no Passo 2 passou as flags de tool-choice ao vLLM.
Passo 6 - Encerre o serviço
Um serviço executa, e cobra, até você pará-lo.Sirva um modelo a partir do mka1-repos
Para servir pesos do mka1-repos — como a saída mesclada de um job de ajuste fino, ou pesos que você enviou via git — mude apenas o identificador do modelo e as credenciais. O Compute sempre injetaHF_ENDPOINT em toda carga de trabalho, apontando para o endpoint de artefatos configurado para o seu cluster, e o vLLM resolve identificadores de modelo contra ele.
O mka1-repos autentica com sua chave de API MKA1, injetada como HF_TOKEN através de secret_env:
Acompanhe os gastos
Os gastos de serviço acumulam por minuto inteiro a partir da alocação e aparecem junto com os jobs no endpoint de uso:limits é encerrado sem período de carência.
Referência da API
Para o esquema completo de requisição e resposta, abra os grupos do Compute na Referência de API.Veja também
- Executar um job de ajuste fino - produza os pesos que este serviço serve.
- Gerenciar repositórios - crie e gerencie os repositórios dos quais este serviço baixa pesos.
- Usar repositórios com o Compute - envie pesos via git e sirva-os por referência.
- Gerar uma resposta - chame seu modelo registrado através da API
/responsesda plataforma.