Este guia aluga GPUs e executa seu próprio contêiner de treinamento.
Para a API gerenciada de ajuste fino que treina modelos da plataforma a partir de arquivos JSONL enviados, consulte Ajustar um modelo.
Antes de começar
Você precisa de:
Os trabalhos passam por
requested → allocating → provisioning → running → finalizing e, em seguida, chegam a um estado terminal:
- Uma carga de trabalho que sai com
0termina comosucceeded; uma falha em qualquer fase termina comofailed. - A terminação explícita, um limite vinculante ou um orçamento da organização esgotado move o trabalho por
terminatingatéterminated.
Etapa 1 - Escolha um acelerador
Liste o catálogo selecionado de aceleradores e escolha um pelo seuname estável.
Etapa 2 - Verifique preço e disponibilidade
Opcionalmente, solicite uma cotação antes de criar qualquer coisa. Uma cotação é uma observação ao vivo do mercado: ela retorna se a configuração está disponível no momento e a faixa de preço por hora, mas não reserva nada.200, com available: false e limites de preço nulos.
Etapa 3 - Crie o trabalho
Crie o trabalho com um cabeçalhoIdempotency-Key obrigatório.
Repetir a solicitação com a mesma chave e o mesmo corpo retorna o mesmo trabalho com 200, em vez de criar um duplicado; a mesma chave com um corpo diferente retorna 409 idempotency_conflict.
Este exemplo executa um pequeno ajuste fino LoRA de Qwen2.5-0.5B-Instruct e mescla o adaptador, correspondendo ao teste de fumaça da plataforma:
A resposta é
201 com o trabalho durável no estado requested:
state, reason, logs e eventos — nunca como um erro HTTP em uma criação que já retornou 201.
Etapa 4 - Consulte até terminar
0, o trabalho passa por finalizing até succeeded, exit_code é registrado, o recurso do provedor é desalocado automaticamente e o custo deixa de acumular.
Uma saída diferente de zero termina em failed com uma reason explicando o motivo.
Trabalhos terminais permanecem legíveis para auditoria e uso.
Etapa 5 - Leia logs e eventos
Os logs são duráveis e paginados por cursor, e distinguem a saída da sua carga de trabalho da saída do sistema.source=system para saída de alocação e bootstrap, e order=asc (o padrão) para paginar do mais antigo para o mais recente.
Transições de ciclo de vida, como provider_allocated, workload_started e workload_exited, também estão disponíveis como eventos estruturados:
Etapa 6 - Interrompa um trabalho antecipadamente
A terminação é explícita, idempotente e retorna o recurso atual.DELETE: o registro é mantido para auditoria, uso e reconciliação.
Um trabalho que atinge limits.max_runtime_hours, limits.max_cost_usd ou um orçamento da organização é terminado da mesma forma, sem período de tolerância e sem garantia de resultado parcial; portanto, publique artefatos de dentro da carga de trabalho antes que ela termine.
Use mka1-repos para conjuntos de dados e pesos
O Compute não armazena artefatos de carga de trabalho. O caminho recomendado é mka1-repos, o serviço de repositório compatível com Hugging Face da plataforma para modelos e conjuntos de dados: seu trabalho obtém o conjunto de dados dele e publica os pesos mesclados de volta nele, tudo de dentro da carga de trabalho. Este é o mesmo acesso ao Hugging Face que você usa da sua própria máquina — consulte Gerenciar repositórios. O ms-swift comUSE_HF=1 usa esse protocolo, portanto --model e --dataset aceitam referências <org>/<name> diretamente e não são necessárias alterações no código.
Três valores de ambiente fazem isso funcionar. O Compute os trata como variáveis de ambiente comuns — são as ferramentas do Hugging Face dentro do seu contêiner que os leem, por estes nomes exatos:
HF_ENDPOINTaponta para o endpoint de artefatos do seu cluster. Ferramentas compatíveis com Hugging Face —huggingface_hub, ms-swift comUSE_HF=1, vLLM — resolvem identificadores<org>/<name>em relação a ele, para que as cargas de trabalho alcancem mka1-repos sem nenhuma alteração de código. O console o preenche automaticamente quando você cria uma carga de trabalho; defina-o você mesmo ao chamar a API diretamente ou aponte-o para outro local para obter dados de outro hub.- mka1-repos autentica com sua chave de API MKA1.
Armazene a chave como um segredo do Compute e injete-a como
HF_TOKENpor meio desecret_env, para que ela nunca apareça embutida na especificação do trabalho. - Defina
HF_HUB_DISABLE_XET=1ao enviar pesos. Versões atuais dohuggingface_hubpodem selecionar automaticamente o caminho de transferência Xet, enquanto o mka1-repos oferece suporte ao caminho padrão de envio Hub/LFS. Desabilitar o Xet mantémHfApi.upload_folderehf uploadno caminho compatível.
meetkai/functionary e publica de volta nele, para que cada execução se baseie na anterior.
HF_ENDPOINT redireciona toda consulta ao Hugging Face na carga de trabalho, portanto identificadores do hub público deixam de ser resolvidos enquanto ele está definido.
Para fazer ajuste fino a partir de um modelo base público, primeiro espelhe-o em um repositório próprio ou deixe HF_ENDPOINT não definido e obtenha-o do hub público.train-and-publish.sh
base64 < train-and-publish.sh e faça referência ao segredo no corpo de criação:
meetkai/functionary por qualquer pessoa na sua organização, e um serviço Compute poderá servi-los diretamente — consulte Implantar um servidor de modelos.
Uma terminação no meio da execução destrói qualquer trabalho que ainda não tenha sido publicado.
Publicar de dentro da carga de trabalho, como acima, é o mecanismo de checkpoint compatível nesta versão.
Acompanhe os custos
Toda resposta de trabalho contémaccrued_usd, e o endpoint de uso agrega os custos entre recursos para uma janela de tempo:
Referência da API
Para os esquemas completos de solicitação e resposta, abra os grupos Compute na Referência da API.Veja também
- Implantar um servidor de modelos - sirva os pesos produzidos por este trabalho atrás de um endpoint autenticado.
- Gerenciar repositórios - crie e gerencie os repositórios dos quais este trabalho lê e nos quais publica.
- Gerenciar repositórios - crie um repositório e coloque conjuntos de dados e pesos nele inicialmente.
- Ajustar um modelo - a API gerenciada de ajuste fino para modelos da plataforma.