Este guia aluga GPUs e executa seu próprio contêiner de treinamento.
Para a API gerenciada de ajuste fino, que treina modelos da plataforma a partir de arquivos JSONL enviados, veja Ajuste fino de um modelo.
Antes de começar
Você precisa de:
Os jobs passam por
requested → allocating → provisioning → running → finalizing e então chegam a um estado terminal:
- Uma carga de trabalho que sai com
0termina comosucceeded; uma falha em qualquer fase termina comofailed. - Encerramento explícito, um limite atingido ou um orçamento da organização esgotado move o job por
terminatingatéterminated.
Passo 1 - Escolha um acelerador
Liste o catálogo curado de aceleradores e escolha um pelo seuname estável.
Passo 2 - Verifique preço e disponibilidade
Opcionalmente, solicite uma cotação antes de criar qualquer coisa. Uma cotação é uma observação do mercado em tempo real: ela retorna se a configuração pode ser obtida no momento e a faixa de preço por hora, e não reserva nada.200, com available: false e limites de preço nulos.
Passo 3 - Crie o job
Crie o job com um cabeçalhoIdempotency-Key obrigatório.
Repetir com a mesma chave e o mesmo corpo retorna o mesmo job com 200 em vez de criar uma duplicata; a mesma chave com um corpo diferente retorna 409 idempotency_conflict.
Este exemplo executa um pequeno ajuste fino LoRA do Qwen2.5-0.5B-Instruct e mescla o adapter, reproduzindo o smoke test da plataforma:
A resposta é
201 com o job persistido no estado requested:
state, reason, logs e eventos — nunca como um erro HTTP em uma criação que já retornou 201.
Passo 4 - Consulte até a conclusão
0, o job passa por finalizing até succeeded, o exit_code é registrado, o recurso do provedor é desalocado automaticamente e os gastos param de acumular.
Uma saída diferente de zero termina em failed com um reason explicando o motivo.
Jobs em estado terminal permanecem legíveis para auditoria e uso.
Passo 5 - Leia logs e eventos
Os logs são duráveis e paginados por cursor, e distinguem a saída da sua carga de trabalho da saída do sistema.source=system para a saída de alocação e bootstrap, e order=asc (o padrão) para paginar do mais antigo para o mais recente.
Transições de ciclo de vida como provider_allocated, workload_started e workload_exited também estão disponíveis como eventos estruturados:
Passo 6 - Interrompa um job antecipadamente
O encerramento é explícito, idempotente e retorna o recurso atual.DELETE: o registro é retido para auditoria, uso e reconciliação.
Um job que atinge limits.max_runtime_hours, limits.max_cost_usd ou um orçamento da organização é encerrado da mesma forma, sem período de carência e sem garantia de resultados parciais, então publique os artefatos de dentro da carga de trabalho antes que ela termine.
Use o mka1-repos para datasets e pesos
O Compute não armazena artefatos de carga de trabalho. O caminho recomendado é o mka1-repos, o serviço de repositórios da plataforma compatível com Hugging Face para modelos e datasets: seu job baixa o dataset dele e publica os pesos mesclados de volta nele, tudo de dentro da carga de trabalho. Duas convenções da plataforma fazem isso funcionar:- O Compute sempre injeta
HF_ENDPOINTem toda carga de trabalho, apontando para o endpoint de artefatos configurado para o seu cluster. Ferramentas compatíveis com Hugging Face —huggingface_hub, ms-swift comUSE_HF=1, vLLM — resolvem identificadores<org>/<name>contra ele, então as cargas de trabalho alcançam o mka1-repos sem nenhuma mudança de código. Você não pode sobrescreverHF_ENDPOINTpor conta própria. - O mka1-repos autentica com sua chave de API MKA1.
Armazene a chave como um segredo do Compute e injete-a como
HF_TOKENatravés desecret_env, para que ela nunca apareça inline na especificação do job.
train-and-publish.sh
base64 < train-and-publish.sh e referencie o segredo no corpo de criação:
acme/qwen2.5-0.5b-support por qualquer pessoa da sua organização, e um serviço do Compute pode servi-los diretamente — veja Implantar um servidor de modelos.
Um encerramento no meio da execução destrói qualquer trabalho ainda não publicado.
Publicar de dentro da carga de trabalho, como acima, é o mecanismo de checkpoint suportado nesta versão.
Acompanhe os gastos
Toda resposta de job carregaaccrued_usd, e o endpoint de uso agrega os gastos entre recursos para uma janela de tempo:
Referência da API
Para o esquema completo de requisição e resposta, abra os grupos do Compute na Referência de API.Veja também
- Implantar um servidor de modelos - sirva os pesos que este job produziu atrás de um endpoint autenticado.
- Gerenciar repositórios - crie e gerencie os repositórios que este job lê e nos quais publica.
- Usar repositórios com o Compute - envie datasets e pesos via git e conecte-os às cargas de trabalho.
- Ajuste fino de um modelo - a API gerenciada de ajuste fino para modelos da plataforma.