Importar uma execução concluída do agente de codificação
Envia diretamente um job de harness concluído — a execução e suas tentativas —, de modo que os resultados nunca fazem round-trip pelo armazenamento externo, como acontece com o importador do Hugging Face. Todo task_id já deve existir no manifesto da versão do conjunto de destino; IDs desconhecidos são rejeitados em vez de inventados, porque um erro de digitação, de outra forma, seria importado como uma tarefa que o conjunto não possui e interpretado como um modelo que nunca cobriu a versão. A execução é registrada como completed e não é executada: isto é uma gravação, não uma solicitação de execução, então nenhum workflow é iniciado. As tentativas que cobrem todas as tarefas da versão recebem task_ids: null, que é o que permite que a execução seja classificada como uma varredura completa. As trajetórias NÃO fazem parte deste payload — uma execução completa de 91 tarefas gerou 8,3 MB delas — então faça upload de cada uma depois em PUT /evals/runs/{run_id}/samples/{sample_index}/trajectory. Passe idempotency_key e um upload reenviado retornará a primeira execução em vez de duplicar as tentativas por trás de uma linha do board.
Autorizações
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Cabeçalhos
Optional external end-user identifier forwarded by the API gateway.
Corpo
Suíte existente para importar. Seu manifesto define o conjunto de tarefas, então crie a suíte primeiro.
1O agente da plataforma de testes, por exemplo, omp.
1 - 1281 - 255Padrão para a versão ativa da suíte.
1 <= x <= 214748364764Configuração de esforço de raciocínio, por exemplo medium. Faz parte da identidade da linha no leaderboard, então o mesmo agente e modelo em dois níveis de esforço permanecem em duas linhas.
32Gasto total para o trabalho. Na ausência disso, usa a soma dos custos próprios das execuções de teste.
x >= 0Quando o trabalho foi executado, em segundos Unix. O padrão é agora — defina isso ao fazer backfill, já que o quadro ordena por isso.
-9007199254740991 < x <= 9007199254740991Reutilizar uma chave retorna a execução criada na primeira vez, em vez de importar uma segunda cópia. Sem uma, um envio repetido silenciosamente duplica os testes por trás de uma linha do quadro.
1 - 255Pode estar vazio ao abrir uma execução para transmitir tentativas para ela. Uma importação única envia todas elas para cá.
1000Quantas execuções o trabalho produzirá. Define o total da execução antecipadamente para que o console mostre o progresso real (12/89) enquanto os dados são transmitidos, em vez de 12/12 que vai aumentando.
0 <= x <= 1000False abre a execução in_progress para POST /evals/runs/{run_id}/trials ser preenchida. Os placares contam apenas execuções concluídas, então uma execução em streaming permanece fora do placar até ser finalizada.
Resposta
OK
-9007199254740991 <= x <= 9007199254740991The org that owns this run.
The team that owns this run.
queued, in_progress, finalizing, completed, failed, cancelling, cancelled Coding-agent harness that produced this run (e.g. omp, claude-code). Null for every non-harness eval kind — a null here is not a missing value, it means the run is not an agent run.
Version of agent_name, as the harness reported it. Null when agent_name is.
Reasoning-effort setting the agent ran at (e.g. medium, xhigh). Part of the leaderboard's row identity: the same agent and model at two efforts are two rows, not one. Null when agent_name is.
Total spend for the run in USD. Null when the harness did not report cost.
-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991