Anexar execuções a uma execução aberta de agente de codificação
Adiciona trials concluídos a uma execução aberta com finalize: false, para que um job iniciado a partir de MKA1 possa ser acompanhado enquanto executa, em vez de aparecer completo do nada no final. Cada trial fixa seu próprio sample_index e faz upsert em (task, model, sample_index): um harness não consegue distinguir um timeout de uma resposta perdida, então reenviar um lote é seguro e substitui em vez de duplicar. O lote inteiro e o recálculo do agregado entram em uma única transação, serializada por execução. Contagens, métricas e custo são recalculados a partir das linhas armazenadas a cada chamada, nunca acumulados a partir da requisição, então um lote reenviado não pode dobrá-los. Envie finalize: true (normalmente com trials vazio) para encerrar a execução — até lá ela permanece in_progress e fora dos leaderboards, que contam apenas execuções concluídas. Acrescentar a uma execução já concluída ou cancelada é rejeitado: esse registro está finalizado, e reescrevê-lo moveria silenciosamente um número que alguém talvez já tenha lido.
Autorizações
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Cabeçalhos
Optional external end-user identifier forwarded by the API gateway.
Parâmetros de caminho
Corpo
Cada tentativa fixa seu próprio sample_index (único por tarefa e modelo): reenviar um lote substitui as mesmas linhas em vez de duplicá-las, então um lote reexecutado é seguro.
1000Marca a execução como concluída quando estes testes chegarem — a última chamada de um trabalho de streaming envia isso, geralmente com um trials vazio.
Resposta
OK
-9007199254740991 <= x <= 9007199254740991The org that owns this run.
The team that owns this run.
queued, in_progress, finalizing, completed, failed, cancelling, cancelled Coding-agent harness that produced this run (e.g. omp, claude-code). Null for every non-harness eval kind — a null here is not a missing value, it means the run is not an agent run.
Version of agent_name, as the harness reported it. Null when agent_name is.
Reasoning-effort setting the agent ran at (e.g. medium, xhigh). Part of the leaderboard's row identity: the same agent and model at two efforts are two rows, not one. Null when agent_name is.
Total spend for the run in USD. Null when the harness did not report cost.
-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991