Obtenha uma visão geral de uma execução de avaliação
Cabeçalho agregado para a visualização das tentativas de uma execução: contagem de tentativas, recompensa média, custo e a divisão de tokens de entrada/saída/cached. Sua própria rota em vez de campos no objeto de execução, porque ela varre as amostras da execução — incorporar isso em GET /evals/runs/{run_id} cobraria essa varredura em cada lista de execuções e na sondagem de status que roda durante toda a duração de um eval. trials.errored se sobrepõe a trials.failed em vez de particioná-lo: uma tentativa de agente de codificação pode registrar um timeout do agente em error e ainda assim ser concluída e pontuada. trials.retried conta as tentativas reexecutadas por meio de rerun-failed, lidas do snapshot anterior à nova execução, já que uma nova execução sobrescreve a amostra no lugar.
Autorizações
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Cabeçalhos
Optional external end-user identifier forwarded by the API gateway.
Parâmetros de caminho
Parâmetros de consulta
A chave avg_reward de scores faz a média. O padrão é reward, que é o que o harness registra para uma tarefa de aprovação/reprovação.
128^[\w.-]+$Resposta
OK
queued, in_progress, finalizing, completed, failed, cancelling, cancelled Média de metric entre as tentativas que o contêm numericamente. Nulo quando nenhuma o contém.
Somado ao longo das tentativas da execução. Cada campo é nulo quando nenhuma tentativa o informou.