Obtenha o ranking do agente de codificação para um conjunto de avaliação
Classifica as execuções concluídas do agente de codificação da suíte, uma linha por (agente, modelo, esforço). Apenas execuções que registraram um agent_name participam — uma execução de QA ou de transcrição da mesma suíte não tem um agente para atribuir uma pontuação e não é uma linha do board. accuracy é a média de metric (padrão reward) sobre os trials pontuados da linha, e accuracy_ci é o intervalo de Wald de 95% ao redor dela; ambos são derivados por solicitação em vez de armazenados, então reexecutar um trial com falha os move em vez de deixar uma cópia desatualizada para trás. agent_version é रिपोर्टado, mas não faz parte da identidade da linha, então uma atualização do agente não divide uma linha em duas. As linhas são ordenadas por accuracy em ordem decrescente, com nulos por último. Passe suite_version quando a suíte tiver mais de uma; caso contrário, o board mistura conjuntos de tarefas.
Autorizações
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Cabeçalhos
Optional external end-user identifier forwarded by the API gateway.
Parâmetros de caminho
Parâmetros de consulta
Restrinja o quadro a uma única versão da suíte. Omitir para agregar todas as versões, o que mistura conjuntos de tarefas — prefira fixá-la quando a suíte tiver mais de uma.
1 <= x <= 2147483647A chave scores a ser usada para calcular a média em accuracy. O padrão é reward, que é o que o harness grava para uma tarefa de aprovação/reprovação. Correspondência feita como uma única chave de nível superior, então reward.avg procura a chave literal.
128^[\w.-]+$Restrinja a um nome de agente.
128Restringir a um único modelo.
255Máximo de linhas retornadas.
1 <= x <= 200Resposta
OK
A versão à qual este quadro estava restrito, ou nula quando abrange todas as versões.
-9007199254740991 <= x <= 9007199254740991A chave scores faz a média de accuracy. Reproduzida de volta para que um painel renderizado a partir de uma métrica não padrão seja autoexplicativo.
Linhas ordenadas por accuracy em ordem decrescente, nulos por último, depois por agente, modelo e esforço.