Añadir pruebas a una ejecución abierta del agente de codificación
Añade ensayos finalizados a una ejecución abierta con finalize: false, de modo que un trabajo iniciado desde MKA1 pueda supervisarse mientras se ejecuta en lugar de aparecer completo de la nada al final. Cada ensayo fija su propio sample_index y hace upsert sobre (task, model, sample_index): un harness no puede distinguir un timeout de una respuesta perdida, así que reenviar un lote es seguro y reemplaza en lugar de duplicar. Todo el lote y su recálculo agregado se realizan en una sola transacción, serializada por ejecución. Los conteos, métricas y costes se recalculan a partir de las filas almacenadas en cada llamada, nunca se acumulan a partir de la solicitud, así que un lote reproducido no puede duplicarlos. Envía finalize: true (normalmente con un trials vacío) para cerrar la ejecución — hasta entonces permanece in_progress y fuera de las clasificaciones, que solo cuentan ejecuciones completadas. Se rechaza añadir elementos a una ejecución ya completada o cancelada: ese registro está terminado, y reescribirlo movería en silencio una cifra que alguien quizá ya haya leído.
Autorizaciones
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Encabezados
Optional external end-user identifier forwarded by the API gateway.
Parámetros de ruta
Cuerpo
Cada ensayo fija su propio sample_index (único por tarea y modelo): volver a enviar un lote reemplaza las mismas filas en lugar de duplicarlas, por lo que un lote reintentado es seguro.
1000Marca la ejecución como completada una vez que estas pruebas se ejecutan — la última llamada de un trabajo de streaming envía esto, normalmente con un trials vacío.
Respuesta
Está bien
-9007199254740991 <= x <= 9007199254740991The org that owns this run.
The team that owns this run.
queued, in_progress, finalizing, completed, failed, cancelling, cancelled Coding-agent harness that produced this run (e.g. omp, claude-code). Null for every non-harness eval kind — a null here is not a missing value, it means the run is not an agent run.
Version of agent_name, as the harness reported it. Null when agent_name is.
Reasoning-effort setting the agent ran at (e.g. medium, xhigh). Part of the leaderboard's row identity: the same agent and model at two efforts are two rows, not one. Null when agent_name is.
Total spend for the run in USD. Null when the harness did not report cost.
-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991