Importar una ejecución finalizada de un agente de codificación
Carga directamente un trabajo de harness completado — la ejecución y sus pruebas —, por lo que los resultados nunca hacen un ida y vuelta a través de almacenamiento externo, como hace el importador de Hugging Face. Cada task_id ya debe existir en el manifiesto de la versión del conjunto de destino; los ids desconocidos se rechazan en lugar de inventarse, porque de lo contrario un error tipográfico se importaría como una tarea que el conjunto no tiene y se leería como un modelo que nunca cubrió la versión. La ejecución se registra como completed y no se ejecuta: esto es una escritura, no una solicitud de ejecución, así que no se inicia ningún flujo de trabajo. Las pruebas que cubren todas las tareas de la versión reciben task_ids: null, que es lo que permite que la ejecución se clasifique como un barrido completo. Las trayectorias NO forman parte de este payload — una ejecución completa de 91 tareas midió 8.3 MB de ellas —, así que cárgalas cada una después contra PUT /evals/runs/{run_id}/samples/{sample_index}/trajectory. Pasa idempotency_key y una carga reintentada devolverá la primera ejecución en lugar de duplicar las pruebas detrás de una fila del tablero.
Autorizaciones
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Encabezados
Optional external end-user identifier forwarded by the API gateway.
Cuerpo
Suite existente para importar. Su manifiesto define el conjunto de tareas, así que cree primero la suite.
1El agente de arnés, p. ej. omp.
1 - 1281 - 255Por defecto, se usa la versión activa del conjunto.
1 <= x <= 214748364764Configuración del nivel de razonamiento, por ejemplo medium. Forma parte de la identidad de la fila de la tabla de clasificación, por lo que el mismo agente y modelo con dos niveles de esfuerzo siguen siendo dos filas.
32Gasto total del trabajo. Si se omite, recurre a la suma de los costes propios de las pruebas.
x >= 0Cuando se ejecutó el trabajo, en segundos Unix. Por defecto es ahora; configúrelo al hacer backfilling, ya que el tablero ordena por esto.
-9007199254740991 < x <= 9007199254740991Reutilizar una clave devuelve la ejecución creada la primera vez en lugar de importar una segunda copia. Sin una, una carga reintentada duplica silenciosamente los ensayos detrás de una fila del tablero.
1 - 255Puede estar vacío al abrir una ejecución para transmitir ensayos. Una importación única los envía todos aquí.
1000Cuántos intentos producirá el trabajo. Establece el total de la ejecución por adelantado para que la consola muestre el progreso real (12/89) mientras se transmite, en lugar de 12/12 que va aumentando.
0 <= x <= 1000False abre la ejecución in_progress para POST /evals/runs/{run_id}/trials para completar. Los marcadores solo cuentan las ejecuciones completadas, por lo que una ejecución en streaming permanece fuera de la tabla hasta que se finaliza.
Respuesta
Está bien
-9007199254740991 <= x <= 9007199254740991The org that owns this run.
The team that owns this run.
queued, in_progress, finalizing, completed, failed, cancelling, cancelled Coding-agent harness that produced this run (e.g. omp, claude-code). Null for every non-harness eval kind — a null here is not a missing value, it means the run is not an agent run.
Version of agent_name, as the harness reported it. Null when agent_name is.
Reasoning-effort setting the agent ran at (e.g. medium, xhigh). Part of the leaderboard's row identity: the same agent and model at two efforts are two rows, not one. Null when agent_name is.
Total spend for the run in USD. Null when the harness did not report cost.
-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991