Obtener una trayectoria de muestra de evaluación
Devuelve la sesión de una prueba de agente de programación: los pasos que siguió el agente, literalmente en el formato de intercambio del harness (véase schema_version, por ejemplo, ATIF-v1.7). Deliberadamente no forma parte de la lista de muestras: una trayectoria promedia ~92 KB y esa lista pagina hasta 500 filas. Los índices de muestra son únicos por (tarea, modelo), no por ejecución, así que pasa task_id y/o model cuando la ejecución abarque más de uno; un índice que coincide con varias pruebas devuelve 400 en lugar de adivinar, y nunca recurre a la sesión de otra prueba. Devuelve 404 cuando la muestra no existe o no registró ninguna trayectoria.
Autorizaciones
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Encabezados
Optional external end-user identifier forwarded by the API gateway.
Parámetros de ruta
0 <= x <= 2147483647Parámetros de consulta
Desambigua el índice de muestra, que es único por (tarea, modelo) y no por ejecución. Requerido cuando el índice coincide con ensayos de más de una tarea.
Desambiguar el índice de muestra cuando la ejecución cubre más de un modelo.
Respuesta
Está bien
-9007199254740991 <= x <= 9007199254740991Interchange format of steps, e.g. ATIF-v1.7. Read it before assuming a step shape.
-9007199254740991 <= x <= 9007199254740991-9007199254740991 <= x <= 9007199254740991Steps exactly as the harness wrote them — reasoning_content, tool_calls[{ function_name, arguments }], observation.results[{ source_call_id, content }]. Passed through unvalidated so a harness upgrade does not need a gateway release.
Bounded tails of the trial's log files, keyed by their path in the trial dir (trial.log, verifier/test-stdout.txt, ...). Null for trials recorded before logs were captured.