Obtener una descripción general de una ejecución de evaluación
Encabezado agregado para la vista de pruebas de una ejecución: recuentos de pruebas, recompensa promedio, costo y la división de tokens de entrada/salida/caché. Su propia ruta en lugar de campos en el objeto de ejecución porque examina las muestras de la ejecución; integrarlo en GET /evals/runs/{run_id} cargaría ese análisis a cada lista de ejecuciones y al sondeo de estado que se ejecuta durante toda la duración de una evaluación. trials.errored se solapa con trials.failed en lugar de particionarlo: una prueba de un agente de codificación puede incluir un tiempo de espera del agente en error y aun así completarse y puntuarse. trials.retried cuenta las pruebas reejecutadas mediante rerun-failed, leídas desde la instantánea previa a la reejecución, ya que una reejecución sobrescribe la muestra en el lugar.
Autorizaciones
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Encabezados
Optional external end-user identifier forwarded by the API gateway.
Parámetros de ruta
Parámetros de consulta
La clave avg_reward de scores promedia. Por defecto usa reward, lo que el harness escribe para una tarea de aprobado/reprobado.
128^[\w.-]+$Respuesta
Está bien
queued, in_progress, finalizing, completed, failed, cancelling, cancelled Media de metric sobre los ensayos que lo contienen numéricamente. Nulo cuando ninguno lo contiene.
Sumado a lo largo de los ensayos de la ejecución. Cada campo es nulo cuando ningún ensayo lo informó.