Lista las ejecuciones de la clasificación para un conjunto de evaluación
Devuelve en una sola solicitud las ejecuciones completadas más recientes de cada grupo de clasificación para una suite, con las asignaciones de grupo en groups. Un grupo es (model, tarea objetivo) para ejecuciones restringidas por task_ids y (model) para ejecuciones no restringidas (task_id null). Construye los tableros a partir de groups, no de run.models/run.task_ids: una ejecución devuelta puede nombrar modelos o tareas en cuyos grupos no quedó clasificada. truncated: true significa que un límite del servidor recortó el agregado; las ejecuciones completas se conservan en el orden (mejor rango, primer modelo, primera tarea, id), de modo que las ejecuciones más recientes de cada grupo sobreviven antes que los respaldos de cualquier grupo y no se descarta ningún grupo por ser antiguo. Reanuda un tablero truncado pasando next_cursor de vuelta como cursor y uniendo las respuestas. Consulta la documentación de evals para conocer la justificación del agrupamiento y las características de coste.
Autorizaciones
Gateway auth: send Authorization: Bearer <mka1-api-key>. For multi-user server-side integrations, you can also send X-On-Behalf-Of: <external-user-id>.
Encabezados
Optional external end-user identifier forwarded by the API gateway.
Parámetros de ruta
Parámetros de consulta
Limita la clasificación a ejecuciones registradas contra una versión de la suite. Las puntuaciones solo son comparables dentro de una versión, así que los consumidores de la tabla de clasificación deben pasar la versión que puntúan. Una versión que la suite no tiene devuelve una lista vacía, no un 404, así que se interpreta igual que una versión sin ejecuciones completadas todavía.
1 <= x <= 2147483647Cuántas ejecuciones completadas más recientes conservar por grupo de clasificación. Un grupo es (modelo, tarea objetivo) para ejecuciones restringidas por task_ids — las importaciones históricas registran una ejecución por modelo y tarea, por lo que sus tableros se ensamblan con per_group=1 — y (modelo) para ejecuciones no restringidas, que cubren todas las tareas de su versión. Más de 1 permite a un consumidor recurrir a una ejecución anterior para una tarea cuya ejecución más reciente carece de estadísticas utilizables.
1 <= x <= 20Limita el ranking a los grupos de un solo modelo. Útil cuando el consumidor ya conoce los ejes de su tablero; para descubrir y paginar más allá de una respuesta truncada, usa cursor/next_cursor. Un valor vacío se rechaza en lugar de tratarse como omitido.
1 - 255Cursor opaco para reanudar a partir del next_cursor de una respuesta truncada anterior. Continúa la clasificación exactamente donde se detuvo la página anterior — dentro de un modelo o de un nivel de ranking cuando el corte cayó allí. Devuélvelo tal cual; un valor malformado provoca un 400. Paginado con un conjunto de filtros fijo, como el cursor de la lista de ejecuciones.
1 - 2048Respuesta
Está bien
The deduplicated runs behind groups, newest first.
The server's group assignments — build boards from these, not from run.models/run.task_ids. Ordered by model, then task id with the covers-everything group first within each model, then rank; that ordering is contract.
True when a server ceiling trimmed the aggregate. Whole runs are kept in (rank, model, task) order — never dropped for being old; resume with cursor: next_cursor.
Set when truncated: pass as cursor on the next request and union the responses until truncated is false to assemble the complete aggregate. Null when this response is complete.