> ## Documentation Index
> Fetch the complete documentation index at: https://docs.mka1.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Obtén la clasificación del agente de codificación para un conjunto de evaluación

> Clasifica las ejecuciones completadas del agente de codificación de la suite, una fila por cada (agente, modelo, esfuerzo). Solo participan las ejecuciones que registraron un `agent_name` — una ejecución de QA o de transcripción de la misma suite no tiene ningún agente al que atribuir una puntuación y no constituye una fila del tablero. `accuracy` es la media de `metric` (por defecto `reward`) sobre los ensayos puntuados de la fila, y `accuracy_ci` es el intervalo de Wald del 95% a su alrededor; ambos se derivan por solicitud en lugar de almacenarse, por lo que volver a ejecutar un ensayo fallido los desplaza en lugar de dejar una copia desactualizada. `agent_version` se informa, pero no forma parte de la identidad de la fila, así que una actualización del agente no divide una fila en dos. Las filas se ordenan por `accuracy` de forma descendente, con los nulos al final. Pasa `suite_version` cuando la suite tenga más de una; de lo contrario, el tablero mezcla conjuntos de tareas.



## OpenAPI

````yaml https://apigw.mka1.com/speakeasy.json?language=es get /api/v1/llm/evals/suites/{suite_id}/leaderboard
openapi: 3.1.1
info:
  title: MKA1 API
  version: 1.1.0
  description: >-
    La API MKA1 es una API RESTful que proporciona acceso a la plataforma MKA1.
    Aprende cómo comenzar con la API y el SDK de TypeScript
    [aquí](https://mka1.apidocumentation.com/guides/getting-started).
  license:
    name: Propietario
servers:
  - url: https://apigw.mka1.com
    description: MKA1 API Gateway
  - url: /
    description: Relative server URL (configurable via SDK constructor)
security: []
tags:
  - name: Resource Authorization
    description: >-
      Gestiona permisos para recursos LLM. Crea recursos, otorga/revoca permisos
      y elimina recursos. Solo los propietarios de recursos pueden otorgar,
      revocar o eliminar permisos.
    x-displayName: Autorización de Recursos
  - name: Embeddings
    description: >-
      Puntos finales de la API de incrustación de texto para generar
      representaciones vectoriales del texto. Crea incrustaciones semánticas
      para búsqueda, agrupamiento y coincidencia de similitudes utilizando
      varios modelos de incrustación.
    x-displayName: Incrustaciones
  - name: Feedback
    description: >-
      API de retroalimentación del usuario para calificar y comentar sobre las
      completaciones de chat. Recopila calificaciones de pulgares arriba/abajo y
      comentarios detallados para mejorar las respuestas del modelo y rastrear
      la satisfacción del usuario.
    x-displayName: Retroalimentación
  - name: Images
    description: >-
      Puntos finales de la API de generación de imágenes para crear imágenes a
      partir de descripciones de texto. Genera imágenes con control sobre el
      tamaño, la calidad y el estilo.
    x-displayName: Imágenes
  - name: MCP Vault
    description: >-
      API de bóveda MCP para almacenar configuraciones de servidor MCP propiedad
      del usuario y credenciales encriptadas. Los agentes hacen referencia a los
      ID de la bóveda para que los secretos se resuelvan solo en el momento de
      la ejecución de la herramienta.
    x-displayName: Bóveda MCP
  - name: Speech
    description: >-
      Puntos finales de la API de voz para el procesamiento de audio. Convierte
      texto en habla natural (TTS) o transcribe el habla a texto (STT) en
      diferentes idiomas.
    x-displayName: Discurso
  - name: Usage
    description: >-
      API de seguimiento de uso y análisis para monitorear el consumo de tokens,
      la cantidad de solicitudes y el análisis de costos. Visualiza estadísticas
      detalladas por usuario, modelo y período de tiempo.
    x-displayName: Uso
  - name: Extract
    description: >-
      API de extracción de datos estructurados para extraer información de
      archivos. Define esquemas JSON para extraer datos estructurados de
      imágenes, PDFs y documentos. Soporta plantillas de esquemas reutilizables.
    x-displayName: Extracción
  - name: Text Classification
    description: >-
      API de clasificación de texto para categorizar texto en etiquetas
      predefinidas. Utilice modelos de IA para clasificar el contenido del texto
      para análisis de sentimientos, categorización de temas y moderación de
      contenido.
    x-displayName: Clasificación de Texto
  - name: Responses
    description: >-
      API de respuestas impulsadas por agentes para crear agentes de IA con uso
      autónomo de herramientas. Crea asistentes conversacionales que pueden
      utilizar búsqueda en la web, operaciones con archivos, generación de
      imágenes, ejecución de código, simulación de uso de computadoras e
      integraciones de MCP. Soporta procesamiento en segundo plano, transmisión
      y seguimiento de estado en tiempo real.
    x-displayName: Respuestas
  - name: Files
    description: >-
      API de gestión de archivos para cargar, almacenar y gestionar archivos con
      expiración automática e integración con S3. Carga archivos que se pueden
      usar con Asistentes, Almacenes Vectoriales y otras funciones. Los archivos
      se almacenan en S3 con metadatos rastreados en PostgreSQL. Soporta la
      limpieza automática de archivos expirados.
    x-displayName: Archivos
  - name: Vector Stores
    description: >-
      API de almacenamiento de vectores para almacenar y buscar documentos
      utilizando incrustaciones. Crea almacenes de vectores, sube archivos con
      fragmentación automática y generación de incrustaciones, y realiza
      búsquedas semánticas. Los archivos se procesan de forma asincrónica
      utilizando flujos de trabajo de Temporal para durabilidad. Soporta
      limpieza automática de almacenes caducados y LanceDB para almacenamiento
      eficiente de vectores.
    x-displayName: Almacenes de Vectores
  - name: Conversations
    description: >-
      API de gestión de conversaciones para almacenar y recuperar el estado de
      la conversación a través de llamadas a la API de respuesta. Crea
      conversaciones, añade elementos (mensajes de usuario, mensajes del
      asistente, mensajes del sistema) y mantiene el historial de la
      conversación. Soporta seguimiento de metadatos y gestión del estado del
      diálogo en múltiples turnos.
    x-displayName: Conversaciones
  - name: Guardrails
    description: >-
      API de salvaguardias de seguridad de IA para configurar la moderación de
      contenido y las políticas de seguridad. Configura listas de palabras
      prohibidas, detección de inyección de mensajes y prevención de filtración
      de mensajes del sistema. Las salvaguardias se aplican a todas las
      solicitudes de una cuenta y se pueden probar antes del despliegue.
    x-displayName: Barandillas
  - name: Models
    description: >-
      API de listado de modelos para descubrir modelos disponibles. Devuelve IDs
      de modelos, propiedad y metadatos para todos los modelos registrados en la
      puerta de enlace.
    x-displayName: Modelos
  - name: Skills
    description: >-
      API de habilidades para gestionar paquetes de instrucciones y archivos
      versionados siguiendo el estándar de Habilidades del Agente. Crea,
      versiona y descarga paquetes de habilidades reutilizables que incluyen
      manifiestos SKILL.md para entornos de agentes.
    x-displayName: Habilidades
  - name: Chat Completions
    description: >-
      **Obsoleto: Usa la API de Respuestas (`/api/v1/llm/responses`) en su
      lugar.** Puntos finales de completación de chat con soporte para
      transmisión, llamadas a herramientas y múltiples proveedores.
    x-deprecated: true
    x-displayName: Completaciones de Chat
  - name: Batches
    x-displayName: Lotes
  - name: Evals
    x-displayName: Evaluaciones
  - name: Fine-Tuning
    x-displayName: Ajuste fino
  - name: Memory Stores
    x-displayName: Almacenes de memoria
  - name: Prompts
    x-displayName: Sugerencias
  - name: API Key
    x-displayName: Clave de API
  - name: Session
    x-displayName: Sesión
  - name: Organization
    x-displayName: Organización
  - name: Cluster Admin
    x-displayName: Administrador de clúster
  - name: Sessions
    description: Crear, inspeccionar, acceder y terminar sesiones de sandbox.
    x-displayName: Sesiones
  - name: Browser
    description: >-
      Conéctate a las sesiones del navegador a través del proxy del puerto de la
      puerta de enlace. Las sesiones del navegador exponen un punto final del
      Protocolo de DevTools de Chrome en el puerto 9222.
    x-displayName: Navegador
  - name: Execution
    description: >-
      Ejecutar comandos de shell y código dentro de una sesión de sandbox
      existente.
    x-displayName: Ejecución
  - name: Workspace
    description: >-
      Inspeccionar el manifiesto del espacio de trabajo, transferir archivos o
      archivos comprimidos, y descargar artefactos generados.
    x-displayName: Espacio de trabajo
  - name: Sandbox Usage
    description: >-
      Agrega estadísticas de uso de sandbox entre sesiones, ejecución y
      operaciones del espacio de trabajo.
    x-displayName: Uso de Sandbox
  - name: Sandbox Pricing
    description: >-
      Gestión de administrador de clúster de la tarjeta de tarifas de cómputo
      del entorno aislado utilizada para el gasto presupuestado.
    x-displayName: Precios de Sandbox
  - name: schema-3_other
    x-displayName: otro
  - name: Agents
    description: Crea y gestiona definiciones de agentes reutilizables.
    x-displayName: Agentes
  - name: Agent Versions
    description: >-
      Inspeccionar el historial de configuración de un agente y revertir a una
      versión anterior.
    x-displayName: Versiones de Agente
  - name: Agent Runs
    description: >-
      Ejecutar agentes guardados e inspeccionar los resultados de ejecución
      persistidos.
    x-displayName: Ejecuta Agentes
  - name: Agent Connectors
    description: >-
      Conecta agentes guardados a canales de mensajería externos como Telegram,
      incluyendo intercambio de texto, fotos y documentos compatibles.
    x-displayName: Conectores de agentes
  - name: Agent Schedules
    description: >-
      Crea y gestiona ejecuciones de agentes programadas o recurrentes
      guardadas.
    x-displayName: Horarios de Agentes
  - name: schema-4_other
    x-displayName: otro
  - name: Budgets
    x-displayName: Presupuestos
  - name: Settings
    x-displayName: Configuración
  - name: Compute Jobs
    x-displayName: Trabajos de computación
  - name: Compute Services
    x-displayName: Servicios de computación
  - name: Compute Catalog
    x-displayName: Catálogo de cómputo
  - name: Compute Volumes
    x-displayName: Calcular volúmenes
  - name: Compute Pricing
    x-displayName: Calcular precios
  - name: Compute Secrets
    x-displayName: Calcular secretos
  - name: Compute Usage
    x-displayName: Uso de cómputo
  - name: Compute Tenants
    x-displayName: Calcular inquilinos
  - description: Crear, listar, leer, actualizar y eliminar repositorios.
    name: Repositories
    x-displayName: Repositorios
paths:
  /api/v1/llm/evals/suites/{suite_id}/leaderboard:
    get:
      tags:
        - Evals
      summary: >-
        Obtén la clasificación del agente de codificación para un conjunto de
        evaluación
      description: >-
        Clasifica las ejecuciones completadas del agente de codificación de la
        suite, una fila por cada (agente, modelo, esfuerzo). Solo participan las
        ejecuciones que registraron un `agent_name` — una ejecución de QA o de
        transcripción de la misma suite no tiene ningún agente al que atribuir
        una puntuación y no constituye una fila del tablero. `accuracy` es la
        media de `metric` (por defecto `reward`) sobre los ensayos puntuados de
        la fila, y `accuracy_ci` es el intervalo de Wald del 95% a su alrededor;
        ambos se derivan por solicitud en lugar de almacenarse, por lo que
        volver a ejecutar un ensayo fallido los desplaza en lugar de dejar una
        copia desactualizada. `agent_version` se informa, pero no forma parte de
        la identidad de la fila, así que una actualización del agente no divide
        una fila en dos. Las filas se ordenan por `accuracy` de forma
        descendente, con los nulos al final. Pasa `suite_version` cuando la
        suite tenga más de una; de lo contrario, el tablero mezcla conjuntos de
        tareas.
      operationId: getEvalSuiteLeaderboard
      parameters:
        - name: suite_id
          in: path
          required: true
          schema:
            type: string
          example: eval_suite_aa87e2b1112a455b8deabed784372198
        - name: suite_version
          in: query
          schema:
            type: integer
            minimum: 1
            maximum: 2147483647
            description: >-
              Restringe el panel a una sola versión de la suite. Omítelo para
              agregar todas las versiones, lo que mezcla conjuntos de tareas; es
              preferible fijarlo cuando la suite tiene más de una.
          allowEmptyValue: true
          example: 1
        - name: metric
          in: query
          schema:
            type: string
            maxLength: 128
            pattern: ^[\w.-]+$
            default: reward
            description: >-
              La clave `scores` para promediar en `accuracy`. Por defecto es
              `reward`, lo que el harness escribe para una tarea de
              aprobar/fallar. Coincide como una sola clave de nivel superior,
              así que `reward.avg` busca la clave literal.
          allowEmptyValue: true
          example: reward
        - name: agent
          in: query
          schema:
            type: string
            maxLength: 128
            description: Restringir a un solo nombre de agente.
          allowEmptyValue: true
        - name: model
          in: query
          schema:
            type: string
            maxLength: 255
            description: Restringir a un solo modelo.
          allowEmptyValue: true
        - name: limit
          in: query
          schema:
            type: integer
            minimum: 1
            maximum: 200
            default: 100
            description: Máximo de filas devueltas.
          allowEmptyValue: true
          example: 100
        - name: X-On-Behalf-Of
          in: header
          required: false
          schema:
            type: string
          description: Optional external end-user identifier forwarded by the API gateway.
      responses:
        '200':
          description: Está bien
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/EvalSuiteLeaderboard'
              example:
                object: eval.leaderboard
                suite_id: eval_suite_aa87e2b1112a455b8deabed784372198
                suite_version: 1
                metric: reward
                data:
                  - agent_name: omp
                    agent_version: 17.3.8
                    agent_effort: medium
                    model: meetkai:functionary-urdu-mini-pak
                    accuracy: 0.539
                    accuracy_ci:
                      low: 0.435
                      high: 0.643
                      margin: 0.104
                    trials: 89
                    scored_trials: 89
                    failed_trials: 0
                    cost_usd: 3.77
                    run_count: 1
                    run_ids:
                      - eval_run_aa87e2b1112a455b8deabed784372198
                    last_run_at: 1704067200
      security:
        - bearerAuth: []
      x-codeSamples:
        - lang: python
          label: Python (SDK)
          source: |-
            from meetkai_mka1 import SDK


            with SDK(
                bearer_auth="<YOUR_BEARER_TOKEN_HERE>",
            ) as sdk:

                res = sdk.llm.evals.get_suite_leaderboard(suite_id="eval_suite_aa87e2b1112a455b8deabed784372198", suite_version=1, metric="reward", limit=100)

                # Handle response
                print(res)
        - lang: typescript
          label: Typescript (SDK)
          source: |-
            import { SDK } from "@meetkai/mka1";

            const sdk = new SDK({
              bearerAuth: "<YOUR_BEARER_TOKEN_HERE>",
            });

            async function run() {
              const result = await sdk.llm.evals.getSuiteLeaderboard({
                suiteId: "eval_suite_aa87e2b1112a455b8deabed784372198",
                suiteVersion: 1,
              });

              console.log(result);
            }

            run();
        - lang: csharp
          label: CSharp (SDK)
          source: >-
            using MeetKai.MKA1;

            using MeetKai.MKA1.Types.Components;

            using MeetKai.MKA1.Types.Requests;


            var sdk = new SDK(bearerAuth: "<YOUR_BEARER_TOKEN_HERE>");


            GetEvalSuiteLeaderboardRequest req = new
            GetEvalSuiteLeaderboardRequest() {
                SuiteId = "eval_suite_aa87e2b1112a455b8deabed784372198",
                SuiteVersion = 1,
            };


            var res = await sdk.Llm.Evals.GetSuiteLeaderboardAsync(req);


            // handle response
components:
  schemas:
    EvalSuiteLeaderboard:
      type: object
      properties:
        object:
          const: eval.leaderboard
        suite_id:
          type: string
        suite_version:
          anyOf:
            - type: integer
              minimum: -9007199254740991
              maximum: 9007199254740991
            - type: 'null'
          description: >-
            La versión a la que estaba restringida esta tabla, o null cuando
            abarca todas las versiones.
        metric:
          type: string
          description: >-
            La clave `scores` promedia `accuracy`. Se devuelve tal cual para que
            una tabla renderizada a partir de una métrica no predeterminada se
            describa por sí misma.
        data:
          type: array
          items:
            $ref: '#/components/schemas/EvalLeaderboardRow'
          description: >-
            Filas ordenadas por `accuracy` en orden descendente, con los nulos
            al final, y luego por agente, modelo y esfuerzo.
      required:
        - object
        - suite_id
        - suite_version
        - metric
        - data
    EvalLeaderboardRow:
      type: object
      properties:
        agent_name:
          type: string
        agent_version:
          anyOf:
            - type: string
            - type: 'null'
          description: >-
            Versión de la ejecución más reciente de la fila. No forma parte de
            la identidad de la fila, por lo que ejecuciones anteriores en esta
            fila pueden haber informado una diferente.
        agent_effort:
          anyOf:
            - type: string
            - type: 'null'
        model:
          type: string
        accuracy:
          anyOf:
            - type: number
            - type: 'null'
          description: >-
            Promedio de `metric` sobre los ensayos puntuados de la fila. Nulo
            cuando ningún ensayo tuvo un valor numérico para esa métrica,
            distinto de 0, que significa que todos los ensayos puntuaron cero.
        accuracy_ci:
          anyOf:
            - type: object
              properties:
                low:
                  type: number
                high:
                  type: number
                margin:
                  type: number
              required:
                - low
                - high
                - margin
            - type: 'null'
          description: >-
            Intervalo de Wald del 95 %, p ± 1.96·sqrt(p(1-p)/n), ajustado al
            rango [0, 1]. Derivado a petición en lugar de almacenado, por lo que
            no puede desviarse cuando se vuelve a ejecutar un intento fallido.
            Supone que `metric` es un resultado 0/1 (la `reward` del harness);
            en una métrica continua la media sigue siendo correcta, pero este
            intervalo no lo es, así que léelo solo para métricas de
            aprobado/reprobado. Nulo cuando `accuracy` lo es.
        trials:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
          description: Cada muestra en las ejecuciones de la fila, sea cual sea su estado.
        scored_trials:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
          description: >-
            Ensayos que llevan una `metric` numérica — el denominador detrás de
            `accuracy` y `accuracy_ci`.
        failed_trials:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
          description: >-
            Ensayos que terminaron con el estado `failed`, es decir, no
            produjeron ninguna puntuación en absoluto. Un tiempo de espera del
            agente NO es uno de estos: el entorno de ejecución todavía verifica
            y puntúa ese ensayo.
        cost_usd:
          anyOf:
            - type: number
            - type: 'null'
          description: >-
            Gasto total de prueba, recurriendo a los totales propios de las
            ejecuciones cuando las pruebas no tienen costo. Nulo cuando ninguno
            de los dos informó alguno.
        run_count:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
        run_ids:
          type: array
          items:
            type: string
          description: >-
            Las ejecuciones detrás de esta fila, primero la más grande (con más
            pruebas), en caso de empate primero la más reciente — el elemento 0
            es la ejecución que se abre cuando el lector profundiza en esta
            fila, así que un trabajo de benchmark completo tiene prioridad sobre
            una ejecución de humo más reciente de una sola tarea.
        last_run_at:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
          description: >-
            Tiempo de creación de la ejecución más reciente en la fila, en
            segundos Unix.
      required:
        - agent_name
        - agent_version
        - agent_effort
        - model
        - accuracy
        - accuracy_ci
        - trials
        - scored_trials
        - failed_trials
        - cost_usd
        - run_count
        - run_ids
        - last_run_at
  securitySchemes:
    bearerAuth:
      type: http
      scheme: bearer
      bearerFormat: API Key
      description: >-
        Gateway auth: send `Authorization: Bearer <mka1-api-key>`. For
        multi-user server-side integrations, you can also send `X-On-Behalf-Of:
        <external-user-id>`.

````