> ## Documentation Index
> Fetch the complete documentation index at: https://docs.mka1.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Obtenha o ranking do agente de codificação para um conjunto de avaliação

> Classifica as execuções concluídas do agente de codificação da suíte, uma linha por (agente, modelo, esforço). Apenas execuções que registraram um `agent_name` participam — uma execução de QA ou de transcrição da mesma suíte não tem um agente para atribuir uma pontuação e não é uma linha do board. `accuracy` é a média de `metric` (padrão `reward`) sobre os trials pontuados da linha, e `accuracy_ci` é o intervalo de Wald de 95% ao redor dela; ambos são derivados por solicitação em vez de armazenados, então reexecutar um trial com falha os move em vez de deixar uma cópia desatualizada para trás. `agent_version` é रिपोर्टado, mas não faz parte da identidade da linha, então uma atualização do agente não divide uma linha em duas. As linhas são ordenadas por `accuracy` em ordem decrescente, com nulos por último. Passe `suite_version` quando a suíte tiver mais de uma; caso contrário, o board mistura conjuntos de tarefas.



## OpenAPI

````yaml https://apigw.mka1.com/speakeasy.json?language=pt-BR get /api/v1/llm/evals/suites/{suite_id}/leaderboard
openapi: 3.1.1
info:
  title: MKA1 API
  version: 1.1.0
  description: >-
    A API MKA1 é uma API RESTful que fornece acesso à plataforma MKA1. Aprenda
    como começar a usar a API e o SDK TypeScript
    [aqui](https://mka1.apidocumentation.com/guides/getting-started).
  license:
    name: Proprietário
servers:
  - url: https://apigw.mka1.com
    description: MKA1 API Gateway
  - url: /
    description: Relative server URL (configurable via SDK constructor)
security: []
tags:
  - name: Resource Authorization
    description: >-
      Gerencie permissões para recursos LLM. Crie recursos, conceda/revoque
      permissões e exclua recursos. Apenas os proprietários dos recursos podem
      conceder, revogar ou excluir permissões.
    x-displayName: Autorização de Recurso
  - name: Embeddings
    description: >-
      Endpoints da API de incorporação de texto para gerar representações
      vetoriais de texto. Crie incorporações semânticas para busca, clustering e
      correspondência de similaridade usando vários modelos de incorporação.
    x-displayName: Incorporações
  - name: Feedback
    description: >-
      API de feedback do usuário para avaliar e comentar sobre as conclusões de
      chat. Coleta de classificações de positivo/negativo e feedback detalhado
      para melhorar as respostas do modelo e acompanhar a satisfação do usuário.
    x-displayName: Feedback
  - name: Images
    description: >-
      Pontos de extremidade da API de geração de imagens para criar imagens a
      partir de descrições de texto. Gere imagens com controle sobre tamanho,
      qualidade e estilo.
    x-displayName: Imagens
  - name: MCP Vault
    description: >-
      API do cofre MCP para armazenar configurações de servidor MCP de
      propriedade do usuário e credenciais criptografadas. Os agentes
      referenciam IDs de cofre para que os segredos sejam resolvidos apenas no
      momento da execução da ferramenta.
    x-displayName: Cofre MCP
  - name: Speech
    description: >-
      Pontos de extremidade da API de fala para processamento de áudio. Converta
      texto em fala com som natural (TTS) ou transcreva fala em texto (STT) em
      diferentes idiomas.
    x-displayName: Discurso
  - name: Usage
    description: >-
      API de rastreamento de uso e análise para monitoramento do consumo de
      tokens, contagem de solicitações e análise de custos. Veja estatísticas
      detalhadas por usuário, modelo e período de tempo.
    x-displayName: Uso
  - name: Extract
    description: >-
      API de extração de dados estruturados para extrair informações de
      arquivos. Defina esquemas JSON para extrair dados estruturados de imagens,
      PDFs e documentos. Suporta modelos de esquema reutilizáveis.
    x-displayName: Extração
  - name: Text Classification
    description: >-
      API de classificação de texto para categorizar textos em rótulos
      predefinidos. Use modelos de IA para classificar o conteúdo textual para
      análise de sentimento, categorização de tópicos e moderação de conteúdo.
    x-displayName: Classificação de Texto
  - name: Responses
    description: >-
      API de respostas com agentes para criar agentes de IA com uso autônomo de
      ferramentas. Crie assistentes conversacionais que podem usar pesquisa na
      web, operações de arquivos, geração de imagens, execução de código,
      simulação de uso de computador e integrações MCP. Suporta processamento em
      segundo plano, streaming e monitoramento de status em tempo real.
    x-displayName: Respostas
  - name: Files
    description: >-
      API de gerenciamento de arquivos para upload, armazenamento e
      gerenciamento de arquivos com expiração automática e integração com S3.
      Faça upload de arquivos que podem ser usados com Assistentes,
      Armazenamentos Vetoriais e outras funcionalidades. Os arquivos são
      armazenados no S3 com metadados rastreados no PostgreSQL. Suporta limpeza
      automática de arquivos expirados.
    x-displayName: Arquivos
  - name: Vector Stores
    description: >-
      API de armazenamento de vetores para armazenar e pesquisar documentos
      usando embeddings. Crie armazenamentos de vetores, faça upload de arquivos
      com divisão automática e geração de embeddings, e realize pesquisas
      semânticas. Os arquivos são processados de forma assíncrona usando fluxos
      de trabalho Temporais para durabilidade. Suporta limpeza automática de
      armazenamentos expirados e LanceDB para armazenamento eficiente de
      vetores.
    x-displayName: Armazenamentos de Vetores
  - name: Conversations
    description: >-
      API de gerenciamento de conversas para armazenar e recuperar o estado da
      conversa durante chamadas à API de Resposta. Crie conversas, adicione
      itens (mensagens do usuário, mensagens do assistente, mensagens do
      sistema) e mantenha o histórico da conversa. Suporta rastreamento de
      metadados e gerenciamento de estado de diálogo em múltiplas interações.
    x-displayName: Conversa
  - name: Guardrails
    description: >-
      API de diretrizes de segurança de IA para configurar moderação de conteúdo
      e políticas de segurança. Configure listas de palavras proibidas, detecção
      de injeção de prompts e prevenção de vazamento de prompts do sistema. As
      diretrizes aplicam-se a todas as solicitações de uma conta e podem ser
      testadas antes da implementação.
    x-displayName: Guarda-corpos
  - name: Models
    description: >-
      API de listagem de modelos para descobrir modelos disponíveis. Retorna IDs
      de modelos, propriedade e metadados de todos os modelos registrados no
      gateway.
    x-displayName: Modelos
  - name: Skills
    description: >-
      API de habilidades para gerenciar pacotes versionados de instruções e
      arquivos seguindo o padrão de Habilidades do Agente. Crie, versionar e
      baixe pacotes de habilidades reutilizáveis que incluam manifestos SKILL.md
      para ambientes de agentes.
    x-displayName: Habilidades
  - name: Chat Completions
    description: >-
      **Obsoleto: Use a API de Respostas (`/api/v1/llm/responses`) em vez
      disso.** Endpoints de conclusão de chat com suporte para streaming,
      chamadas de ferramentas e múltiplos provedores.
    x-deprecated: true
    x-displayName: Conclusões de Bate-Papo
  - name: Batches
    x-displayName: Lotes
  - name: Evals
    x-displayName: Avaliações
  - name: Fine-Tuning
    x-displayName: Ajuste Fino
  - name: Memory Stores
    x-displayName: Armazenamentos de Memória
  - name: Prompts
    x-displayName: Sugestões
  - name: API Key
    x-displayName: Chave da API
  - name: Session
    x-displayName: Sessão
  - name: Organization
    x-displayName: Organização
  - name: Cluster Admin
    x-displayName: Administrador do cluster
  - name: Sessions
    description: Crie, inspecione, acesse e encerre sessões de sandbox.
    x-displayName: Sessões
  - name: Browser
    description: >-
      Conecte-se às sessões do navegador através do proxy da porta do gateway.
      As sessões do navegador expõem um endpoint do Chrome DevTools Protocol na
      porta 9222.
    x-displayName: Navegador
  - name: Execution
    description: >-
      Executar comandos shell e código dentro de uma sessão de sandbox
      existente.
    x-displayName: Execução
  - name: Workspace
    description: >-
      Inspecione o manifesto do espaço de trabalho, transfira arquivos ou
      arquivos compactados e baixe artefatos gerados.
    x-displayName: Espaço de trabalho
  - name: Sandbox Usage
    description: >-
      Agregue estatísticas de uso da sandbox entre sessões, execução e operações
      do espaço de trabalho.
    x-displayName: Uso do Sandbox
  - name: Sandbox Pricing
    description: >-
      Gerenciamento de cluster-admin da tabela de preços de computação da
      sandbox usada para gastos orçados.
    x-displayName: Preço da Sandbox
  - name: schema-3_other
    x-displayName: outro
  - name: Agents
    description: Crie e gerencie definições de agentes reutilizáveis.
    x-displayName: Agentes
  - name: Agent Versions
    description: >-
      Inspecione o histórico de configuração de um agente e reverta para uma
      versão anterior.
    x-displayName: Versões do Agente
  - name: Agent Runs
    description: Execute agentes salvos e inspecione os resultados da execução persistidos.
    x-displayName: Executa Agente
  - name: Agent Connectors
    description: >-
      Conecte agentes salvos a canais de mensagens externos, como o Telegram,
      incluindo troca de texto, foto e documentos compatíveis.
    x-displayName: Conectores de Agente
  - name: Agent Schedules
    description: Crie e gerencie execuções de agentes salvos agendadas ou recorrentes.
    x-displayName: Agendas de Agentes
  - name: schema-4_other
    x-displayName: outro
  - name: Budgets
    x-displayName: Orçamentos
  - name: Settings
    x-displayName: Configurações
  - name: Compute Jobs
    x-displayName: Jobs de Computação
  - name: Compute Services
    x-displayName: Serviços de Computação
  - name: Compute Catalog
    x-displayName: Catálogo de Computação
  - name: Compute Volumes
    x-displayName: Calcular volumes
  - name: Compute Pricing
    x-displayName: Calcular Preços
  - name: Compute Secrets
    x-displayName: Calcular Segredos
  - name: Compute Usage
    x-displayName: Uso de Computação
  - name: Compute Tenants
    x-displayName: Calcular Inquilinos
  - description: Criar, listar, ler, atualizar e excluir repositórios.
    name: Repositories
    x-displayName: Repositórios
paths:
  /api/v1/llm/evals/suites/{suite_id}/leaderboard:
    get:
      tags:
        - Evals
      summary: Obtenha o ranking do agente de codificação para um conjunto de avaliação
      description: >-
        Classifica as execuções concluídas do agente de codificação da suíte,
        uma linha por (agente, modelo, esforço). Apenas execuções que
        registraram um `agent_name` participam — uma execução de QA ou de
        transcrição da mesma suíte não tem um agente para atribuir uma pontuação
        e não é uma linha do board. `accuracy` é a média de `metric` (padrão
        `reward`) sobre os trials pontuados da linha, e `accuracy_ci` é o
        intervalo de Wald de 95% ao redor dela; ambos são derivados por
        solicitação em vez de armazenados, então reexecutar um trial com falha
        os move em vez de deixar uma cópia desatualizada para trás.
        `agent_version` é रिपोर्टado, mas não faz parte da identidade da linha,
        então uma atualização do agente não divide uma linha em duas. As linhas
        são ordenadas por `accuracy` em ordem decrescente, com nulos por último.
        Passe `suite_version` quando a suíte tiver mais de uma; caso contrário,
        o board mistura conjuntos de tarefas.
      operationId: getEvalSuiteLeaderboard
      parameters:
        - name: suite_id
          in: path
          required: true
          schema:
            type: string
          example: eval_suite_aa87e2b1112a455b8deabed784372198
        - name: suite_version
          in: query
          schema:
            type: integer
            minimum: 1
            maximum: 2147483647
            description: >-
              Restrinja o quadro a uma única versão da suíte. Omitir para
              agregar todas as versões, o que mistura conjuntos de tarefas —
              prefira fixá-la quando a suíte tiver mais de uma.
          allowEmptyValue: true
          example: 1
        - name: metric
          in: query
          schema:
            type: string
            maxLength: 128
            pattern: ^[\w.-]+$
            default: reward
            description: >-
              A chave `scores` a ser usada para calcular a média em `accuracy`.
              O padrão é `reward`, que é o que o harness grava para uma tarefa
              de aprovação/reprovação. Correspondência feita como uma única
              chave de nível superior, então `reward.avg` procura a chave
              literal.
          allowEmptyValue: true
          example: reward
        - name: agent
          in: query
          schema:
            type: string
            maxLength: 128
            description: Restrinja a um nome de agente.
          allowEmptyValue: true
        - name: model
          in: query
          schema:
            type: string
            maxLength: 255
            description: Restringir a um único modelo.
          allowEmptyValue: true
        - name: limit
          in: query
          schema:
            type: integer
            minimum: 1
            maximum: 200
            default: 100
            description: Máximo de linhas retornadas.
          allowEmptyValue: true
          example: 100
        - name: X-On-Behalf-Of
          in: header
          required: false
          schema:
            type: string
          description: Optional external end-user identifier forwarded by the API gateway.
      responses:
        '200':
          description: OK
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/EvalSuiteLeaderboard'
              example:
                object: eval.leaderboard
                suite_id: eval_suite_aa87e2b1112a455b8deabed784372198
                suite_version: 1
                metric: reward
                data:
                  - agent_name: omp
                    agent_version: 17.3.8
                    agent_effort: medium
                    model: meetkai:functionary-urdu-mini-pak
                    accuracy: 0.539
                    accuracy_ci:
                      low: 0.435
                      high: 0.643
                      margin: 0.104
                    trials: 89
                    scored_trials: 89
                    failed_trials: 0
                    cost_usd: 3.77
                    run_count: 1
                    run_ids:
                      - eval_run_aa87e2b1112a455b8deabed784372198
                    last_run_at: 1704067200
      security:
        - bearerAuth: []
      x-codeSamples:
        - lang: python
          label: Python (SDK)
          source: |-
            from meetkai_mka1 import SDK


            with SDK(
                bearer_auth="<YOUR_BEARER_TOKEN_HERE>",
            ) as sdk:

                res = sdk.llm.evals.get_suite_leaderboard(suite_id="eval_suite_aa87e2b1112a455b8deabed784372198", suite_version=1, metric="reward", limit=100)

                # Handle response
                print(res)
        - lang: typescript
          label: Typescript (SDK)
          source: |-
            import { SDK } from "@meetkai/mka1";

            const sdk = new SDK({
              bearerAuth: "<YOUR_BEARER_TOKEN_HERE>",
            });

            async function run() {
              const result = await sdk.llm.evals.getSuiteLeaderboard({
                suiteId: "eval_suite_aa87e2b1112a455b8deabed784372198",
                suiteVersion: 1,
              });

              console.log(result);
            }

            run();
        - lang: csharp
          label: CSharp (SDK)
          source: >-
            using MeetKai.MKA1;

            using MeetKai.MKA1.Types.Components;

            using MeetKai.MKA1.Types.Requests;


            var sdk = new SDK(bearerAuth: "<YOUR_BEARER_TOKEN_HERE>");


            GetEvalSuiteLeaderboardRequest req = new
            GetEvalSuiteLeaderboardRequest() {
                SuiteId = "eval_suite_aa87e2b1112a455b8deabed784372198",
                SuiteVersion = 1,
            };


            var res = await sdk.Llm.Evals.GetSuiteLeaderboardAsync(req);


            // handle response
components:
  schemas:
    EvalSuiteLeaderboard:
      type: object
      properties:
        object:
          const: eval.leaderboard
        suite_id:
          type: string
        suite_version:
          anyOf:
            - type: integer
              minimum: -9007199254740991
              maximum: 9007199254740991
            - type: 'null'
          description: >-
            A versão à qual este quadro estava restrito, ou nula quando abrange
            todas as versões.
        metric:
          type: string
          description: >-
            A chave `scores` faz a média de `accuracy`. Reproduzida de volta
            para que um painel renderizado a partir de uma métrica não padrão
            seja autoexplicativo.
        data:
          type: array
          items:
            $ref: '#/components/schemas/EvalLeaderboardRow'
          description: >-
            Linhas ordenadas por `accuracy` em ordem decrescente, nulos por
            último, depois por agente, modelo e esforço.
      required:
        - object
        - suite_id
        - suite_version
        - metric
        - data
    EvalLeaderboardRow:
      type: object
      properties:
        agent_name:
          type: string
        agent_version:
          anyOf:
            - type: string
            - type: 'null'
          description: >-
            Versão da execução mais recente da linha. Não faz parte da
            identidade da linha, então execuções anteriores nesta linha podem
            ter informado uma diferente.
        agent_effort:
          anyOf:
            - type: string
            - type: 'null'
        model:
          type: string
        accuracy:
          anyOf:
            - type: number
            - type: 'null'
          description: >-
            Média de `metric` sobre os ensaios avaliados da linha. Nulo quando
            nenhum ensaio tinha um valor numérico para essa métrica — distinto
            de 0, que significa que todos os ensaios pontuaram zero.
        accuracy_ci:
          anyOf:
            - type: object
              properties:
                low:
                  type: number
                high:
                  type: number
                margin:
                  type: number
              required:
                - low
                - high
                - margin
            - type: 'null'
          description: >-
            Intervalo de Wald de 95%, p ± 1,96·sqrt(p(1-p)/n), limitado a [0,
            1]. Derivado sob demanda em vez de armazenado, então não pode
            divergir quando uma tentativa com falha é reexecutada. Ele assume
            que `metric` é um resultado 0/1 (o `reward` do harness); em uma
            métrica contínua a média continua correta, mas esse intervalo não,
            então leia-o apenas para métricas de aprovação/reprovação. Nulo
            quando `accuracy` é.
        trials:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
          description: Cada amostra nos runs da linha, independentemente do seu status.
        scored_trials:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
          description: >-
            Ensaios que carregam uma `metric` numérica — o denominador por trás
            de `accuracy` e `accuracy_ci`.
        failed_trials:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
          description: >-
            Tentativas que terminaram com o status `failed`, ou seja, não
            produziram nenhuma pontuação. Um timeout do agente NÃO é um desses
            casos: o harness ainda verifica e pontua essa tentativa.
        cost_usd:
          anyOf:
            - type: number
            - type: 'null'
          description: >-
            Soma do gasto das execuções de teste, recorrendo aos totais próprios
            das execuções quando os testes não têm custo. Nulo quando nenhum dos
            dois reportou algum.
        run_count:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
        run_ids:
          type: array
          items:
            type: string
          description: >-
            As execuções por trás desta linha, da maior (mais testes) para a
            menor, empatadas primeiro pela mais recente — o elemento 0 é a
            execução a ser aberta quando o leitor se aprofunda nesta linha,
            então um trabalho completo de benchmark tem precedência sobre um
            smoke run mais novo de uma única tarefa.
        last_run_at:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
          description: >-
            Tempo de criação da execução mais recente na linha, em segundos
            Unix.
      required:
        - agent_name
        - agent_version
        - agent_effort
        - model
        - accuracy
        - accuracy_ci
        - trials
        - scored_trials
        - failed_trials
        - cost_usd
        - run_count
        - run_ids
        - last_run_at
  securitySchemes:
    bearerAuth:
      type: http
      scheme: bearer
      bearerFormat: API Key
      description: >-
        Gateway auth: send `Authorization: Bearer <mka1-api-key>`. For
        multi-user server-side integrations, you can also send `X-On-Behalf-Of:
        <external-user-id>`.

````