> ## Documentation Index
> Fetch the complete documentation index at: https://docs.mka1.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Importar uma execução concluída do agente de codificação

> Envia diretamente um job de harness concluído — a execução e suas tentativas —, de modo que os resultados nunca fazem round-trip pelo armazenamento externo, como acontece com o importador do Hugging Face. Todo `task_id` já deve existir no manifesto da versão do conjunto de destino; IDs desconhecidos são rejeitados em vez de inventados, porque um erro de digitação, de outra forma, seria importado como uma tarefa que o conjunto não possui e interpretado como um modelo que nunca cobriu a versão. A execução é registrada como `completed` e não é executada: isto é uma gravação, não uma solicitação de execução, então nenhum workflow é iniciado. As tentativas que cobrem todas as tarefas da versão recebem `task_ids: null`, que é o que permite que a execução seja classificada como uma varredura completa. As trajetórias NÃO fazem parte deste payload — uma execução completa de 91 tarefas gerou 8,3 MB delas — então faça upload de cada uma depois em `PUT /evals/runs/{run_id}/samples/{sample_index}/trajectory`. Passe `idempotency_key` e um upload reenviado retornará a primeira execução em vez de duplicar as tentativas por trás de uma linha do board.



## OpenAPI

````yaml https://apigw.mka1.com/speakeasy.json?language=pt-BR post /api/v1/llm/evals/imports/agent-run
openapi: 3.1.1
info:
  title: MKA1 API
  version: 1.1.0
  description: >-
    A API MKA1 é uma API RESTful que fornece acesso à plataforma MKA1. Aprenda
    como começar a usar a API e o SDK TypeScript
    [aqui](https://mka1.apidocumentation.com/guides/getting-started).
  license:
    name: Proprietário
servers:
  - url: https://apigw.mka1.com
    description: MKA1 API Gateway
  - url: /
    description: Relative server URL (configurable via SDK constructor)
security: []
tags:
  - name: Resource Authorization
    description: >-
      Gerencie permissões para recursos LLM. Crie recursos, conceda/revoque
      permissões e exclua recursos. Apenas os proprietários dos recursos podem
      conceder, revogar ou excluir permissões.
    x-displayName: Autorização de Recurso
  - name: Embeddings
    description: >-
      Endpoints da API de incorporação de texto para gerar representações
      vetoriais de texto. Crie incorporações semânticas para busca, clustering e
      correspondência de similaridade usando vários modelos de incorporação.
    x-displayName: Incorporações
  - name: Feedback
    description: >-
      API de feedback do usuário para avaliar e comentar sobre as conclusões de
      chat. Coleta de classificações de positivo/negativo e feedback detalhado
      para melhorar as respostas do modelo e acompanhar a satisfação do usuário.
    x-displayName: Feedback
  - name: Images
    description: >-
      Pontos de extremidade da API de geração de imagens para criar imagens a
      partir de descrições de texto. Gere imagens com controle sobre tamanho,
      qualidade e estilo.
    x-displayName: Imagens
  - name: MCP Vault
    description: >-
      API do cofre MCP para armazenar configurações de servidor MCP de
      propriedade do usuário e credenciais criptografadas. Os agentes
      referenciam IDs de cofre para que os segredos sejam resolvidos apenas no
      momento da execução da ferramenta.
    x-displayName: Cofre MCP
  - name: Speech
    description: >-
      Pontos de extremidade da API de fala para processamento de áudio. Converta
      texto em fala com som natural (TTS) ou transcreva fala em texto (STT) em
      diferentes idiomas.
    x-displayName: Discurso
  - name: Usage
    description: >-
      API de rastreamento de uso e análise para monitoramento do consumo de
      tokens, contagem de solicitações e análise de custos. Veja estatísticas
      detalhadas por usuário, modelo e período de tempo.
    x-displayName: Uso
  - name: Extract
    description: >-
      API de extração de dados estruturados para extrair informações de
      arquivos. Defina esquemas JSON para extrair dados estruturados de imagens,
      PDFs e documentos. Suporta modelos de esquema reutilizáveis.
    x-displayName: Extração
  - name: Text Classification
    description: >-
      API de classificação de texto para categorizar textos em rótulos
      predefinidos. Use modelos de IA para classificar o conteúdo textual para
      análise de sentimento, categorização de tópicos e moderação de conteúdo.
    x-displayName: Classificação de Texto
  - name: Responses
    description: >-
      API de respostas com agentes para criar agentes de IA com uso autônomo de
      ferramentas. Crie assistentes conversacionais que podem usar pesquisa na
      web, operações de arquivos, geração de imagens, execução de código,
      simulação de uso de computador e integrações MCP. Suporta processamento em
      segundo plano, streaming e monitoramento de status em tempo real.
    x-displayName: Respostas
  - name: Files
    description: >-
      API de gerenciamento de arquivos para upload, armazenamento e
      gerenciamento de arquivos com expiração automática e integração com S3.
      Faça upload de arquivos que podem ser usados com Assistentes,
      Armazenamentos Vetoriais e outras funcionalidades. Os arquivos são
      armazenados no S3 com metadados rastreados no PostgreSQL. Suporta limpeza
      automática de arquivos expirados.
    x-displayName: Arquivos
  - name: Vector Stores
    description: >-
      API de armazenamento de vetores para armazenar e pesquisar documentos
      usando embeddings. Crie armazenamentos de vetores, faça upload de arquivos
      com divisão automática e geração de embeddings, e realize pesquisas
      semânticas. Os arquivos são processados de forma assíncrona usando fluxos
      de trabalho Temporais para durabilidade. Suporta limpeza automática de
      armazenamentos expirados e LanceDB para armazenamento eficiente de
      vetores.
    x-displayName: Armazenamentos de Vetores
  - name: Conversations
    description: >-
      API de gerenciamento de conversas para armazenar e recuperar o estado da
      conversa durante chamadas à API de Resposta. Crie conversas, adicione
      itens (mensagens do usuário, mensagens do assistente, mensagens do
      sistema) e mantenha o histórico da conversa. Suporta rastreamento de
      metadados e gerenciamento de estado de diálogo em múltiplas interações.
    x-displayName: Conversa
  - name: Guardrails
    description: >-
      API de diretrizes de segurança de IA para configurar moderação de conteúdo
      e políticas de segurança. Configure listas de palavras proibidas, detecção
      de injeção de prompts e prevenção de vazamento de prompts do sistema. As
      diretrizes aplicam-se a todas as solicitações de uma conta e podem ser
      testadas antes da implementação.
    x-displayName: Guarda-corpos
  - name: Models
    description: >-
      API de listagem de modelos para descobrir modelos disponíveis. Retorna IDs
      de modelos, propriedade e metadados de todos os modelos registrados no
      gateway.
    x-displayName: Modelos
  - name: Skills
    description: >-
      API de habilidades para gerenciar pacotes versionados de instruções e
      arquivos seguindo o padrão de Habilidades do Agente. Crie, versionar e
      baixe pacotes de habilidades reutilizáveis que incluam manifestos SKILL.md
      para ambientes de agentes.
    x-displayName: Habilidades
  - name: Chat Completions
    description: >-
      **Obsoleto: Use a API de Respostas (`/api/v1/llm/responses`) em vez
      disso.** Endpoints de conclusão de chat com suporte para streaming,
      chamadas de ferramentas e múltiplos provedores.
    x-deprecated: true
    x-displayName: Conclusões de Bate-Papo
  - name: Batches
    x-displayName: Lotes
  - name: Evals
    x-displayName: Avaliações
  - name: Fine-Tuning
    x-displayName: Ajuste Fino
  - name: Memory Stores
    x-displayName: Armazenamentos de Memória
  - name: Prompts
    x-displayName: Sugestões
  - name: API Key
    x-displayName: Chave da API
  - name: Session
    x-displayName: Sessão
  - name: Organization
    x-displayName: Organização
  - name: Cluster Admin
    x-displayName: Administrador do cluster
  - name: Sessions
    description: Crie, inspecione, acesse e encerre sessões de sandbox.
    x-displayName: Sessões
  - name: Browser
    description: >-
      Conecte-se às sessões do navegador através do proxy da porta do gateway.
      As sessões do navegador expõem um endpoint do Chrome DevTools Protocol na
      porta 9222.
    x-displayName: Navegador
  - name: Execution
    description: >-
      Executar comandos shell e código dentro de uma sessão de sandbox
      existente.
    x-displayName: Execução
  - name: Workspace
    description: >-
      Inspecione o manifesto do espaço de trabalho, transfira arquivos ou
      arquivos compactados e baixe artefatos gerados.
    x-displayName: Espaço de trabalho
  - name: Sandbox Usage
    description: >-
      Agregue estatísticas de uso da sandbox entre sessões, execução e operações
      do espaço de trabalho.
    x-displayName: Uso do Sandbox
  - name: Sandbox Pricing
    description: >-
      Gerenciamento de cluster-admin da tabela de preços de computação da
      sandbox usada para gastos orçados.
    x-displayName: Preço da Sandbox
  - name: schema-3_other
    x-displayName: outro
  - name: Agents
    description: Crie e gerencie definições de agentes reutilizáveis.
    x-displayName: Agentes
  - name: Agent Versions
    description: >-
      Inspecione o histórico de configuração de um agente e reverta para uma
      versão anterior.
    x-displayName: Versões do Agente
  - name: Agent Runs
    description: Execute agentes salvos e inspecione os resultados da execução persistidos.
    x-displayName: Executa Agente
  - name: Agent Connectors
    description: >-
      Conecte agentes salvos a canais de mensagens externos, como o Telegram,
      incluindo troca de texto, foto e documentos compatíveis.
    x-displayName: Conectores de Agente
  - name: Agent Schedules
    description: Crie e gerencie execuções de agentes salvos agendadas ou recorrentes.
    x-displayName: Agendas de Agentes
  - name: schema-4_other
    x-displayName: outro
  - name: Budgets
    x-displayName: Orçamentos
  - name: Settings
    x-displayName: Configurações
  - name: Compute Jobs
    x-displayName: Jobs de Computação
  - name: Compute Services
    x-displayName: Serviços de Computação
  - name: Compute Catalog
    x-displayName: Catálogo de Computação
  - name: Compute Volumes
    x-displayName: Calcular volumes
  - name: Compute Pricing
    x-displayName: Calcular Preços
  - name: Compute Secrets
    x-displayName: Calcular Segredos
  - name: Compute Usage
    x-displayName: Uso de Computação
  - name: Compute Tenants
    x-displayName: Calcular Inquilinos
  - description: Criar, listar, ler, atualizar e excluir repositórios.
    name: Repositories
    x-displayName: Repositórios
paths:
  /api/v1/llm/evals/imports/agent-run:
    post:
      tags:
        - Evals
      summary: Importar uma execução concluída do agente de codificação
      description: >-
        Envia diretamente um job de harness concluído — a execução e suas
        tentativas —, de modo que os resultados nunca fazem round-trip pelo
        armazenamento externo, como acontece com o importador do Hugging Face.
        Todo `task_id` já deve existir no manifesto da versão do conjunto de
        destino; IDs desconhecidos são rejeitados em vez de inventados, porque
        um erro de digitação, de outra forma, seria importado como uma tarefa
        que o conjunto não possui e interpretado como um modelo que nunca cobriu
        a versão. A execução é registrada como `completed` e não é executada:
        isto é uma gravação, não uma solicitação de execução, então nenhum
        workflow é iniciado. As tentativas que cobrem todas as tarefas da versão
        recebem `task_ids: null`, que é o que permite que a execução seja
        classificada como uma varredura completa. As trajetórias NÃO fazem parte
        deste payload — uma execução completa de 91 tarefas gerou 8,3 MB delas —
        então faça upload de cada uma depois em `PUT
        /evals/runs/{run_id}/samples/{sample_index}/trajectory`. Passe
        `idempotency_key` e um upload reenviado retornará a primeira execução em
        vez de duplicar as tentativas por trás de uma linha do board.
      operationId: importAgentEvalRun
      parameters:
        - name: X-On-Behalf-Of
          in: header
          required: false
          schema:
            type: string
          description: Optional external end-user identifier forwarded by the API gateway.
      requestBody:
        required: true
        content:
          application/json:
            schema:
              $ref: '#/components/schemas/ImportAgentRunRequest'
            example:
              suite_id: eval_suite_aa87e2b1112a455b8deabed784372198
              suite_version: 1
              agent_name: omp
              agent_version: 17.3.8
              agent_effort: medium
              model: meetkai:functionary-urdu-mini-pak
              cost_usd: 3.77
              created_at: 1704067200
              idempotency_key: harbor-job-2026-08-23-luna-medium
              metadata:
                harness: harbor
                benchmark: terminal-bench-2.1
              trials:
                - task_id: fix-permissions
                  sample_index: 0
                  status: completed
                  prompt: >-
                    The test suite fails because the fixture directory is not
                    writable. Fix it.
                  target: all tests pass
                  output_text: 9 passed in 2.25s
                  scores:
                    reward: 1
                    resolved: 1
                  cost_usd: 0.0279
                  input_tokens: 658456
                  output_tokens: 6489
                  cached_tokens: 658366
      responses:
        '200':
          description: OK
          content:
            application/json:
              schema:
                type: object
                properties:
                  id:
                    type: string
                  object:
                    const: eval.run
                  suite_id:
                    type: string
                  suite_version:
                    type: integer
                    minimum: -9007199254740991
                    maximum: 9007199254740991
                  suite_version_id:
                    type: string
                  org_id:
                    type: string
                    description: The org that owns this run.
                  team_id:
                    type: string
                    description: The team that owns this run.
                  status:
                    $ref: '#/components/schemas/EvalRunStatus'
                  models:
                    type: array
                    items:
                      type: string
                  task_ids:
                    anyOf:
                      - type: array
                        items:
                          type: string
                      - type: 'null'
                  judge_model:
                    anyOf:
                      - type: string
                      - type: 'null'
                  embedding_model:
                    anyOf:
                      - type: string
                      - type: 'null'
                  generation:
                    type: object
                    properties:
                      instructions:
                        type: string
                      temperature:
                        type: number
                        minimum: 0
                        maximum: 2
                      top_p:
                        type: number
                        minimum: 0
                        maximum: 1
                      max_output_tokens:
                        type: integer
                        minimum: 1
                        maximum: 9007199254740991
                      max_gen_toks:
                        type: integer
                        minimum: 1
                        maximum: 9007199254740991
                        description: lm-eval alias for max_output_tokens.
                      stop:
                        anyOf:
                          - type: string
                          - type: array
                            minItems: 1
                            items:
                              type: string
                      until:
                        type: array
                        minItems: 1
                        items:
                          type: string
                        description: lm-eval generate_until stop sequences.
                      max_tool_calls:
                        type: integer
                        minimum: 1
                        maximum: 9007199254740991
                      reasoning: {}
                      text: {}
                      tools:
                        type: array
                        items:
                          anyOf:
                            - {}
                            - type: 'null'
                      tool_choice: {}
                      parallel_tool_calls:
                        type: boolean
                      truncation:
                        enum:
                          - auto
                          - disabled
                        type: string
                      service_tier:
                        enum:
                          - auto
                          - default
                          - flex
                          - priority
                        type: string
                      presence_penalty:
                        type: number
                        minimum: -2
                        maximum: 2
                      frequency_penalty:
                        type: number
                        minimum: -2
                        maximum: 2
                      top_k:
                        type: integer
                        minimum: 0
                        maximum: 9007199254740991
                      min_p:
                        type: number
                        minimum: 0
                        maximum: 1
                      repetition_penalty:
                        type: number
                        minimum: 0
                      do_sample:
                        type: boolean
                      extra_body:
                        type: object
                        propertyNames:
                          type: string
                        additionalProperties: {}
                      chat_template_kwargs:
                        type: object
                        propertyNames:
                          type: string
                        additionalProperties: {}
                      prefill_think:
                        anyOf:
                          - type: boolean
                          - type: string
                      use_cache:
                        type: boolean
                      timeout_seconds:
                        type: integer
                        minimum: 1
                        maximum: 3600
                      max_retries:
                        type: integer
                        minimum: 0
                        maximum: 10
                      max_empty_retries:
                        type: integer
                        minimum: 0
                        maximum: 10
                    additionalProperties: {}
                  request_counts:
                    type: object
                    properties:
                      total:
                        type: integer
                        minimum: -9007199254740991
                        maximum: 9007199254740991
                      completed:
                        type: integer
                        minimum: -9007199254740991
                        maximum: 9007199254740991
                      failed:
                        type: integer
                        minimum: -9007199254740991
                        maximum: 9007199254740991
                    required:
                      - total
                      - completed
                      - failed
                  metrics:
                    anyOf:
                      - type: object
                        propertyNames:
                          type: string
                        additionalProperties: {}
                      - type: 'null'
                  error:
                    anyOf:
                      - type: object
                        propertyNames:
                          type: string
                        additionalProperties: {}
                      - type: 'null'
                  artifact_file_ids:
                    type: array
                    items:
                      type: string
                  metadata:
                    type: object
                    propertyNames:
                      type: string
                      maxLength: 64
                    additionalProperties:
                      type: string
                      maxLength: 512
                  agent_name:
                    anyOf:
                      - type: string
                      - type: 'null'
                    description: >-
                      Coding-agent harness that produced this run (e.g. `omp`,
                      `claude-code`). Null for every non-harness eval kind — a
                      null here is not a missing value, it means the run is not
                      an agent run.
                  agent_version:
                    anyOf:
                      - type: string
                      - type: 'null'
                    description: >-
                      Version of `agent_name`, as the harness reported it. Null
                      when `agent_name` is.
                  agent_effort:
                    anyOf:
                      - type: string
                      - type: 'null'
                    description: >-
                      Reasoning-effort setting the agent ran at (e.g. `medium`,
                      `xhigh`). Part of the leaderboard's row identity: the same
                      agent and model at two efforts are two rows, not one. Null
                      when `agent_name` is.
                  cost_usd:
                    anyOf:
                      - type: number
                      - type: 'null'
                    description: >-
                      Total spend for the run in USD. Null when the harness did
                      not report cost.
                  created_at:
                    type: integer
                    minimum: -9007199254740991
                    maximum: 9007199254740991
                  started_at:
                    anyOf:
                      - type: integer
                        minimum: -9007199254740991
                        maximum: 9007199254740991
                      - type: 'null'
                  completed_at:
                    anyOf:
                      - type: integer
                        minimum: -9007199254740991
                        maximum: 9007199254740991
                      - type: 'null'
                  cancelled_at:
                    anyOf:
                      - type: integer
                        minimum: -9007199254740991
                        maximum: 9007199254740991
                      - type: 'null'
                  failed_at:
                    anyOf:
                      - type: integer
                        minimum: -9007199254740991
                        maximum: 9007199254740991
                      - type: 'null'
                required:
                  - id
                  - object
                  - suite_id
                  - suite_version
                  - suite_version_id
                  - org_id
                  - team_id
                  - status
                  - models
                  - task_ids
                  - judge_model
                  - embedding_model
                  - generation
                  - request_counts
                  - metrics
                  - error
                  - artifact_file_ids
                  - metadata
                  - agent_name
                  - agent_version
                  - agent_effort
                  - cost_usd
                  - created_at
                  - started_at
                  - completed_at
                  - cancelled_at
                  - failed_at
              example:
                id: eval_run_aa87e2b1112a455b8deabed784372198
                object: eval.run
                suite_id: eval_suite_aa87e2b1112a455b8deabed784372198
                suite_version: 1
                suite_version_id: eval_sver_aa87e2b1112a455b8deabed784372198
                org_id: org-acme
                team_id: team-research
                status: completed
                models:
                  - auto
                task_ids: null
                judge_model: auto
                embedding_model: auto
                generation:
                  temperature: 0
                  max_output_tokens: 512
                request_counts:
                  total: 100
                  completed: 10
                  failed: 0
                metrics: null
                error: null
                artifact_file_ids: []
                metadata:
                  purpose: mvp
                agent_name: omp
                agent_version: null
                agent_effort: null
                cost_usd: null
                created_at: 1704067200
                started_at: 1704067210
                completed_at: null
                cancelled_at: null
                failed_at: null
      security:
        - bearerAuth: []
      x-codeSamples:
        - lang: python
          label: Python (SDK)
          source: |-
            from meetkai_mka1 import SDK


            with SDK(
                bearer_auth="<YOUR_BEARER_TOKEN_HERE>",
            ) as sdk:

                res = sdk.llm.evals.import_agent_run(suite_id="eval_suite_aa87e2b1112a455b8deabed784372198", agent_name="omp", model="meetkai:functionary-urdu-mini-pak", suite_version=1, agent_version="17.3.8", agent_effort="medium", cost_usd=3.77, created_at=1704067200, metadata={
                    "harness": "harbor",
                    "benchmark": "terminal-bench-2.1",
                }, idempotency_key="harbor-job-2026-08-23-luna-medium", trials=[
                    {
                        "task_id": "fix-permissions",
                        "sample_index": 0,
                        "prompt": "The test suite fails because the fixture directory is not writable. Fix it.",
                        "target": "all tests pass",
                        "output_text": "9 passed in 2.25s",
                        "scores": {
                            "reward": 1,
                            "resolved": 1,
                        },
                        "cost_usd": 0.0279,
                        "input_tokens": 658456,
                        "output_tokens": 6489,
                        "cached_tokens": 658366,
                    },
                ], finalize=True)

                # Handle response
                print(res)
        - lang: typescript
          label: Typescript (SDK)
          source: |-
            import { SDK } from "@meetkai/mka1";

            const sdk = new SDK({
              bearerAuth: "<YOUR_BEARER_TOKEN_HERE>",
            });

            async function run() {
              const result = await sdk.llm.evals.importAgentRun({
                importAgentRunRequest: {
                  suiteId: "eval_suite_aa87e2b1112a455b8deabed784372198",
                  suiteVersion: 1,
                  agentName: "omp",
                  agentVersion: "17.3.8",
                  agentEffort: "medium",
                  model: "meetkai:functionary-urdu-mini-pak",
                  costUsd: 3.77,
                  createdAt: 1704067200,
                  metadata: {
                    "harness": "harbor",
                    "benchmark": "terminal-bench-2.1",
                  },
                  idempotencyKey: "harbor-job-2026-08-23-luna-medium",
                  trials: [
                    {
                      taskId: "fix-permissions",
                      sampleIndex: 0,
                      prompt: "The test suite fails because the fixture directory is not writable. Fix it.",
                      target: "all tests pass",
                      outputText: "9 passed in 2.25s",
                      scores: {
                        "reward": 1,
                        "resolved": 1,
                      },
                      costUsd: 0.0279,
                      inputTokens: 658456,
                      outputTokens: 6489,
                      cachedTokens: 658366,
                    },
                  ],
                },
              });

              console.log(result);
            }

            run();
        - lang: csharp
          label: CSharp (SDK)
          source: >-
            using MeetKai.MKA1;

            using MeetKai.MKA1.Types.Components;

            using System.Collections.Generic;


            var sdk = new SDK(bearerAuth: "<YOUR_BEARER_TOKEN_HERE>");


            var res = await sdk.Llm.Evals.ImportAgentRunAsync(body: new
            ImportAgentRunRequest() {
                SuiteId = "eval_suite_aa87e2b1112a455b8deabed784372198",
                SuiteVersion = 1,
                AgentName = "omp",
                AgentVersion = "17.3.8",
                AgentEffort = "medium",
                Model = "meetkai:functionary-urdu-mini-pak",
                CostUsd = 3.77D,
                CreatedAt = 1704067200,
                Metadata = new Dictionary<string, string>() {
                    { "harness", "harbor" },
                    { "benchmark", "terminal-bench-2.1" },
                },
                IdempotencyKey = "harbor-job-2026-08-23-luna-medium",
                Trials = new List<ImportAgentRunRequestTrial>() {
                    new ImportAgentRunRequestTrial() {
                        TaskId = "fix-permissions",
                        SampleIndex = 0,
                        Prompt = "The test suite fails because the fixture directory is not writable. Fix it.",
                        Target = "all tests pass",
                        OutputText = "9 passed in 2.25s",
                        Scores = new Dictionary<string, double>() {
                            { "reward", 1D },
                            { "resolved", 1D },
                        },
                        CostUsd = 0.0279D,
                        InputTokens = 658456,
                        OutputTokens = 6489,
                        CachedTokens = 658366,
                    },
                },
            });


            // handle response
components:
  schemas:
    ImportAgentRunRequest:
      type: object
      properties:
        suite_id:
          type: string
          minLength: 1
          description: >-
            Suíte existente para importar. Seu manifesto define o conjunto de
            tarefas, então crie a suíte primeiro.
        suite_version:
          type: integer
          minimum: 1
          maximum: 2147483647
          description: Padrão para a versão ativa da suíte.
        agent_name:
          type: string
          minLength: 1
          maxLength: 128
          description: O agente da plataforma de testes, por exemplo, `omp`.
        agent_version:
          anyOf:
            - type: string
              maxLength: 64
            - type: 'null'
        agent_effort:
          anyOf:
            - type: string
              maxLength: 32
            - type: 'null'
          description: >-
            Configuração de esforço de raciocínio, por exemplo `medium`. Faz
            parte da identidade da linha no leaderboard, então o mesmo agente e
            modelo em dois níveis de esforço permanecem em duas linhas.
        model:
          type: string
          minLength: 1
          maxLength: 255
        cost_usd:
          anyOf:
            - type: number
              minimum: 0
            - type: 'null'
          description: >-
            Gasto total para o trabalho. Na ausência disso, usa a soma dos
            custos próprios das execuções de teste.
        created_at:
          type: integer
          minimum: -9007199254740991
          maximum: 9007199254740991
          exclusiveMinimum: 0
          description: >-
            Quando o trabalho foi executado, em segundos Unix. O padrão é agora
            — defina isso ao fazer backfill, já que o quadro ordena por isso.
        metadata:
          type: object
          propertyNames:
            type: string
            maxLength: 64
          additionalProperties:
            type: string
            maxLength: 512
        idempotency_key:
          type: string
          minLength: 1
          maxLength: 255
          description: >-
            Reutilizar uma chave retorna a execução criada na primeira vez, em
            vez de importar uma segunda cópia. Sem uma, um envio repetido
            silenciosamente duplica os testes por trás de uma linha do quadro.
        trials:
          type: array
          maxItems: 1000
          items:
            type: object
            properties:
              task_id:
                type: string
                minLength: 1
                maxLength: 255
                description: >-
                  Deve já existir no manifesto da versão do pacote de destino;
                  IDs desconhecidos são rejeitados em vez de inventados.
              sample_index:
                type: integer
                minimum: 0
                maximum: 2147483647
                description: >-
                  Padrão para a posição da tentativa em `trials`. Único por
                  (task, model), não por execução.
              status:
                enum:
                  - completed
                  - failed
                type: string
                default: completed
                description: >-
                  `failed` significa que nenhuma pontuação foi produzida. Um
                  timeout do agente NÃO é isso — o harness ainda executa o
                  verificador e pontua a tentativa, então ela continua
                  `completed` e carrega sua exceção em `error`.
              prompt:
                type: string
                default: ''
                description: A instrução da tarefa.
              target:
                anyOf:
                  - type: string
                  - type: 'null'
              output_text:
                anyOf:
                  - type: string
                  - type: 'null'
                description: >-
                  O que decidiu a pontuação — a saída do verificador. A sessão
                  do agente vai para a rota de trajetória.
              scores:
                type: object
                propertyNames:
                  type: string
                additionalProperties:
                  type: number
                default: {}
                description: >-
                  Valores de métricas para este experimento, por exemplo `{
                  "reward": 1, "resolved": 1 }`. O painel calcula a média de
                  `reward` por padrão.
              error:
                anyOf:
                  - type: object
                    propertyNames:
                      type: string
                    additionalProperties: {}
                  - type: 'null'
                description: >-
                  A exceção registrada por este teste, se houver. Não faz, por
                  si só, com que o teste seja considerado uma falha.
              cost_usd:
                anyOf:
                  - type: number
                    minimum: 0
                  - type: 'null'
              input_tokens:
                anyOf:
                  - type: integer
                    minimum: 0
                    maximum: 9007199254740991
                  - type: 'null'
              output_tokens:
                anyOf:
                  - type: integer
                    minimum: 0
                    maximum: 9007199254740991
                  - type: 'null'
              cached_tokens:
                anyOf:
                  - type: integer
                    minimum: 0
                    maximum: 9007199254740991
                  - type: 'null'
                description: >-
                  A parcela de `input_tokens` atendidos pelo cache de prompt do
                  provedor.
              phase_timings:
                anyOf:
                  - type: object
                    propertyNames:
                      type: string
                    additionalProperties: {}
                  - type: 'null'
            required:
              - task_id
          default: []
          description: >-
            Pode estar vazio ao abrir uma execução para transmitir tentativas
            para ela. Uma importação única envia todas elas para cá.
        expected_trials:
          type: integer
          minimum: 0
          maximum: 1000
          description: >-
            Quantas execuções o trabalho produzirá. Define o total da execução
            antecipadamente para que o console mostre o progresso real (12/89)
            enquanto os dados são transmitidos, em vez de 12/12 que vai
            aumentando.
        finalize:
          type: boolean
          default: true
          description: >-
            False abre a execução `in_progress` para `POST
            /evals/runs/{run_id}/trials` ser preenchida. Os placares contam
            apenas execuções concluídas, então uma execução em streaming
            permanece fora do placar até ser finalizada.
      required:
        - suite_id
        - agent_name
        - model
    EvalRunStatus:
      enum:
        - queued
        - in_progress
        - finalizing
        - completed
        - failed
        - cancelling
        - cancelled
      type: string
  securitySchemes:
    bearerAuth:
      type: http
      scheme: bearer
      bearerFormat: API Key
      description: >-
        Gateway auth: send `Authorization: Bearer <mka1-api-key>`. For
        multi-user server-side integrations, you can also send `X-On-Behalf-Of:
        <external-user-id>`.

````