Skip to main content
Use avaliações quando precisar medir o comportamento do modelo em relação às suas próprias tarefas, conjuntos de dados, código de pontuação e configurações operacionais. Uma avaliação possui duas camadas: As execuções de avaliação usam o roteamento normal do MKA1. As gerações candidatas passam por POST /api/v1/llm/responses. Os avaliadores Python baseados em modelo chamam Responses e Embeddings por meio de uma ponte pertencente ao gateway, para que o código do avaliador nunca receba sua chave de API.

Antes de começar

Você precisa de: Use X-On-Behalf-Of quando a avaliação pertencer a um contexto específico de usuário final. Suítes, execuções, arquivos de avaliação enviados e artefatos de resultado são delimitados ao contexto da equipe autenticada.

Fluxo de trabalho

O fluxo normal é:
  1. Faça upload do conjunto de dados e dos arquivos Python opcionais por meio de /files.
  2. Crie uma suíte de avaliação com um manifesto.
  3. Inicie uma execução de avaliação para um ou mais modelos.
  4. Consulte a execução até que ela alcance um status terminal.
  5. Inspecione as linhas das amostras e baixe os arquivos de artefato gerados.
  6. Crie uma nova versão da suíte ao editar o manifesto.
Os status da execução de avaliação passam por:
Os status das amostras são queued, generating, ready_to_score, scoring, running, completed e failed.

Etapa 1 - Fazer upload de um conjunto de dados

Faça upload de arquivos JSONL ou CSV com purpose=evals. JSONL preserva objetos e arrays aninhados. Os valores CSV são analisados como strings.
eval-smoke.jsonl
Armazene o ID file-... retornado.

Etapa 2 - Fazer upload de um arquivo de avaliador Python

Você pode inserir o código-fonte do avaliador diretamente no manifesto. Para avaliadores reutilizáveis, faça upload de arquivos Python com purpose=evals.
exact_match_grader.py
Bash
Armazene o ID file-... do avaliador retornado.

Etapa 3 - Criar uma suíte

Um manifesto de suíte define uma ou mais tarefas. Cada tarefa renderiza um prompt a partir de uma linha do conjunto de dados, envia o prompt a cada modelo da execução, extrai a saída do modelo e avalia a amostra.
Bash
A resposta retorna um objeto eval.suite. Use o id da suíte ao iniciar uma execução.

Etapa 4 - Iniciar uma execução

Uma execução escolhe o modelo ou os modelos a testar. Ela também pode escolher um subconjunto de tarefas, modelo juiz, modelo de embeddings, configurações de geração, concorrência e limite de amostras.
Bash
Campos úteis da execução:

Etapa 5 - Consultar a execução

Bash
Enquanto uma execução está ativa, metrics é null ou está vazio. Quando ela é concluída, as métricas são agrupadas por modelo e por tarefa:

Etapa 6 - Inspecionar amostras

Liste as amostras quando precisar depurar cada linha. Você pode filtrar por task_id, model ou status.
Bash
Você também pode:
  • Filtrar por uma faixa de pontuação numérica usando score_metric + score_min/score_max.
  • Ignorar linhas grandes (como áudio embutido) definindo include_dataset_row=false (as amostras retornarão dataset_row: null).
  • Buscar apenas índices de amostra específicos usando sample_index (índices separados por vírgulas).
Cada amostra inclui a linha de origem, o prompt renderizado, o destino, o response_id armazenado de Responses, a saída bruta do modelo, a saída extraída, as pontuações, os detalhes do juiz e os detalhes de erro.

Buscar áudio de amostra (tarefas de transcrição)

Para avaliações de transcrição, as listas de amostras podem ocultar blobs de áudio data: embutidos em dataset_row. Para buscar a referência do clipe de uma única amostra, chame: GET /api/v1/llm/evals/runs/{run_id}/samples/{sample_index}/audio Se uma execução incluir mais de uma tarefa de transcrição e o mesmo sample_index puder corresponder a várias tarefas, passe task_id ou a API retornará 400.
Bash
A resposta inclui { object, audio, sample_index, task_id, model }, em que audio é uma URI data: em base64 ou uma URL.

Etapa 7 - Buscar artefatos

Execuções concluídas criam arquivos de resultado com purpose=evals. Use o endpoint de artefatos para localizar os IDs dos arquivos de artefato de resultado e de amostras.
Bash
Depois, baixe os arquivos por meio da API Files:
Bash
O artefato de resultado resume os metadados da execução e as métricas finais. O artefato de amostras preserva detalhes por amostra para análise offline.

Editar uma suíte

As suítes são versionadas. Crie uma nova versão imutável ao alterar um manifesto. Defina make_active como false quando quiser preparar uma versão de rascunho sem torná-la o padrão para novas execuções.
Bash
As execuções mantêm a versão da suíte com a qual foram criadas. Alterar a versão ativa não modifica execuções históricas.

Cancelar uma execução

Cancele uma execução quando ela estiver na fila, em andamento ou em finalização.
Bash
O cancelamento é realizado conforme possível. Amostras que já estão em execução podem terminar antes que o fluxo de trabalho alcance cancelled.

Excluir suítes, execuções, agendamentos e arquivos

Avaliações e agendamentos oferecem suporte à exclusão lógica. Os arquivos são excluídos do armazenamento.

Excluir uma execução de avaliação

Exclui logicamente uma execução de avaliação para que ela não apareça mais em listas de execuções, detalhes ou classificações de pontuação.
Bash

Excluir uma suíte de avaliação

Exclui logicamente uma suíte de avaliação e todas as suas execuções de avaliação para que não apareçam mais em leituras voltadas ao usuário.
Bash

Excluir um agendamento de avaliação

Exclui logicamente um agendamento de avaliação e remove seu agendamento Temporal. As execuções históricas são preservadas.
Bash

Excluir um arquivo

Exclui um arquivo do armazenamento. Isso também o removerá de quaisquer armazenamentos vetoriais.
Bash

Paginação e filtragem

Os endpoints de listagem usam paginação por cursor. Exemplo:
Bash

O que ler em seguida