As execuções de avaliação usam o roteamento normal do MKA1.
As gerações candidatas passam por
POST /api/v1/llm/responses.
Os avaliadores Python baseados em modelo chamam Responses e Embeddings por meio de uma ponte pertencente ao gateway, para que o código do avaliador nunca receba sua chave de API.
Antes de começar
Você precisa de:
Use
X-On-Behalf-Of quando a avaliação pertencer a um contexto específico de usuário final.
Suítes, execuções, arquivos de avaliação enviados e artefatos de resultado são delimitados ao contexto da equipe autenticada.
Fluxo de trabalho
O fluxo normal é:- Faça upload do conjunto de dados e dos arquivos Python opcionais por meio de
/files. - Crie uma suíte de avaliação com um manifesto.
- Inicie uma execução de avaliação para um ou mais modelos.
- Consulte a execução até que ela alcance um status terminal.
- Inspecione as linhas das amostras e baixe os arquivos de artefato gerados.
- Crie uma nova versão da suíte ao editar o manifesto.
queued, generating, ready_to_score, scoring, running, completed e failed.
Etapa 1 - Fazer upload de um conjunto de dados
Faça upload de arquivos JSONL ou CSV compurpose=evals.
JSONL preserva objetos e arrays aninhados.
Os valores CSV são analisados como strings.
eval-smoke.jsonl
file-... retornado.
Etapa 2 - Fazer upload de um arquivo de avaliador Python
Você pode inserir o código-fonte do avaliador diretamente no manifesto. Para avaliadores reutilizáveis, faça upload de arquivos Python compurpose=evals.
exact_match_grader.py
Bash
file-... do avaliador retornado.
Etapa 3 - Criar uma suíte
Um manifesto de suíte define uma ou mais tarefas. Cada tarefa renderiza um prompt a partir de uma linha do conjunto de dados, envia o prompt a cada modelo da execução, extrai a saída do modelo e avalia a amostra.Bash
eval.suite.
Use o id da suíte ao iniciar uma execução.
Etapa 4 - Iniciar uma execução
Uma execução escolhe o modelo ou os modelos a testar. Ela também pode escolher um subconjunto de tarefas, modelo juiz, modelo de embeddings, configurações de geração, concorrência e limite de amostras.Bash
Etapa 5 - Consultar a execução
Bash
metrics é null ou está vazio.
Quando ela é concluída, as métricas são agrupadas por modelo e por tarefa:
Etapa 6 - Inspecionar amostras
Liste as amostras quando precisar depurar cada linha. Você pode filtrar portask_id, model ou status.
Bash
- Filtrar por uma faixa de pontuação numérica usando
score_metric+score_min/score_max. - Ignorar linhas grandes (como áudio embutido) definindo
include_dataset_row=false(as amostras retornarãodataset_row: null). - Buscar apenas índices de amostra específicos usando
sample_index(índices separados por vírgulas).
response_id armazenado de Responses, a saída bruta do modelo, a saída extraída, as pontuações, os detalhes do juiz e os detalhes de erro.
Buscar áudio de amostra (tarefas de transcrição)
Para avaliações de transcrição, as listas de amostras podem ocultar blobs de áudiodata: embutidos em dataset_row. Para buscar a referência do clipe de uma única amostra, chame:
GET /api/v1/llm/evals/runs/{run_id}/samples/{sample_index}/audio
Se uma execução incluir mais de uma tarefa de transcrição e o mesmo sample_index puder corresponder a várias tarefas, passe task_id ou a API retornará 400.
Bash
{ object, audio, sample_index, task_id, model }, em que audio é uma URI data: em base64 ou uma URL.
Etapa 7 - Buscar artefatos
Execuções concluídas criam arquivos de resultado compurpose=evals.
Use o endpoint de artefatos para localizar os IDs dos arquivos de artefato de resultado e de amostras.
Bash
Bash
Editar uma suíte
As suítes são versionadas. Crie uma nova versão imutável ao alterar um manifesto. Definamake_active como false quando quiser preparar uma versão de rascunho sem torná-la o padrão para novas execuções.
Bash
Cancelar uma execução
Cancele uma execução quando ela estiver na fila, em andamento ou em finalização.Bash
cancelled.
Excluir suítes, execuções, agendamentos e arquivos
Avaliações e agendamentos oferecem suporte à exclusão lógica. Os arquivos são excluídos do armazenamento.Excluir uma execução de avaliação
Exclui logicamente uma execução de avaliação para que ela não apareça mais em listas de execuções, detalhes ou classificações de pontuação.Bash
Excluir uma suíte de avaliação
Exclui logicamente uma suíte de avaliação e todas as suas execuções de avaliação para que não apareçam mais em leituras voltadas ao usuário.Bash
Excluir um agendamento de avaliação
Exclui logicamente um agendamento de avaliação e remove seu agendamento Temporal. As execuções históricas são preservadas.Bash
Excluir um arquivo
Exclui um arquivo do armazenamento. Isso também o removerá de quaisquer armazenamentos vetoriais.Bash
Paginação e filtragem
Os endpoints de listagem usam paginação por cursor.
Exemplo:
Bash
O que ler em seguida
- Projetar suítes de tarefas de avaliação aborda conjuntos de dados, manifestos de tarefas, modelos, exemplos few-shot, extração de saída, controles de geração e métricas.
- Escrever avaliadores Python para avaliações aborda contratos Python de amostra, lote e baseados em modelo.
- Use os caminhos de endpoint deste guia com os objetos de solicitação e resposta gerados retornados pela API.