- inferir o contexto de localidade apenas a partir do prompt do usuário
- pedir esclarecimento quando o prompt do usuário é ambíguo
pt-BR).
O mesmo método pode ser reutilizado para outras localidades alterando o conjunto de prompts e os sinais de pontuação.
Execute cada caso como uma nova solicitação de turno único.
Não pré-carregue exemplos que ensinem ao modelo o comportamento exato que você pretende pontuar.
Princípios de avaliação
Use a mesma configuração para ambas as avaliações:- Mantenha a solicitação neutra.
- Não instrua explicitamente o modelo a se localizar para uma região.
- Não instrua explicitamente o modelo a pedir esclarecimento.
- Registre o prompt exato e a resposta bruta exata de cada caso.
- Pontue a saída em relação a sinais comportamentais visíveis, e não à intenção oculta.
Estrutura mínima
Use o SDK MKA1 e mantenha a estrutura da solicitação simples:MKA1 SDK
Avaliar a inferência de contexto de localidade
Objetivo
Comprove que o modelo consegue inferir convenções regionais apenas a partir do prompt do usuário e aplicá-las naturalmente quando o tema exigir. No exemplopt-BR, os sinais mais visíveis são:
R$e a formatação brasileira de valores monetáriosdd/mm/yyyyquando o modelo transforma uma data em formato numérico- unidades métricas como
km,°Cem - tratamento correto de expressões idiomáticas locais e regionais
- contexto social local, como
CPF,RGecomprovante de residência
Etapa 1: escolha sinais de localidade observáveis
Escolha sinais que sejam fáceis para um revisor identificar diretamente na saída.Etapa 2: execute um conjunto de prompts focado
Os promptspt-BR a seguir são baseados em exemplos reais de execuções de avaliação anteriores.
Eles funcionam bem porque expõem sinais locais visíveis sem pedir explicitamente que o modelo se localize.
MKA1 SDK
Etapa 3: pontue cada resposta
Pontue cada caso comopass, partial ou fail.
Etapa 4: monte as evidências
Seu pacote de evidências deve mostrar saídas brutas que tornem visível a inferência de localidade. No exemplo do Brasilpt-BR, uma tabela compacta de evidências pode ser assim:
Uma condição prática de aprovação é:
- pelo menos um exemplo forte aprovado para moeda, data, unidades, expressões idiomáticas e contexto social
- nenhum prompt contém orientação explícita de localização
- as saídas brutas mostram visivelmente as convenções locais
Avaliar o tratamento de ambiguidades
Objetivo
Comprove que o modelo reconhece a ambiguidade no prompt do usuário e faz uma pergunta de acompanhamento direcionada em vez de adivinhar. A avaliação deve medir ambos os lados do comportamento:- se o modelo pede esclarecimento quando o prompt é genuinamente ambíguo
- se o modelo responde diretamente quando o prompt já está claro
Etapa 1: crie prompts ambíguos e controles claros
Os prompts a seguir são baseados em exemplos reais de execuções de avaliação anteriores.MKA1 SDK
Etapa 2: pontue as respostas
Exemplos de comportamento de esclarecimento aprovado:
Preciso de um banco.->Você quer dizer banco financeiro ou banco para sentar?Faz um relatório.->Sobre qual tema, para qual público e para qual período?Manda aquele arquivo pra mim.->Qual arquivo você quer dizer?
Me fala sobre manga.adivinhou o significado de quadrinho japonês em vez de perguntar qual significado o usuário queria.Quero saber mais sobre pena.respondeu sobre vários significados em vez de fazer uma pergunta de esclarecimento.Faz um relatório.inventou um relatório de vendas em vez de resolver a ausência de tema e público.Atualiza os dados.forneceu instruções genéricas de atualização em vez de perguntar quais dados deveriam ser atualizados.Manda aquele arquivo pra mim.passou diretamente para uma limitação de entrega antes de esclarecer a qual arquivo o usuário se referia.
Etapa 3: calcule as métricas
Informe pelo menos estas três métricas:
Uma meta prática é:
- alta taxa de esclarecimento em prompts ambíguos
- baixa taxa de suposições erradas em prompts ambíguos
- baixa taxa de falsos esclarecimentos em prompts claros
Etapa 4: monte as evidências
Use uma tabela compacta de evidências que mostre tanto o comportamento de esclarecimento quanto o de não esclarecimento:Adaptar este guia para outra localidade
Para reutilizar este método em outra região, mantenha a mesma estrutura de avaliação e altere apenas as entradas específicas da localidade:- altere o conjunto de prompts
- altere as convenções locais que você espera ver
- altere as expressões idiomáticas, instituições e referências específicas da região na rubrica
R$,dd/mm/yyyy,km,CPF
- símbolo monetário e estilo de números
- formato de data curta
- convenções de medição
- instituições, documentos e expressões idiomáticas locais
- ambiguidade lexical
- solicitações subespecificadas
- ambiguidade referencial
- ambiguidade de tarefa
- prompts de controle claros
Pacote final de evidências
Para qualquer uma das avaliações, inclua:- a lista exata de prompts
- a resposta bruta de cada caso
- a rubrica de pontuação
- a pontuação por caso
- as métricas agregadas
- uma breve observação confirmando que o teste usou solicitações novas de turno único sem orientação por prompt