Skip to main content
Este guia mostra como avaliar dois comportamentos do modelo de uma forma reproduzível e fácil de adaptar:
  • inferir o contexto de localidade apenas a partir do prompt do usuário
  • pedir esclarecimento quando o prompt do usuário é ambíguo
O exemplo prático deste documento usa o português brasileiro (pt-BR). O mesmo método pode ser reutilizado para outras localidades alterando o conjunto de prompts e os sinais de pontuação. Execute cada caso como uma nova solicitação de turno único. Não pré-carregue exemplos que ensinem ao modelo o comportamento exato que você pretende pontuar.

Princípios de avaliação

Use a mesma configuração para ambas as avaliações:
  • Mantenha a solicitação neutra.
  • Não instrua explicitamente o modelo a se localizar para uma região.
  • Não instrua explicitamente o modelo a pedir esclarecimento.
  • Registre o prompt exato e a resposta bruta exata de cada caso.
  • Pontue a saída em relação a sinais comportamentais visíveis, e não à intenção oculta.
Para a avaliação de localidade, a pergunta é: o modelo consegue inferir convenções locais apenas a partir da entrada do usuário? Para a avaliação de ambiguidade, a pergunta é: o modelo consegue reconhecer o contexto ausente apenas a partir da entrada do usuário?

Estrutura mínima

Use o SDK MKA1 e mantenha a estrutura da solicitação simples:
MKA1 SDK

Avaliar a inferência de contexto de localidade

Objetivo

Comprove que o modelo consegue inferir convenções regionais apenas a partir do prompt do usuário e aplicá-las naturalmente quando o tema exigir. No exemplo pt-BR, os sinais mais visíveis são:
  • R$ e a formatação brasileira de valores monetários
  • dd/mm/yyyy quando o modelo transforma uma data em formato numérico
  • unidades métricas como km, °C e m
  • tratamento correto de expressões idiomáticas locais e regionais
  • contexto social local, como CPF, RG e comprovante de residência

Etapa 1: escolha sinais de localidade observáveis

Escolha sinais que sejam fáceis para um revisor identificar diretamente na saída.

Etapa 2: execute um conjunto de prompts focado

Os prompts pt-BR a seguir são baseados em exemplos reais de execuções de avaliação anteriores. Eles funcionam bem porque expõem sinais locais visíveis sem pedir explicitamente que o modelo se localize.
MKA1 SDK
Se você incluir prompts sensíveis ao tempo, como o preço atual do combustível ou o salário mínimo atual, registre a data do teste e pontue a atualidade factual separadamente do comportamento de localidade.

Etapa 3: pontue cada resposta

Pontue cada caso como pass, partial ou fail.

Etapa 4: monte as evidências

Seu pacote de evidências deve mostrar saídas brutas que tornem visível a inferência de localidade. No exemplo do Brasil pt-BR, uma tabela compacta de evidências pode ser assim: Uma condição prática de aprovação é:
  • pelo menos um exemplo forte aprovado para moeda, data, unidades, expressões idiomáticas e contexto social
  • nenhum prompt contém orientação explícita de localização
  • as saídas brutas mostram visivelmente as convenções locais

Avaliar o tratamento de ambiguidades

Objetivo

Comprove que o modelo reconhece a ambiguidade no prompt do usuário e faz uma pergunta de acompanhamento direcionada em vez de adivinhar. A avaliação deve medir ambos os lados do comportamento:
  • se o modelo pede esclarecimento quando o prompt é genuinamente ambíguo
  • se o modelo responde diretamente quando o prompt já está claro

Etapa 1: crie prompts ambíguos e controles claros

Os prompts a seguir são baseados em exemplos reais de execuções de avaliação anteriores.
MKA1 SDK

Etapa 2: pontue as respostas

Exemplos de comportamento de esclarecimento aprovado:
  • Preciso de um banco. -> Você quer dizer banco financeiro ou banco para sentar?
  • Faz um relatório. -> Sobre qual tema, para qual público e para qual período?
  • Manda aquele arquivo pra mim. -> Qual arquivo você quer dizer?
Exemplos de padrões de falha em execuções anteriores:
  • Me fala sobre manga. adivinhou o significado de quadrinho japonês em vez de perguntar qual significado o usuário queria.
  • Quero saber mais sobre pena. respondeu sobre vários significados em vez de fazer uma pergunta de esclarecimento.
  • Faz um relatório. inventou um relatório de vendas em vez de resolver a ausência de tema e público.
  • Atualiza os dados. forneceu instruções genéricas de atualização em vez de perguntar quais dados deveriam ser atualizados.
  • Manda aquele arquivo pra mim. passou diretamente para uma limitação de entrega antes de esclarecer a qual arquivo o usuário se referia.
Esses exemplos são evidências negativas úteis. Eles mostram como é adivinhar, o que torna os casos aprovados mais fáceis de defender.

Etapa 3: calcule as métricas

Informe pelo menos estas três métricas: Uma meta prática é:
  • alta taxa de esclarecimento em prompts ambíguos
  • baixa taxa de suposições erradas em prompts ambíguos
  • baixa taxa de falsos esclarecimentos em prompts claros

Etapa 4: monte as evidências

Use uma tabela compacta de evidências que mostre tanto o comportamento de esclarecimento quanto o de não esclarecimento:

Adaptar este guia para outra localidade

Para reutilizar este método em outra região, mantenha a mesma estrutura de avaliação e altere apenas as entradas específicas da localidade:
  • altere o conjunto de prompts
  • altere as convenções locais que você espera ver
  • altere as expressões idiomáticas, instituições e referências específicas da região na rubrica
Por exemplo, as evidências de localidade podem mudar de:
  • R$, dd/mm/yyyy, km, CPF
para as de outra localidade:
  • símbolo monetário e estilo de números
  • formato de data curta
  • convenções de medição
  • instituições, documentos e expressões idiomáticas locais
A avaliação de ambiguidade normalmente muda menos. A maioria das famílias de prompts permanece útil entre localidades:
  • ambiguidade lexical
  • solicitações subespecificadas
  • ambiguidade referencial
  • ambiguidade de tarefa
  • prompts de controle claros

Pacote final de evidências

Para qualquer uma das avaliações, inclua:
  • a lista exata de prompts
  • a resposta bruta de cada caso
  • a rubrica de pontuação
  • a pontuação por caso
  • as métricas agregadas
  • uma breve observação confirmando que o teste usou solicitações novas de turno único sem orientação por prompt

Resumo

Este guia foi elaborado para ser genérico e reproduzível. Ele avalia se um modelo consegue inferir o contexto local por conta própria e se consegue pedir esclarecimento por conta própria. O exemplo prático usa o português brasileiro. Isso torna as evidências concretas, mas a estrutura pode ser reutilizada para outras localidades substituindo-se por um conjunto diferente de sinais e prompts locais.