Skip to main content
Esta avaliação compara o GraphRAG com o RAG tradicional no mesmo corpus de benchmark e no mesmo conjunto de perguntas. O objetivo foi medir se a recuperação orientada por grafo melhorava a resposta a perguntas multi-hop.

O que foi implementado

O sistema avaliado não usou apenas recuperação plana de chunks. Ele implementou GraphRAG com estas etapas:
  1. Dividir os documentos de origem em chunks.
  2. Extrair entidades e relacionamentos desses chunks.
  3. Construir um grafo de conhecimento a partir das entidades e relacionamentos extraídos.
  4. Executar a recuperação padrão para obter evidências iniciais para uma pergunta do usuário.
  5. Expandir pelos links do grafo para coletar evidências conectadas.
  6. Reclassificar o conjunto final de evidências antes da geração da resposta.
Esse é o comportamento do GraphRAG que foi avaliado.

Com o que foi comparado

A comparação usou uma linha de base de RAG tradicional com o mesmo corpus e o mesmo modelo de resposta. A única diferença entre as duas execuções foi o modo de recuperação:
  • RAG de linha de base: apenas recuperação plana de chunks
  • GraphRAG: expansão iniciada pelo grafo mais reclassificação orientada por grafo
Isso é importante porque isola o efeito do próprio GraphRAG.

Design do benchmark

O benchmark foi projetado para testar a recuperação multi-hop, em vez de uma simples busca em um único chunk. Ele usou:
  • três grafos de conhecimento alvo
  • nove grafos distratores semanticamente semelhantes
  • 108 documentos factuais curtos
  • 24 perguntas que exigiam conectar fatos entre vários chunks
Esse design é importante. Se cada resposta já aparece em um único chunk óbvio, o GraphRAG não apresentará muitos benefícios em relação ao RAG padrão.

Método de avaliação

Ambos os modos de recuperação foram executados sobre o mesmo corpus de benchmark e o mesmo conjunto de perguntas. Em seguida, ambos usaram o mesmo modelo de geração de respostas e o mesmo prompt de resposta. A avaliação registrou três métricas:
  • Correspondência exata: se a resposta final correspondia exatamente à resposta de referência
  • F1 de tokens: sobreposição de tokens entre a resposta final e a resposta de referência
  • Recall de evidências@5: quanto das evidências de suporte necessárias apareceu nos 5 principais chunks recuperados

Como a avaliação foi executada

O fluxo avaliado foi simples e idêntico para ambas as execuções — o mesmo armazenamento, os mesmos documentos e o mesmo conjunto de perguntas. Apenas o modo de recuperação mudou.
  1. Criar um armazenamento com suporte a grafo. O armazenamento foi configurado com um modelo de embeddings, um modelo de extração de entidades/relacionamentos, um tamanho de chunk de 800 tokens com sobreposição de 120 e uma profundidade máxima de travessia do grafo de 2 hops.
  2. Ingerir o corpus. Cada um dos 108 documentos do benchmark foi dividido em chunks e incorporado, e entidades e relacionamentos foram extraídos de cada chunk para construir o grafo de conhecimento. Por exemplo, “Rivera Logistics won the Northern Bridge Sensors contract” e “Atlas Infrastructure Group owns Rivera Logistics” vêm de documentos diferentes, mas a extração os conecta por meio da entidade compartilhada Rivera Logistics.
  3. Executar cada pergunta no modo de linha de base. Recuperação plana: incorporar a pergunta, recuperar os chunks com maior pontuação e responder com base neles.
  4. Executar cada pergunta no modo de grafo. Mesma pergunta, mesmo armazenamento: recuperar chunks iniciais, identificar as entidades iniciais que eles mencionam, expandir até 2 hops pelo grafo para coletar evidências conectadas e reclassificar o conjunto expandido de evidências com sinais de grafo antes de responder.
A etapa 3 em comparação com a etapa 4 é a comparação principal. A consulta, o corpus e o modelo de resposta permaneceram os mesmos — apenas o modo de recuperação mudou:
  • baseline = recuperação plana tradicional
  • graph = expansão iniciada pelo grafo mais reclassificação orientada por grafo

Resultados medidos

A execução ao vivo do benchmark produziu os seguintes resultados: Melhoria:
  • Correspondência exata: +37.5 pontos
  • F1 de tokens: +35.4 pontos
  • Recall de evidências@5: +16.0 pontos

Limite de aceitação

O benchmark usou os seguintes critérios de aprovação:
  • melhoria de correspondência exata de pelo menos +5.0 pontos
  • melhoria de recall de evidências@5 de pelo menos +10.0 pontos
A implementação avaliada do GraphRAG passou em ambos os limites.

Resultados representativos no nível das perguntas

Exemplos em que o GraphRAG teve sucesso e o RAG de linha de base não:
  • “Who is the chief financial officer of the company that owns the Northern Bridge Sensors contract winner?”
    • RAG de linha de base: unknown
    • GraphRAG: Javier Nanda
  • “Which company acquired the firm that prepared a risk report for Meridian Ports Authority?”
    • RAG de linha de base: unknown
    • GraphRAG: Atlas Infrastructure Group
  • “Which company owns the company that won the Delta Reach Sensors contract?”
    • RAG de linha de base: unknown
    • GraphRAG: Bluepeak Transit Group
Estas são perguntas multi-hop. Elas exigem conectar fatos entre entidades conectadas, em vez de recuperar um único chunk diretamente correspondente.

Por que o GraphRAG teve melhor desempenho

O RAG de linha de base recuperou chunks semanticamente semelhantes, mas às vezes não conseguiu recuperar as evidências conectadas necessárias para concluir a cadeia de raciocínio. O GraphRAG melhorou o desempenho ao:
  • identificar as entidades iniciais relevantes a partir da pergunta
  • percorrer relacionamentos do grafo para encontrar evidências vinculadas
  • reclassificar o conjunto final de evidências com sinais de grafo, além da similaridade semântica
É por isso que a melhoria aparece mais claramente em perguntas multi-hop.

Resumo

Neste benchmark, o GraphRAG superou o RAG tradicional tanto na precisão das respostas finais quanto na recuperação de evidências de suporte. Os ganhos mais expressivos apareceram nas perguntas que exigiam conectar fatos entre várias entidades conectadas. Na plataforma MKA1, a recuperação orientada por grafo é fornecida por meio dos armazenamentos vetoriais — a superfície de recuperação da plataforma, responsável por tenancy, medição de uso e cobrança — como um modo de recuperação junto com a busca semântica e híbrida, em vez de uma API de produto separada. Para ativar, crie um armazenamento com retrieval_mode: "graph". Consulte Criar um armazenamento de grafo para a requisição completa e para o que muda quando um armazenamento está em modo de grafo.