O que foi implementado
O sistema avaliado não usou apenas recuperação plana de chunks. Ele implementou GraphRAG com estas etapas:- Dividir os documentos de origem em chunks.
- Extrair entidades e relacionamentos desses chunks.
- Construir um grafo de conhecimento a partir das entidades e relacionamentos extraídos.
- Executar a recuperação padrão para obter evidências iniciais para uma pergunta do usuário.
- Expandir pelos links do grafo para coletar evidências conectadas.
- Reclassificar o conjunto final de evidências antes da geração da resposta.
Com o que foi comparado
A comparação usou uma linha de base de RAG tradicional com o mesmo corpus e o mesmo modelo de resposta. A única diferença entre as duas execuções foi o modo de recuperação:- RAG de linha de base: apenas recuperação plana de chunks
- GraphRAG: expansão iniciada pelo grafo mais reclassificação orientada por grafo
Design do benchmark
O benchmark foi projetado para testar a recuperação multi-hop, em vez de uma simples busca em um único chunk. Ele usou:- três grafos de conhecimento alvo
- nove grafos distratores semanticamente semelhantes
- 108 documentos factuais curtos
- 24 perguntas que exigiam conectar fatos entre vários chunks
Método de avaliação
Ambos os modos de recuperação foram executados sobre o mesmo corpus de benchmark e o mesmo conjunto de perguntas. Em seguida, ambos usaram o mesmo modelo de geração de respostas e o mesmo prompt de resposta. A avaliação registrou três métricas:- Correspondência exata: se a resposta final correspondia exatamente à resposta de referência
- F1 de tokens: sobreposição de tokens entre a resposta final e a resposta de referência
- Recall de evidências@5: quanto das evidências de suporte necessárias apareceu nos 5 principais chunks recuperados
Como a avaliação foi executada
O fluxo avaliado foi simples e idêntico para ambas as execuções — o mesmo armazenamento, os mesmos documentos e o mesmo conjunto de perguntas. Apenas o modo de recuperação mudou.- Criar um armazenamento com suporte a grafo. O armazenamento foi configurado com um modelo de embeddings, um modelo de extração de entidades/relacionamentos, um tamanho de chunk de 800 tokens com sobreposição de 120 e uma profundidade máxima de travessia do grafo de 2 hops.
- Ingerir o corpus. Cada um dos 108 documentos do benchmark foi dividido em chunks e incorporado, e entidades e relacionamentos foram extraídos de cada chunk para construir o grafo de conhecimento. Por exemplo, “Rivera Logistics won the Northern Bridge Sensors contract” e “Atlas Infrastructure Group owns Rivera Logistics” vêm de documentos diferentes, mas a extração os conecta por meio da entidade compartilhada
Rivera Logistics. - Executar cada pergunta no modo de linha de base. Recuperação plana: incorporar a pergunta, recuperar os chunks com maior pontuação e responder com base neles.
- Executar cada pergunta no modo de grafo. Mesma pergunta, mesmo armazenamento: recuperar chunks iniciais, identificar as entidades iniciais que eles mencionam, expandir até 2 hops pelo grafo para coletar evidências conectadas e reclassificar o conjunto expandido de evidências com sinais de grafo antes de responder.
- baseline = recuperação plana tradicional
- graph = expansão iniciada pelo grafo mais reclassificação orientada por grafo
Resultados medidos
A execução ao vivo do benchmark produziu os seguintes resultados:
Melhoria:
- Correspondência exata:
+37.5pontos - F1 de tokens:
+35.4pontos - Recall de evidências@5:
+16.0pontos
Limite de aceitação
O benchmark usou os seguintes critérios de aprovação:- melhoria de correspondência exata de pelo menos
+5.0pontos - melhoria de recall de evidências@5 de pelo menos
+10.0pontos
Resultados representativos no nível das perguntas
Exemplos em que o GraphRAG teve sucesso e o RAG de linha de base não:- “Who is the chief financial officer of the company that owns the Northern Bridge Sensors contract winner?”
- RAG de linha de base:
unknown - GraphRAG:
Javier Nanda
- RAG de linha de base:
- “Which company acquired the firm that prepared a risk report for Meridian Ports Authority?”
- RAG de linha de base:
unknown - GraphRAG:
Atlas Infrastructure Group
- RAG de linha de base:
- “Which company owns the company that won the Delta Reach Sensors contract?”
- RAG de linha de base:
unknown - GraphRAG:
Bluepeak Transit Group
- RAG de linha de base:
Por que o GraphRAG teve melhor desempenho
O RAG de linha de base recuperou chunks semanticamente semelhantes, mas às vezes não conseguiu recuperar as evidências conectadas necessárias para concluir a cadeia de raciocínio. O GraphRAG melhorou o desempenho ao:- identificar as entidades iniciais relevantes a partir da pergunta
- percorrer relacionamentos do grafo para encontrar evidências vinculadas
- reclassificar o conjunto final de evidências com sinais de grafo, além da similaridade semântica
Resumo
Neste benchmark, o GraphRAG superou o RAG tradicional tanto na precisão das respostas finais quanto na recuperação de evidências de suporte. Os ganhos mais expressivos apareceram nas perguntas que exigiam conectar fatos entre várias entidades conectadas. Na plataforma MKA1, a recuperação orientada por grafo é fornecida por meio dos armazenamentos vetoriais — a superfície de recuperação da plataforma, responsável por tenancy, medição de uso e cobrança — como um modo de recuperação junto com a busca semântica e híbrida, em vez de uma API de produto separada. Para ativar, crie um armazenamento comretrieval_mode: "graph". Consulte Criar um armazenamento de grafo para a requisição completa e para o que muda quando um armazenamento está em modo de grafo.