Qué se implementó
El sistema evaluado no utilizó únicamente la recuperación plana de fragmentos. Se implementó GraphRAG con estas etapas:- Dividir los documentos fuente en fragmentos.
- Extraer entidades y relaciones de esos fragmentos.
- Construir un grafo de conocimiento a partir de las entidades y relaciones extraídas.
- Ejecutar una recuperación estándar para obtener evidencia inicial para una pregunta del usuario.
- Expandir a través de los enlaces del grafo para recopilar evidencia conectada.
- Reordenar el conjunto final de evidencias antes de la generación de la respuesta.
Contra qué se comparó
La comparación utilizó una línea base de RAG tradicional con el mismo corpus y el mismo modelo de respuesta. La única diferencia entre las dos ejecuciones fue el modo de recuperación:- RAG base: solo recuperación plana de fragmentos
- GraphRAG: expansión iniciada por grafo más reordenamiento consciente de grafo
Diseño del benchmark
El benchmark fue diseñado para probar la recuperación multi-hop en lugar de una simple búsqueda de un solo fragmento. Se utilizó:- tres grafos de conocimiento objetivo
- nueve grafos distractores semánticamente similares
- 108 documentos cortos de hechos
- 24 preguntas que requerían enlazar hechos a través de múltiples fragmentos
Método de evaluación
Ambos modos de recuperación se ejecutaron sobre el mismo corpus de referencia y el mismo conjunto de preguntas. Ambos luego usaron el mismo modelo de generación de respuestas y el mismo prompt de respuesta. La evaluación registró tres métricas:- Coincidencia exacta: si la respuesta final coincidía exactamente con la respuesta de referencia
- Token F1: superposición de tokens entre la respuesta final y la respuesta de referencia
- Recall de evidencia@5: cuánta de la evidencia de soporte requerida apareció en los 5 fragmentos recuperados principales
Cómo se ejecutó la evaluación
El flujo evaluado fue simple e idéntico en ambas ejecuciones: el mismo almacén, los mismos documentos y el mismo conjunto de preguntas. Solo cambió el modo de recuperación.- Crear un almacén con grafo habilitado. El almacén se configuró con un modelo de embeddings, un modelo de extracción de entidades/relaciones, un tamaño de fragmento de 800 tokens con 120 de superposición y una profundidad máxima de recorrido del grafo de 2 saltos.
- Ingerir el corpus. Cada uno de los 108 documentos del benchmark se fragmentó e incrustó, y se extrajeron entidades y relaciones de cada fragmento para construir el grafo de conocimiento. Por ejemplo, “Rivera Logistics won the Northern Bridge Sensors contract” y “Atlas Infrastructure Group owns Rivera Logistics” provienen de documentos distintos, pero la extracción los enlaza mediante la entidad compartida
Rivera Logistics. - Ejecutar cada pregunta en modo base. Recuperación plana: incrustar la pregunta, recuperar los fragmentos con mayor puntuación y responder a partir de ellos.
- Ejecutar cada pregunta en modo grafo. Misma pregunta, mismo almacén: recuperar los fragmentos semilla, identificar las entidades semilla que mencionan, expandir hasta 2 saltos por el grafo para recopilar evidencia conectada y reordenar el conjunto de evidencias expandido con señales del grafo antes de responder.
- baseline = recuperación plana tradicional
- graph = expansión iniciada por grafo más reordenamiento consciente de grafo
Resultados medidos
La ejecución en vivo del benchmark produjo los siguientes resultados:
Mejora:
- Coincidencia Exacta:
+37.5puntos - Token F1:
+35.4puntos - Recall de Evidencia@5:
+16.0puntos
Umbral de aceptación
El benchmark utilizó los siguientes criterios de aprobación:- mejora de coincidencia exacta de al menos
+5.0puntos - mejora de recall de evidencia@5 de al menos
+10.0puntos
Resultados representativos a nivel de pregunta
Ejemplos donde GraphRAG tuvo éxito y RAG base no:- “Who is the chief financial officer of the company that owns the Northern Bridge Sensors contract winner?”
- RAG base:
unknown - GraphRAG:
Javier Nanda
- RAG base:
- “Which company acquired the firm that prepared a risk report for Meridian Ports Authority?”
- RAG base:
unknown - GraphRAG:
Atlas Infrastructure Group
- RAG base:
- “Which company owns the company that won the Delta Reach Sensors contract?”
- RAG base:
unknown - GraphRAG:
Bluepeak Transit Group
- RAG base:
Por qué GraphRAG tuvo mejor desempeño
RAG base recuperó fragmentos semánticamente similares, pero a veces no logró recuperar la evidencia conectada necesaria para completar la cadena de razonamiento. GraphRAG mejoró el desempeño al:- identificar las entidades semilla relevantes de la pregunta
- recorrer las relaciones del grafo para encontrar evidencia enlazada
- reordenar el conjunto final de evidencias usando señales del grafo además de la similitud semántica
Resumen
En este benchmark, GraphRAG superó a RAG tradicional tanto en precisión de la respuesta final como en recuperación de evidencia de soporte. Las mayores mejoras se observaron en preguntas que requerían enlazar hechos a través de múltiples entidades conectadas. En la plataforma MKA1, la recuperación consciente de grafos se ofrece a través de los almacenes vectoriales — la superficie de recuperación de la plataforma, responsable del aislamiento por tenant, la medición de uso y la facturación — como un modo de recuperación junto a la búsqueda semántica e híbrida, en lugar de como una API de producto independiente. Para activarlo, crea un almacén conretrieval_mode: "graph". Consulta Crear un almacén de grafos para ver la solicitud completa y qué cambia cuando un almacén está en modo grafo.