Skip to main content
Usa Archivos para subir documentos una sola vez. Usa Almacenes Vectoriales para indexar esos archivos y realizar búsquedas semánticas y recuperación de información. Este es el patrón estándar para asistentes respaldados por documentos, flujos de trabajo de recuperación y respuestas fundamentadas.

Subir un archivo

Sube el archivo usando multipart/form-data. La especificación OpenAPI en vivo requiere file y purpose.
La respuesta devuelve un objeto file con un ID como file-abc123.

Crear un almacén vectorial

Crea un almacén vectorial y adjunta uno o más IDs de archivos subidos.
Esta respuesta devuelve un ID de almacén vectorial como vs_abc123.

Crear un almacén de grafos

Establece retrieval_mode en "graph" para obtener recuperación consciente de grafos en lugar de similitud vectorial simple. En un almacén de grafos, las entidades y relaciones se extraen de cada fragmento durante la ingesta para construir un grafo de conocimiento, y la búsqueda recorre ese grafo para reunir evidencia conectada en lugar de devolver únicamente los fragmentos más cercanos. Las mejoras aparecen en preguntas que requieren enlazar hechos entre varios documentos. Dos opciones se aplican solo a los almacenes de grafos:
  • extraction_model — el modelo usado para la extracción de entidades y relaciones. Sigue el mismo contrato que embedding_model: opcional, su valor predeterminado es auto y se resuelve a un modelo concreto en el momento de la creación.
  • max_hops — hasta dónde expandirse por el grafo en cada consulta, de 1 a 4. El valor predeterminado es 2.
La respuesta devuelve retrieval_mode, extraction_model y max_hops, con extraction_model ya resuelto al modelo concreto en lugar de auto. Un almacén de grafos se consulta con la misma llamada de búsqueda que cualquier otro almacén vectorial: el modo es una propiedad del almacén, no de la solicitud.

Qué cambia en un almacén de grafos

  • El modo queda fijado en la creación. No hay forma de convertir un almacén entre vector y graph después; el endpoint de actualización no acepta retrieval_mode. Cambiarlo implica crear un almacén nuevo y volver a adjuntar los archivos.
  • La extracción se contabiliza en tu consumo. Las entidades y relaciones se extraen de cada fragmento durante la ingesta, y cada consulta ejecuta además una pasada de extracción para identificar las entidades desde las que expandirse. Ambas se facturan como uso normal de modelo, así que un almacén de grafos cuesta más de llenar y más de consultar que un almacén vectorial sobre los mismos archivos.
  • La búsqueda en grafo devuelve como máximo 20 resultados. max_num_results admite hasta 50, pero las consultas en grafo se limitan a 20. Un valor mayor se trunca, no se rechaza.
  • extraction_model y max_hops son exclusivos de grafo. Enviar cualquiera de los dos sin retrieval_mode: "graph" devuelve 400.

Agregar más archivos después

Puedes agregar más archivos a un almacén vectorial existente sin tener que recrearlo.
El archivo del almacén vectorial puede devolver status: "in_progress" mientras se realiza la indexación. Un archivo no se puede buscar hasta que su estado llega a "completed": una búsqueda anterior a ese momento tiene éxito, pero omite el archivo, así que consulta el estado hasta "completed" en lugar de asumir una espera fija. La indexación suele terminar en segundos, pero la latencia varía según el tamaño del archivo y la carga. Consulta los endpoints de Archivos y Almacenes Vectoriales en la Referencia de la API para el endpoint de consulta de estado.

Buscar en el almacén vectorial

Usa la búsqueda semántica para recuperar los fragmentos más relevantes para una pregunta de usuario.
La respuesta devuelve coincidencias ordenadas con file_id, filename, datos de puntuación y el contenido del fragmento.

Flujo de trabajo típico

Utiliza esta secuencia para la mayoría de configuraciones de recuperación:
  1. Sube el archivo fuente.
  2. Crea un almacén vectorial con file_ids, o adjunta el archivo más tarde.
  3. Espera a que se complete el procesamiento del archivo.
  4. Busca en el almacén vectorial cuando necesites contexto relevante.
Luego puedes utilizar el texto devuelto en la lógica de tu propia aplicación o en una solicitud de Respuestas.