Saltar al contenido principal
presupuesto.app

Cómo preparar tus datos para un sistema de RAG

La calidad de un sistema de RAG depende más de la preparación de los datos de origen que de la elección del modelo de lenguaje — documentación desordenada, desactualizada o sin una estructura mínima produce respuestas pobres sin importar cuánto se optimice el resto del sistema. Preparar bien los datos antes de empezar la implementación técnica ahorra tiempo y evita retrabajo.

Publicado: Revisado por: Equipo editorial de presupuesto.app

En esta página

Por qué la preparación de datos importa más que el modelo

Un RAG solo puede responder tan bien como la información que tiene disponible para recuperar — un modelo excelente sobre documentación desordenada o desactualizada produce respuestas mediocres, mientras que una base documental bien preparada mejora la calidad de las respuestas incluso con un modelo más modesto.

Auditar qué documentación tienes realmente

Antes de construir nada, conviene hacer un inventario real de las fuentes documentales disponibles — dónde están, en qué formato, quién las mantiene actualizadas, y cuánto se solapan o contradicen entre sí. Es habitual descubrir en esta fase que buena parte de la documentación «disponible» está desactualizada o duplicada en varios sitios con versiones distintas.

Calidad y estructura del contenido

Un documento bien estructurado (con títulos claros, secciones delimitadas, sin mezclar temas no relacionados en un mismo bloque) facilita mucho el chunking posterior — dividirlo en fragmentos que conserven sentido propio sin perder contexto.

Documentos muy largos sin estructura interna, o que mezclan información vigente con información obsoleta sin distinguirlas, son la causa más habitual de que un RAG recupere fragmentos poco útiles o contradictorios.

Permisos y sensibilidad de la información

Antes de ingerir cualquier fuente, conviene identificar qué documentos contienen información sensible o restringida a ciertos usuarios — la recuperación del sistema debe respetar esos permisos, no solo la relevancia semántica de cada fragmento frente a la pregunta.

Un proceso para mantener los datos actualizados

Preparar los datos no es una tarea de una sola vez — conviene definir desde el principio quién es responsable de mantener cada fuente actualizada y con qué frecuencia se reingiere el contenido, para que el sistema no responda con información obsoleta sin que nadie lo note.

Checklist antes de empezar la implementación técnica

Resolver estos puntos antes de la implementación técnica reduce el riesgo de tener que rehacer trabajo de ingesta después.

  • ¿Qué fuentes documentales son realmente fiables y están actualizadas?
  • ¿Existen versiones contradictorias del mismo contenido en distintos sitios?
  • ¿Qué documentos requieren restricción de acceso por usuario o rol?
  • ¿Quién será responsable de mantener el contenido actualizado tras el lanzamiento?

Preguntas frecuentes

No toda, pero sí auditar qué fuentes son fiables y están actualizadas — es preferible empezar con un conjunto más pequeño y bien cuidado de documentos que con todo el archivo histórico sin revisar.

Es un factor que hay que diseñar desde el principio — define un proceso de reingesta con la frecuencia adecuada a cómo cambian tus datos, en lugar de tratarlo como un problema a resolver después del lanzamiento.

Contenido relacionado