Cómo preparar tus datos para un sistema de RAG
La calidad de un sistema de RAG depende más de la preparación de los datos de origen que de la elección del modelo de lenguaje — documentación desordenada, desactualizada o sin una estructura mínima produce respuestas pobres sin importar cuánto se optimice el resto del sistema. Preparar bien los datos antes de empezar la implementación técnica ahorra tiempo y evita retrabajo.
Publicado: Revisado por: Equipo editorial de presupuesto.app
En esta página
Por qué la preparación de datos importa más que el modelo
Un RAG solo puede responder tan bien como la información que tiene disponible para recuperar — un modelo excelente sobre documentación desordenada o desactualizada produce respuestas mediocres, mientras que una base documental bien preparada mejora la calidad de las respuestas incluso con un modelo más modesto.
Auditar qué documentación tienes realmente
Antes de construir nada, conviene hacer un inventario real de las fuentes documentales disponibles — dónde están, en qué formato, quién las mantiene actualizadas, y cuánto se solapan o contradicen entre sí. Es habitual descubrir en esta fase que buena parte de la documentación «disponible» está desactualizada o duplicada en varios sitios con versiones distintas.
Calidad y estructura del contenido
Un documento bien estructurado (con títulos claros, secciones delimitadas, sin mezclar temas no relacionados en un mismo bloque) facilita mucho el chunking posterior — dividirlo en fragmentos que conserven sentido propio sin perder contexto.
Documentos muy largos sin estructura interna, o que mezclan información vigente con información obsoleta sin distinguirlas, son la causa más habitual de que un RAG recupere fragmentos poco útiles o contradictorios.
Permisos y sensibilidad de la información
Antes de ingerir cualquier fuente, conviene identificar qué documentos contienen información sensible o restringida a ciertos usuarios — la recuperación del sistema debe respetar esos permisos, no solo la relevancia semántica de cada fragmento frente a la pregunta.
Un proceso para mantener los datos actualizados
Preparar los datos no es una tarea de una sola vez — conviene definir desde el principio quién es responsable de mantener cada fuente actualizada y con qué frecuencia se reingiere el contenido, para que el sistema no responda con información obsoleta sin que nadie lo note.
Checklist antes de empezar la implementación técnica
Resolver estos puntos antes de la implementación técnica reduce el riesgo de tener que rehacer trabajo de ingesta después.
- ¿Qué fuentes documentales son realmente fiables y están actualizadas?
- ¿Existen versiones contradictorias del mismo contenido en distintos sitios?
- ¿Qué documentos requieren restricción de acceso por usuario o rol?
- ¿Quién será responsable de mantener el contenido actualizado tras el lanzamiento?
Preguntas frecuentes
Contenido relacionado
Coste de un sistema de RAG
Un sistema de RAG (Retrieval-Augmented Generation) conecta un modelo de lenguaje a una base documental propia para que responda con información real y actualizada — su coste está dominado por el trabajo de ingesta y mantenimiento de esa base documental, no por el uso del modelo en sí.
RAG frente a fine-tuning
RAG y fine-tuning son dos formas distintas de adaptar un modelo de lenguaje a los datos y necesidades concretas de una empresa. RAG conecta el modelo a una base documental propia en el momento de responder; el fine-tuning reentrena el modelo con ejemplos propios para cambiar su comportamiento de base. No son excluyentes ni intercambiables — resuelven problemas distintos.
Calculadora de presupuesto de IA
La calculadora de presupuesto de IA de presupuesto.app genera un rango estimado de coste y plazo para chatbots, asistentes internos, RAG, agentes, procesamiento documental, visión artificial y otros proyectos de inteligencia artificial — a partir de tus respuestas sobre datos, integraciones, evaluación y guardarraíles, sin necesidad de registrarte y sin usar IA para calcularlo.