Retrieval-Augmented Generation — una arquitectura donde un modelo de lenguaje responde desde tus datos recuperando contexto relevante de una base de datos vectorial antes de generar.
Un sistema RAG (Retrieval-Augmented Generation) combina un modelo de lenguaje con una capa de recuperación sobre tus datos privados. Cuando un usuario hace una pregunta, el sistema primero recupera los chunks más relevantes de contexto de una base de datos vectorial (usando similitud semántica sobre embeddings), luego ensambla esos chunks en el prompt del modelo, y genera una respuesta fundamentada en el contenido recuperado. RAG es la arquitectura estándar para casos de uso de "hacer preguntas sobre nuestra base de conocimiento".
La mayoría de los casos de uso empresariales de IA — bases de conocimiento internas, soporte al cliente sobre documentación, Q&A en industrias reguladas — requieren respuestas fundamentadas en datos privados con los que el modelo nunca se entrenó. El fine-tuning es caro y congela los datos; RAG mantiene los datos vivos y externos. El desafío es que el RAG grado-producción es mucho más difícil que el tutorial — estrategia de chunking, selección del modelo de embedding, ajuste de top-k y disciplina de evaluación deciden si el sistema realmente funciona.
El RAG en producción es un problema de ingeniería más que de modelo. A través de los engagements de Skopa, la diferencia entre un RAG grado-tutorial y uno que aguanta a escala se reduce a: tamaño de chunk y solapamiento calibrados contra un set de evaluación (no los valores por defecto), modelo de embedding seleccionado para el dominio (no sólo el popular), reranking tras la recuperación, observabilidad sobre qué contexto usó realmente el modelo, y medición rigurosa de calidad sobre preguntas reales de usuarios. Vemos rutinariamente top-k recortado de 10 a 3 con mejora de calidad y 70% de reducción de coste simultáneamente.