Una IA con sus propios documentos: cómo funciona el RAG
La mayoría de los proyectos de IA en la empresa se basan en una misma técnica: recuperar los pasajes adecuados en los documentos de la organización y pedir después al modelo que responda a partir de ellos. Así funciona, dónde se equivoca y por qué los documentos sensibles conviene dejarlos en el sitio.
Una buena fuente, una mala respuesta
Un pasajero pregunta al asistente conversacional del sitio web de Air Canada por las tarifas reservadas a los viajes por duelo. El asistente le explica que puede pagar el billete a precio normal y solicitar la reducción a posteriori, en un plazo de 90 días. En el mismo mensaje, facilita un enlace a la página oficial de la compañía. Esa página dice lo contrario: la tarifa por duelo no se aplica a las solicitudes presentadas después del viaje.
El tribunal de resolución de conflictos civiles de Columbia Británica dictó sentencia en febrero de 2024. Air Canada sostenía que su asistente era una entidad distinta, responsable de sus propias declaraciones; el tribunal calificó el argumento de «notable» y lo rechazó. La compañía tuvo que abonar la diferencia entre el precio pagado y la tarifa por duelo. Para el tribunal, poco importa que la información provenga de una página fija o de un asistente: la empresa responde de lo que figura en su sitio.
El episodio resume el problema que busca resolver la generación aumentada por recuperación, o RAG por retrieval-augmented generation. El documento exacto existía. Faltaba un sistema que respondiera a partir de él y que mostrara de dónde procede cada afirmación.
El principio: un examen a libro abierto
El término aparece en 2020 en un artículo firmado por Patrick Lewis y once coautores, presentado en la conferencia NeurIPS. Los autores distinguen allí dos memorias. La memoria paramétrica es la que el modelo ha absorbido durante su entrenamiento, inscrita en sus parámetros. La memoria no paramétrica es un índice externo, en su experimento una versión de Wikipedia, que el sistema consulta en el momento de responder. Su conclusión: la combinación de ambas produce textos más precisos y más factuales que el modelo solo.
La comparación más elocuente es la del examen. Un estudiante que lo ha aprendido todo de memoria responde rápido, pero se equivoca en lo que retuvo mal e ignora todo lo que ha cambiado desde sus repasos. Un estudiante autorizado a abrir su carpeta busca primero la página adecuada y luego redacta a partir de lo que lee. El RAG sitúa al modelo de lenguaje en la posición del segundo.
La CNIL resume el interés del método: produce respuestas enriquecidas con datos externos, más específicas y más fáciles de actualizar que el propio modelo. Es el punto decisivo para una empresa. Reentrenar un modelo con sus documentos es caro y hay que repetirlo en cada actualización. La ANSSI añade un argumento de seguridad: una vez que los datos se han integrado en el entrenamiento, resulta imposible aplicarles derechos de acceso, mientras que los documentos almacenados junto al modelo pueden seguir sometidos a las reglas habituales de quién ve qué.
En concreto, un RAG encadena cuatro operaciones: preparar los documentos, convertirlos en coordenadas, recuperar los pasajes útiles y redactar después una respuesta que los cite.
Paso 1: preparar y fragmentar los documentos
Todo empieza con la extracción del texto. Un archivo de procesamiento de texto o una página web se leen fácilmente; un PDF escaneado requiere reconocimiento de caracteres, una tabla o un esquema exigen un tratamiento particular. Este trabajo ingrato determina buena parte de la calidad final: un texto mal extraído dará respuestas erróneas, sea cual sea la potencia del modelo.
A continuación, el texto se divide en fragmentos de unos pocos párrafos, que los profesionales llaman chunks. La fragmentación es necesaria porque la búsqueda debe señalar un pasaje preciso, no un informe de doscientas páginas. También crea una trampa, bien descrita por Anthropic en una publicación de septiembre de 2024: un fragmento aislado pierde su contexto. El ejemplo elegido es el de un informe financiero cuyo extracto indica que la facturación aumentó un 3 % en el trimestre, sin precisar de qué empresa ni de qué trimestre se trata.
Las contramedidas son conocidas. Se hace que los fragmentos se solapen ligeramente, se respetan los títulos y los artículos en lugar de cortar a mitad de frase, y se añade a cada fragmento una breve descripción de su contexto: documento de origen, sección, fecha. Estos metadatos servirán más adelante para filtrar, citar y controlar los accesos.
Paso 2: traducir el sentido en coordenadas
Cada fragmento pasa después por un modelo de embedding, distinto del modelo que redactará la respuesta. Su función es transformar un texto en una lista de números, un vector, que representa su sentido. Dos pasajes que hablan de lo mismo, aunque con palabras diferentes, obtienen vectores próximos.
La imagen más exacta es la de un mapa. Cada pasaje recibe unas coordenadas, no sobre dos ejes como una latitud y una longitud, sino sobre cientos o miles de dimensiones. En ese mapa, «preaviso de dimisión» queda cerca de «plazo que debe respetarse antes de dejar la empresa», aunque ambas fórmulas apenas comparten palabras. Eso es lo que distingue la búsqueda semántica de la búsqueda por palabras clave de un motor interno clásico.
Estos vectores parecen abstractos. Lo son menos de lo que se cree. En un artículo presentado en la conferencia EMNLP 2023, unos investigadores mostraron que se podía reconstruir exactamente el 92 % de textos cortos, de 32 tokens, a partir de sus solos embeddings, y recuperar así nombres completos en notas clínicas. Un índice vectorial debe, por tanto, protegerse con el mismo cuidado que los documentos de los que procede.
Paso 3: almacenar y luego recuperar
Los vectores se almacenan en una base de datos vectorial, junto con el texto original y sus metadatos. Cuando un usuario plantea una pregunta, esta se convierte en vector con el mismo modelo de embedding y la base busca los fragmentos cuyas coordenadas son las más próximas. El principio recuerda al de un bibliotecario que, en lugar de buscar la palabra exacta en los títulos, va directo a la estantería donde están las obras que tratan del tema.
La búsqueda semántica por sí sola tiene sus debilidades. Puede pasar por alto una referencia exacta, un número de contrato o un código de artículo, que una búsqueda por palabras clave encuentra sin dificultad. Los sistemas serios combinan, por tanto, ambas y suelen añadir una etapa de reclasificación: un segundo modelo relee los candidatos seleccionados y los ordena según su pertinencia real para la pregunta formulada.
Anthropic ha cuantificado el efecto de estas mejoras en sus propios conjuntos de prueba. Con una búsqueda vectorial simple, la información correcta faltaba entre los veinte primeros resultados en el 5,7 % de los casos. Al añadir contexto a cada fragmento, esa tasa bajaba al 3,7 %. Combinada con una búsqueda por palabras clave de tipo BM25, descendía al 2,9 % y después al 1,9 % con la reclasificación. Son mediciones de un proveedor sobre sus datos, pero el orden de magnitud muestra que la búsqueda, más que la redacción, determina la calidad de un RAG.
Paso 4: redactar la respuesta y citar las fuentes
Los pocos pasajes seleccionados se insertan en la instrucción enviada al modelo de lenguaje, junto con la pregunta y unas indicaciones explícitas: responder únicamente a partir de los extractos facilitados, indicar para cada afirmación el documento y la página, y decir claramente cuándo la información no figura en ellos. El modelo redacta entonces una respuesta en lenguaje corriente y la interfaz muestra los enlaces a los pasajes citados.
La cita cambia la naturaleza de la herramienta. Sin ella, el usuario debe creer a la máquina bajo palabra. Con ella, puede comprobarlo con un clic, y la organización puede reconstruir después el origen de una respuesta impugnada. En el caso de Air Canada, el enlace estaba presente pero contradecía el texto; un sistema bien ajustado debe producir una respuesta fiel a la fuente que cita, y el usuario debe tener el reflejo de abrirla.
Tampoco hay que ahogar al modelo bajo los extractos. Un estudio publicado en 2023 en las Transactions of the Association for Computational Linguistics, con el título «Lost in the Middle», mostró que los modelos aprovechan mejor una información situada al principio o al final del texto que se les proporciona, y bastante peor cuando se encuentra en el medio. Más vale unos pocos pasajes pertinentes que un montón de pasajes aproximados.
Por otra parte, el RAG no siempre es necesario. Anthropic señala que por debajo de unos 200 000 tokens, es decir, aproximadamente 500 páginas, puede resultar más sencillo insertar toda la base en la instrucción, siempre que el modelo admita una ventana de contexto tan larga. Para un reglamento interno y algunos procedimientos, la pregunta se plantea. Para los archivos de un despacho, no se plantea.
Por qué casi todos los proyectos empiezan por aquí
Un modelo de lenguaje, por excelente que sea, no conoce los procedimientos internos de una empresa, ni sus contratos, ni sus fichas de producto, ni el historial de sus expedientes. El RAG es la manera más directa de darle acceso a ese conocimiento sin modificarlo. Añadir un documento equivale a indexarlo; retirar una versión obsoleta equivale a eliminarla del índice. La operación pertenece a la gestión documental, no a un nuevo entrenamiento.
Los usos se parecen de un sector a otro. Un departamento de recursos humanos responde a las preguntas recurrentes de los empleados sobre el convenio colectivo o las vacaciones. Un servicio de atención al cliente encuentra la ficha técnica adecuada. Un departamento jurídico consulta una base de contratos para localizar las cláusulas de rescisión. Una administración local ayuda a sus agentes a orientarse en deliberaciones y reglamentos acumulados durante años. En cada uno de estos casos, el valor reside menos en la redacción que en la capacidad de encontrar el pasaje adecuado.
Las alucinaciones disminuyen, no desaparecen
El RAG suele presentarse como el remedio contra las respuestas inventadas. Un estudio del RegLab y del instituto HAI de la Universidad de Stanford, publicado en mayo de 2024 y realizado sobre más de 200 preguntas jurídicas, matiza con fuerza esa promesa. Las herramientas de investigación jurídica de LexisNexis y Thomson Reuters, basadas en el RAG y algunas de las cuales afirmaban estar libres de alucinaciones, producían información incorrecta en más del 17 % de los casos en Lexis+ AI y Ask Practical Law AI, y en más del 34 % en Westlaw AI-Assisted Research. GPT-4 usado solo lo hacía claramente peor, con entre un 58 y un 82 % de errores en este tipo de preguntas.
Los autores señalan varias causas: una búsqueda que devuelve textos no aplicables, una dificultad propia del razonamiento jurídico y la tendencia del modelo a seguir la dirección de la pregunta, incluso cuando esta se apoya en una premisa falsa. El RAG desplaza, por tanto, el riesgo más que suprimirlo. Si la búsqueda devuelve el pasaje equivocado, el modelo redacta una respuesta fluida a partir del pasaje equivocado.
Las protecciones son sobre todo organizativas. Se constituye un conjunto de preguntas reales cuyas respuestas correctas se conocen y se mide el sistema con él antes de desplegarlo, y después en cada cambio. Se le autoriza a responder que no lo sabe. Se reserva una validación humana para las respuestas que comprometen a la organización. En su acompañamiento de un proyecto de France Travail, la CNIL insistía en este último punto: formar a los agentes para que detecten los errores y dejarles tiempo para apartarse de la sugerencia de la herramienta.
Derechos de acceso: el asistente ve lo que ve el índice
El riesgo más subestimado no es el error, es la fuga interna. Si todos los documentos de una organización se indexan en una misma base, un becario puede pedir al asistente el sueldo de su director y obtener un extracto de nómina. El modelo no ha forzado nada; ha leído lo que la base le ha transmitido.
La ANSSI lo convierte en una exigencia explícita: un sistema de IA debe respetar, en sus respuestas, las restricciones de acceso propias de cada usuario. Precisa que es factible para los documentos almacenados junto al modelo, según las capacidades de la herramienta de almacenamiento, y recomienda revisar periódicamente los derechos configurados, por ejemplo cada mes. Microsoft, en su documentación de preparación para Copilot, lo formula a su manera: el asistente respeta los permisos existentes, lo que equivale a dejar al descubierto todos los recursos compartidos demasiado amplios acumulados con los años. El editor recuerda además que los ajustes de uso compartido de SharePoint son, por defecto, los más permisivos.
OWASP, fundación de referencia en seguridad de aplicaciones, dedica en la edición 2025 de su clasificación de los diez principales riesgos asociados a los modelos de lenguaje una categoría a las debilidades de los vectores y de los embeddings. Incluye las fugas entre usuarios o clientes que comparten una misma base vectorial, el envenenamiento de la base mediante documentos trampa y la inversión de los embeddings mencionada más arriba. El ejemplo citado habla por sí solo: un currículum que contiene, en texto blanco sobre fondo blanco, una instrucción destinada a que el sistema de selección recomiende al candidato. Todo documento indexado acabará llegando al modelo; hay que saber de dónde procede.
La consecuencia práctica es sencilla de enunciar y larga de poner en práctica. Cada fragmento indexado debe llevar los derechos de su documento de origen, la búsqueda debe filtrar según la identidad de la persona que consulta y cada consulta debe quedar registrada.
Documentos obsoletos, respuestas obsoletas
Un RAG responde a partir de lo que se le ha confiado. Si el índice contiene la nota de servicio de 2019 y la que la sustituyó, puede citar una u otra con la misma seguridad. El caso es frecuente en las organizaciones donde los documentos se acumulan sin que se retire nunca ninguno: antiguas tarifas, procedimientos abandonados, modelos de contrato superados.
La solución es documental antes que técnica. Hay que designar un responsable para cada corpus, fechar los documentos, archivar lo que se sustituye y lograr que el índice siga automáticamente las altas, las modificaciones y las supresiones. El propio Microsoft recomienda archivar los sitios inactivos para que su asistente se apoye en contenido actualizado. En la interfaz, mostrar la fecha de cada fuente citada permite detectar de un vistazo una respuesta basada en un texto antiguo.
Por qué ejecutarlo en local con documentos sensibles
Un RAG manipula, por construcción, los documentos más valiosos de la organización. Con un servicio en línea, esos documentos, sus vectores, las preguntas de los usuarios y las respuestas transitan o permanecen en el proveedor. En sus preguntas y respuestas de julio de 2024 sobre la IA generativa, la CNIL recomienda priorizar un despliegue en las propias instalaciones cuando se tratan datos personales o sensibles, para limitar los riesgos de extracción por un tercero. La ANSSI, en su recomendación R34, desaconseja las herramientas de IA generativa en línea para cualquier uso profesional que implique datos sensibles.
El servicio público ofrece un ejemplo documentado. En el marco de su entorno de pruebas dedicado a la IA en los servicios públicos, la CNIL acompañó en 2024 el proyecto «Conseils Personnalisés» de France Travail, una herramienta que sugiere formaciones a los asesores a partir de un RAG alimentado por el catálogo de formaciones y el perfil del solicitante de empleo. El modelo elegido, Mixtral de Mistral AI, se instaló en las propias instalaciones. La CNIL subraya en sus recomendaciones que un modelo utilizado en el entorno del proveedor presenta riesgos de pérdida de confidencialidad de los datos personales.
Para ciertas profesiones, la cuestión afecta al secreto profesional. El artículo 226-13 del Código Penal francés castiga con un año de prisión y 15 000 euros de multa la revelación de una información de carácter secreto por parte de la persona que es depositaria de ella por razón de su profesión. Los despachos de abogados y de expertos contables son los primeros afectados. Un departamento de recursos humanos que indexa expedientes individuales o una administración local que tramita solicitudes de ayuda social manejan, por su parte, datos personales cuya divulgación causaría un perjuicio real a las personas.
El modo local supone que toda la cadena permanece en el sitio: la extracción del texto, el modelo de embedding, la base vectorial, el modelo de lenguaje y los registros. Conservar el modelo en casa y confiar los vectores a un servicio externo no protege gran cosa, puesto que esos vectores permiten reconstruir parte de los textos. A cambio, la organización asume la explotación: copias de seguridad, actualizaciones, vigilancia de los accesos.
Por dónde empezar
Un primer proyecto exitoso se resume en pocas cosas: un corpus limitado y bien mantenido, por ejemplo los procedimientos de un departamento, unos derechos de acceso claros, un conjunto de preguntas reales para medir la calidad y usuarios que saben que deben abrir las fuentes citadas. Las dificultades rara vez vienen del modelo. Vienen de los documentos, de su estado, de sus versiones y de la cuestión de quién tiene derecho a leerlos.
Es el enfoque que adopta HOMN: los documentos, el índice y el modelo permanecen dentro de las paredes de la organización, y el recurso a un servicio externo sigue siendo una elección explícita. Sea cual sea la herramienta elegida, la calidad de las respuestas dependerá ante todo de la del corpus y del rigor de los derechos.
¿Qué es el RAG?
El RAG, por retrieval-augmented generation o generación aumentada por recuperación, es una técnica que busca primero los pasajes pertinentes en una base de documentos y pide después a un modelo de lenguaje que responda a partir de esos pasajes. Permite consultar los propios documentos sin reentrenar el modelo y citar la fuente de cada respuesta.
¿Elimina el RAG las alucinaciones?
No, las reduce sin eliminarlas. Un estudio de Stanford publicado en 2024 midió más de un 17 % de respuestas incorrectas en herramientas jurídicas comerciales basadas en el RAG. Si la búsqueda devuelve un pasaje equivocado, el modelo redacta una respuesta fluida a partir de ese pasaje, de ahí la importancia de las citas y de la verificación humana.
¿Hay que entrenar una IA con los propios documentos para que los conozca?
En general, no. El RAG deja el modelo tal cual y le proporciona los extractos útiles en el momento de cada pregunta, lo que permite actualizar la base añadiendo o retirando documentos. También permite conservar derechos de acceso por documento, algo que la ANSSI considera imposible una vez que los datos se han integrado en el entrenamiento.
¿Se puede crear un chatbot sobre los propios documentos sin enviarlos a la nube?
Sí. La extracción del texto, el modelo de embedding, la base vectorial y el modelo de lenguaje pueden funcionar en un servidor instalado en las instalaciones de la organización. Es la opción que la CNIL recomienda priorizar cuando se tratan datos personales o sensibles.