Inteligencia artificial

Una base de conocimiento empresarial basada en RAG

Cómo el RAG permite que una IA responda a partir de sus propios documentos de empresa, qué datos entran y dónde están los riesgos reales.

Equipo de rabbitclipPublicación: 5 min. de lectura

En breve

El RAG, retrieval augmented generation, significa que un modelo de IA busca antes de responder los fragmentos relevantes de los documentos propios de una empresa, y basa su respuesta en ellos. Un modelo de chat general no conoce los procedimientos internos, la lista de precios ni el manual técnico de una empresa; el RAG cierra ese hueco sin reentrenar el modelo. El sistema encuentra las secciones del documento más cercanas a la pregunta, se las muestra al modelo, y este redacta su respuesta apoyándose solo en ellas.

En un fabricante de generadores, el equipo de servicio técnico podía formular una pregunta en lenguaje natural y encontrar la página correcta de un manual de cientos de páginas en segundos, en vez de buscarlo página por página; el sistema no inventaba nada fuera del manual, porque la implementación estaba pensada para impedirlo.

¿En qué se diferencia el RAG de un modelo de chat general?

Un modelo de chat general responde desde el texto amplio con el que fue entrenado; nunca ha visto el documento propio de la empresa. El RAG busca en los documentos de la empresa en cuanto llega una pregunta, encuentra los fragmentos más relevantes y los envía al modelo con la instrucción de responder solo a partir de ellos.

La diferencia aparece aquí: en lugar de adivinar sobre un tema que no conoce, el modelo resume o cita el documento que tiene delante. Si la respuesta no está en el documento, el sistema debería decirlo en vez de inventar una; ese comportamiento se prueba específicamente durante la implementación.

El resultado práctico es que un sistema RAG se mantiene certero antes y después de una actualización de documento, porque consulta el documento de nuevo en cada pregunta. Un modelo general, en cambio, trabaja con un conocimiento congelado en su fecha de entrenamiento.

¿Qué documentos se convierten en una base de conocimiento?

Manuales de producto, procedimientos internos, preguntas frecuentes, una lista de precios, especificaciones técnicas, antiguos expedientes de presupuesto; cualquier documento escrito y razonablemente organizado es candidato. Su formato, PDF, Word, una hoja de cálculo, se procesa en una forma que el sistema pueda leer; a este paso se le llama preparación de datos.

Documentos dispersos, contradictorios o desactualizados no deberían entrar tal cual. En un fabricante de ropa de trabajo, tres departamentos mantenían cada uno su propia versión de la misma tabla de precios; esa tabla se unificó antes de acercarse al sistema, de lo contrario este no habría sabido qué versión era la correcta.

Los documentos que cambian con frecuencia, la lista de precios sobre todo, deberían quedar en una categoría aparte; si el sistema está configurado para reprocesarlos automáticamente en cada actualización, el riesgo de responder con un precio caducado baja de forma notable.

¿Qué pasos sigue la implementación?

La implementación recorre cuatro pasos principales, cada uno depende de la exactitud del anterior.

  • Reúna los documentos que va a incorporar y descarte los contradictorios o desactualizados
  • Divida los documentos en fragmentos consultables y cárguelos en una base de datos vectorial
  • Construya el flujo de pregunta y respuesta: búsqueda, selección del fragmento, respuesta del modelo
  • Prepare un conjunto de pruebas que confirme que las respuestas se apoyan solo en el documento recuperado
  • Defina los permisos de acceso: quién puede consultar cada documento
  • Fije un calendario para actualizar el sistema cada vez que cambie un documento

¿Por qué el control de acceso es un tema aparte?

Una base de conocimiento también puede contener los documentos más sensibles de una empresa: datos salariales, un contrato con un proveedor, un plan de producto aún no anunciado. La implementación necesita definir con claridad quién puede llegar a qué documento; de lo contrario el asistente podría resumir un documento sensible para alguien que nunca debió verlo.

Eso convierte la implementación del RAG en un proyecto de control de acceso tanto como técnico. Un acceso separado por departamento, al menos en el primer lanzamiento, es más seguro que un sistema abierto a toda la empresa.

¿Cuándo se equivoca el sistema, y cómo se nota?

El error más común ocurre cuando el modelo intenta rellenar, con su propio conocimiento general, un vacío que el documento no cubre. La respuesta suena fluida pero no tiene una fuente real; la implementación debería mostrar en qué sección de documento se apoya cada respuesta, y el usuario debería poder ver esa fuente.

En una cadena de spas, el asistente respondió una vez desde una lista de precios desactualizada que no se había reprocesado; sin una fuente visible, ese error podría haber pasado semanas sin notarse. Mostrar la fuente es la única prueba real de que el sistema es fiable.

¿Necesita mantenimiento, y quién debe encargarse?

Una base de conocimiento no es un sistema que se instala y se abandona; es una estructura viva que necesita reprocesarse cada vez que cambia un documento. La responsabilidad debería recaer, en general, en el departamento que produce el documento; el equipo técnico solo mantiene el sistema en marcha.

Una revisión mensual muestra qué documento se ha quedado desactualizado y cuál nuevo merece entrar. Saltarse esa revisión deja que la precisión del sistema se desvíe, y con ella la confianza del usuario.

Dejar la responsabilidad sin definir hace que una base de conocimiento envejezca en silencio, sin que nadie note los errores acumularse. Nombrar a una persona claramente responsable de la actualización resulta más eficaz que cualquier solución técnica.

El RAG es la forma más controlada de llevar el conocimiento propio de una empresa a un modelo de IA; no exige reentrenamiento, y se actualiza solo en cuanto cambia un documento. La parte difícil de la implementación no es la tecnología, es decidir en qué documentos se puede confiar y trazar bien los límites de acceso. En una llamada de descubrimiento con rabbitclip podemos definir juntos cuáles de sus documentos están listos para convertirse en una base de conocimiento.

Preguntas frecuentes

¿El RAG reentrena el modelo?

No, el modelo se mantiene igual; el sistema solo le muestra el documento pertinente antes de responder.

¿Un sistema RAG necesita conexión a internet?

No necesariamente; los documentos pueden quedarse en el propio entorno de la empresa y abrirse solo a personas autorizadas, según la configuración elegida.

¿Necesita una empresa pequeña una base de conocimiento?

Se vuelve útil cuando crecen el número de documentos y las preguntas internas repetidas; una guía de pocas páginas normalmente no la necesita.

¿Qué pasa si el sistema responde mal?

Como se muestra la fuente, se puede ver de qué documento viene; el documento se corrige o se retira, y la respuesta se prueba de nuevo.

Compartir

Servicio relacionadoSoluciones de IALos datos no sirven si no se estructuran bien. Una inteligencia artificial bien construida asume el trabajo repetitivo, responde antes a su cliente y detecta lo que se le escapa.

Artículos relacionados

Si no sabe por dónde empezar, no pasa nada: está en el lugar correcto.

El proyecto que tiene en mente puede estar ya definido, o ser solo una idea. Las dos cosas valen. En una conversación breve hablamos de dónde está y hacia dónde puede llegar.

Programemos una conversación
Hablemos del proyecto