El problema del conocimiento genérico
Un modelo de lenguaje como GPT-4 sabe muchísimo sobre el mundo en general. Pero no sabe nada sobre tu empresa específicamente: tus productos, tus precios, tus políticas, tu historia.
Si le preguntas a un agente sin base de conocimiento "¿cuánto cuesta el plan empresarial de Flowy?", va a inventar una respuesta o decir que no tiene esa información. Ninguna de las dos opciones es útil.
RAG resuelve este problema.
¿Qué es Retrieval-Augmented Generation?
RAG es una arquitectura que combina dos capacidades:
Retrieval (Recuperación): Antes de generar una respuesta, el sistema busca en tu base de documentos los fragmentos más relevantes para la pregunta del usuario.
Augmented Generation (Generación aumentada): Esos fragmentos se incluyen en el contexto que recibe el modelo de lenguaje al generar la respuesta. El resultado: el agente responde con información real y actualizada de tu empresa.
En términos simples: el agente "busca" antes de "responder".
La anatomía técnica de RAG
1. Indexación de documentos
Cuando subes un documento a Flowy, el sistema lo procesa:
1. Chunking: El documento se divide en fragmentos pequeños (chunks) de ~500 tokens cada uno 2. Embedding: Cada chunk se convierte en un vector numérico que representa su significado semántico 3. Almacenamiento: Los vectores se guardan en una base de datos vectorial optimizada para búsquedas de similitud
Este proceso ocurre una sola vez por documento y tarda segundos o minutos dependiendo del tamaño.
2. Búsqueda en tiempo real
Cuando un cliente hace una pregunta:
1. La pregunta también se convierte en un vector (embedding) 2. El sistema busca los chunks cuyo vector sea más similar al de la pregunta 3. Los top 3-5 chunks más relevantes se seleccionan 4. Se incluyen en el prompt del modelo de lenguaje
3. Generación de respuesta
El modelo recibe algo así:
``
Contexto relevante de los documentos:
[fragmento 1 sobre política de precios]
[fragmento 2 sobre plan empresarial]
Pregunta del usuario: ¿Cuánto cuesta el plan empresarial?
Responde usando el contexto anterior...
`
Y genera una respuesta precisa basada en tu información real.
Por qué los embeddings son clave
La magia de RAG está en los embeddings. A diferencia de una búsqueda por palabras clave, los embeddings capturan el significado.
Ejemplo:
Una búsqueda por palabras clave no encontraría la coincidencia ("entrega" vs "envíos"). Un embedding sí, porque ambas frases significan lo mismo semánticamente.
Qué documentos funcionan mejor en RAG
Funciona muy bien:
Funciona menos bien:
Mejores prácticas para tu base de conocimiento
Estructura con claridad
Escribe tus documentos pensando en preguntas específicas. En lugar de un párrafo largo sobre tu política de envíos, usa:
`
P: ¿Cuánto demora el envío a Bogotá?
R: Los envíos a Bogotá tardan entre 1 y 2 días hábiles...
P: ¿Tienen envíos internacionales? R: Actualmente solo realizamos envíos dentro de Colombia... ``
Mantén los documentos actualizados
Si cambian tus precios o políticas, actualiza los documentos. El agente responde con lo que tiene — si la información está desactualizada, sus respuestas también lo estarán.
Usa documentos específicos por tema
En lugar de un solo documento enorme, divide por temas: uno para precios, uno para soporte técnico, uno para productos, uno para políticas. Esto mejora la precisión de la recuperación.
Incluye contexto en cada chunk
Cada sección del documento debe ser comprensible de forma independiente. Evita referencias como "como mencionamos anteriormente" — el chunk puede llegar al agente sin el contexto previo.
Limitaciones que debes conocer
El agente no razona sobre datos en tiempo real: Si un cliente pregunta "¿tengo stock disponible del producto X?", el agente solo puede responder si ese dato está en la base de conocimiento. Para datos dinámicos (inventario, precios en tiempo real), necesitas integrar la API de tu sistema.
La calidad de la respuesta depende de la calidad del documento: GIGO (Garbage In, Garbage Out) aplica perfectamente aquí. Documentos mal escritos producen respuestas poco útiles.
Hay un límite de contexto: Los modelos tienen un límite de tokens que pueden procesar en una sola llamada. Si recuperas demasiados chunks, el modelo puede "distraerse" con información menos relevante.
El futuro: RAG más inteligente
La próxima generación de RAG incluye:
En Flowy vamos incorporando estas mejoras de forma continua — tus agentes se vuelven más inteligentes sin que tengas que hacer nada.
