Glosario
RAG (Retrieval-Augmented Generation)
RAG (Retrieval-Augmented Generation) es la técnica que combina búsqueda en una base de conocimiento con generación de lenguaje, para que el LLM responda usando información real de la empresa en vez de su memoria entrenada.
RAG es el patrón estándar para que un agente IA responda preguntas sobre datos específicos de una empresa sin tener que entrenar un modelo propio. Resuelve uno de los problemas más serios de los LLMs cuando se usan en producción: alucinar respuestas plausibles pero falsas porque están razonando solo con su entrenamiento genérico.
Cómo funciona, paso a paso
- Indexación (offline): los documentos de la empresa (FAQs, catálogos, políticas, manuales) se procesan, se cortan en chunks y cada chunk se convierte en un vector numérico (embedding) que captura su significado.
- Almacenamiento: los vectores se guardan en una base de datos vectorial (Pinecone, Weaviate, pgvector) indexada para búsqueda rápida por similitud.
- Pregunta del usuario: el cliente escribe "¿cuánto cuesta la consulta de ortodoncia?".
- Retrieval: la pregunta también se convierte en vector y se buscan los chunks más similares en la base. Pueden volver, por ejemplo, los párrafos del PDF de servicios que mencionan ortodoncia.
- Generation: el LLM recibe la pregunta + los chunks recuperados como contexto adicional, y genera la respuesta basándose en esos chunks.
Por qué importa para un negocio
Sin RAG, si le preguntás a un LLM "¿qué horario tiene la clínica Sonrisas?", inventará un horario plausible. Con RAG bien hecho, el LLM consulta el documento real, recupera "Lunes a viernes 8:00 a 18:00, sábados 8:00 a 13:00" y responde con eso. Las alucinaciones bajan drásticamente.
Las trampas comunes
- Chunks mal cortados: si el chunk se corta en medio de una oración, el contexto recuperado es inservible
- Embeddings de baja calidad: modelos viejos producen embeddings que confunden conceptos relacionados pero distintos
- Sin re-ranking: los top-K resultados pueden incluir ruido. Un re-ranker (modelo que reordena por relevancia real) mejora mucho
- Knowledge base contradictoria: si el PDF de precios dice X y el sitio web dice Y, RAG va a alucinar con buena fe. Por eso es crítica la auditoría de contradicciones
- No actualizado: si los embeddings se generaron hace un año y los datos cambiaron, las respuestas son obsoletas
Cuándo RAG no alcanza
- Para datos transaccionales en tiempo real (stock actual, agenda de hoy), RAG es poco adecuado. Conviene una tool API que consulte el dato vivo.
- Para razonamiento complejo sobre múltiples documentos a la vez, modelos con context window larga + agent loops funcionan mejor.
- Para tareas que requieren ejecutar acciones (agendar, cobrar), RAG solo no basta: necesita herramientas externas.
En Kharyo, el módulo Cortex implementa RAG con tres capas extra: indexación incremental cuando cambian los documentos, re-ranking semántico, y auditoría mensual automática que detecta contradicciones entre fuentes antes de que un cliente las note.






