Qué es
RAG (generación aumentada por recuperación) es un enfoque que, antes de generar una respuesta, busca información relevante en una fuente externa —documentos, bases de conocimiento, la web— y se la entrega al modelo de lenguaje como contexto adicional para que la use al responder.
Por qué se usa
Los modelos de lenguaje tienen un conocimiento fijo hasta la fecha de su entrenamiento y pueden alucinar cuando no saben algo. RAG reduce ese problema: en vez de depender solo de lo que el modelo “memorizó”, le da acceso a información concreta y verificable en el momento de responder.
Cómo funciona, en simple
- La pregunta del usuario se convierte en un embedding.
- Se buscan los documentos más similares en una base de datos vectorial.
- Esos documentos se agregan como contexto al prompt.
- El modelo genera la respuesta basándose en ese contexto, no solo en su memoria interna.
