Qué es
RAG combina búsqueda y generación: primero recupera los fragmentos más relevantes de tus documentos (retrieval) y luego el modelo genera la respuesta apoyado en ellos (generation). Así responde con datos tuyos, no solo con lo que aprendió en su entrenamiento.
Por qué importa a una agencia
Puedes darle a un agente el conocimiento de tu negocio (manuales, políticas, catálogos) sin pagar fine-tuning. Actualizas el conocimiento cambiando los documentos, no el modelo.
Ejemplo
Un chatbot de soporte que responde citando el manual del cliente: busca el fragmento correcto y lo usa para contestar con precisión.
En numeros
Un pipeline tipico de RAG parte los documentos en fragmentos de 500 a 1000 tokens y recupera los 3 a 5 mas relevantes por consulta. A diferencia del fine-tuning, no reentrena nada: actualizar el conocimiento es reindexar un documento, cosa de minutos, mientras que reentrenar un modelo toma horas y presupuesto.