RAG
Recuperar para generar con evidencia
En vez de confiar sólo en la memoria paramétrica, el modelo recupera pasajes de un corpus y genera anclado a ellos.
Intuición
Indexas documentos en un espacio denso; la consulta trae los top-k; el generador los condiciona.
Reduce alucinaciones y permite actualizar conocimiento sin reentrenar.
El laboratorio recupera sobre un corpus mínimo y resalta lo citado.
Mecanismo
Encoder bi-encoder (DPR) o híbrido BM25+denso.
Generación condicionada: concat o cross-attn (FiD).
Variantes: Self-RAG, corrective RAG, graph-RAG, agentic RAG.
Laboratorio
Recuperar y generar
Corpus mínimo de fichas. La consulta recupera top-k (denso+BM25) y el generador resalta los fragmentos usados.
Historia
- 2017
DrQA: recuperar + leer.
Chen et al.
- 2020
RAG (Lewis et al., Facebook).
Lewis et al. (2020), NeurIPS
- 2020
DPR: retrievers densos.
Karpukhin et al.
- 2023
RAG se vuelve el patrón por defecto en producción LLM.
industria
Límites
Si el retriever falla, el generador inventa con confianza.
Contexto finito: ¿qué pasajes caben?
Atribución fiel es más difícil de lo que parece.
¿Saber es recordar o consultar?
La memoria paramétrica comprime el mundo; RAG lo deja en la estantería.
¿Es eso más honesto intelectualmente, o sólo más ingenieril?