01 / Visión general
Qué es y qué problema resuelve
Consultar documentación corporativa heterogénea exigía reducir búsquedas manuales sin perder la evidencia que permite verificar cada respuesta.
TFG y prototipo funcional desarrollado sobre documentación corporativa real. No se presenta como un sistema RAG operando actualmente en producción.
02 / Funcionamiento
Cómo funciona el sistema
- 01
Extracción visual página a página y conversión a Markdown jerárquico para documentos con maquetaciones heterogéneas.
- 02
Chunking semántico con rutas de sección, páginas, procedencia, nivel de seguridad y representaciones específicas para búsqueda léxica y vectorial.
- 03
Índices persistentes BM25 y ChromaDB, búsqueda paralela, fusión RRF y reranking de los mejores candidatos antes de generar.
- 04
Contexto numerado y respuesta en streaming con citas, fuentes, puntuaciones y diagnósticos visibles en una interfaz local.
03 / Mi aportación
Qué hice yo
Diseñé e implementé el flujo completo: extracción por página, limpieza, metadatos, chunking, índices, fusión, reranking, generación y validación.
Decisiones principales
- Separar el procesamiento offline de la consulta online para poder reconstruir y auditar cada fase.
- Combinar BM25 y ChromaDB mediante Reciprocal Rank Fusion en lugar de depender de un único recuperador.
- Mantener procedencia explícita en todos los fragmentos y aplicar Jina Reranker antes de generar.
04 / Comprobación y resultado
Cómo comprobé el resultado
La suite cubre extracción, metadatos, limpieza, chunking, BM25, embeddings, recuperación híbrida y generación con clientes simulados. También preparé lotes de preguntas para inspeccionar la evidencia recuperada y comparar BM25, embeddings, RRF y reranking. Las cifras prueban la ejecución del pipeline; no se presentan como una garantía universal de precisión.
Resultado del proyecto
- Pipeline reproducible con artefactos persistentes y reindexación selectiva.
- Respuestas fundamentadas con fuentes identificables y una interfaz de consulta local.
- Validación automatizada de contratos, recuperación y comportamiento del sistema.
05 / Aprendizajes
Qué aprendí durante el desarrollo
La calidad final de un RAG no depende solo del LLM. Una extracción deficiente, una tabla fragmentada sin contexto o una recuperación débil condicionan todo lo que ocurre después. Diseñar trazabilidad desde la ingesta fue tan importante como elegir el modelo generativo.