Proyectos
01 / 04

Trabajo de Fin de Grado · 2026

RAG híbrido para documentación corporativa

Un RAG auditable construido de extremo a extremo: procesa documentación heterogénea, combina BM25 y búsqueda vectorial, rerankea la evidencia y conserva trazabilidad hasta la página para que cada respuesta pueda verificarse.

01 / Visión general

Qué es y qué problema resuelve

Consultar documentación corporativa heterogénea exigía reducir búsquedas manuales sin perder la evidencia que permite verificar cada respuesta.

TFG y prototipo funcional desarrollado sobre documentación corporativa real. No se presenta como un sistema RAG operando actualmente en producción.

02 / Funcionamiento

Cómo funciona el sistema

  1. 01

    Extracción visual página a página y conversión a Markdown jerárquico para documentos con maquetaciones heterogéneas.

  2. 02

    Chunking semántico con rutas de sección, páginas, procedencia, nivel de seguridad y representaciones específicas para búsqueda léxica y vectorial.

  3. 03

    Índices persistentes BM25 y ChromaDB, búsqueda paralela, fusión RRF y reranking de los mejores candidatos antes de generar.

  4. 04

    Contexto numerado y respuesta en streaming con citas, fuentes, puntuaciones y diagnósticos visibles en una interfaz local.

03 / Mi aportación

Qué hice yo

Diseñé e implementé el flujo completo: extracción por página, limpieza, metadatos, chunking, índices, fusión, reranking, generación y validación.

Decisiones principales

  • Separar el procesamiento offline de la consulta online para poder reconstruir y auditar cada fase.
  • Combinar BM25 y ChromaDB mediante Reciprocal Rank Fusion en lugar de depender de un único recuperador.
  • Mantener procedencia explícita en todos los fragmentos y aplicar Jina Reranker antes de generar.

04 / Comprobación y resultado

Cómo comprobé el resultado

La suite cubre extracción, metadatos, limpieza, chunking, BM25, embeddings, recuperación híbrida y generación con clientes simulados. También preparé lotes de preguntas para inspeccionar la evidencia recuperada y comparar BM25, embeddings, RRF y reranking. Las cifras prueban la ejecución del pipeline; no se presentan como una garantía universal de precisión.

Resultado del proyecto

  • Pipeline reproducible con artefactos persistentes y reindexación selectiva.
  • Respuestas fundamentadas con fuentes identificables y una interfaz de consulta local.
  • Validación automatizada de contratos, recuperación y comportamiento del sistema.

05 / Aprendizajes

Qué aprendí durante el desarrollo

La calidad final de un RAG no depende solo del LLM. Una extracción deficiente, una tabla fragmentada sin contexto o una recuperación débil condicionan todo lo que ocurre después. Diseñar trazabilidad desde la ingesta fue tan importante como elegir el modelo generativo.

Presentación técnica

Fases y estructura de un RAG explicadas

Presentación de 26 minutos en la que explico la arquitectura completa, los problemas encontrados y las decisiones tomadas durante el desarrollo.