Contexto
Ejecutar un modelo local es sólo una parte del problema. Para trabajar con conocimiento propio, el sistema necesita poder localizar información relevante y proporcionársela al modelo cuando sea necesaria.
Este experimento explora la construcción de una arquitectura RAG completamente local: desde la ingesta y fragmentación de documentos hasta embeddings, búsqueda vectorial y recuperación de contexto para un LLM.
Objetivo
Construir una base sencilla y comprensible antes de añadir más capas.
El flujo que estamos explorando parte de una arquitectura deliberadamente pequeña:
Documents
↓
Parsing
↓
Chunking
↓
Embeddings
↓
Vector store
↓
Retrieval
↓
Context
↓
Local LLM
La prioridad no es ocultar el proceso detrás de un framework, sino entender qué ocurre en cada etapa y qué decisiones afectan realmente a la calidad de la recuperación.
Qué estamos investigando
- estrategias de fragmentación de documentos
- generación local de embeddings
- almacenamiento y búsqueda vectorial
- selección del contexto relevante
- relación entre recuperación y ventana de contexto
- integración con inferencia LLM local
Principio
El conocimiento y la inferencia son problemas distintos.
El modelo no necesita contener toda la información que utilizamos. Parte del conocimiento puede permanecer fuera del modelo, almacenado de forma persistente y recuperado sólo cuando resulta relevante.
Esto permite tratar el conocimiento como una capa independiente del motor de inferencia.
Estado
Activo.
La base está todavía en construcción y la siguiente fase consiste en afinar el pipeline RAG antes de utilizarlo como fundamento para sistemas más específicos.