Configuración local de GraphRAG con Ollama y Chaos Cypher explicada
Un nuevo tutorial demuestra cómo ejecutar un grafo de conocimiento local utilizando Ollama y Chaos Cypher, permitiendo el análisis privado de documentos sin APIs en la nube.
Traducido automáticamente del original en inglés.
Una guía reciente publicada el 28 de septiembre de 2026 detalla un método para ejecutar Graph Retrieval-Augmented Generation (GraphRAG) completamente en hardware local. El tutorial, escrito por Denis MacPherson para Chaos Cypher, muestra cómo combinar el ejecutor local de modelos de lenguaje grandes Ollama con la plataforma Chaos Cypher para procesar documentos de forma privada. Este enfoque permite a desarrolladores y administradores de sistemas construir grafos de conocimiento y consultarlos con citas, sin enviar datos a servicios externos en la nube ni incurrir en costos de API.
Qué ocurrió
El artículo ofrece una guía paso a paso para configurar un pipeline de IA local que extrae entidades y relaciones de los documentos cargados. El proceso comienza instalando Ollama y descargando un modelo específico, qwen3:30b-instruct, que requiere aproximadamente entre 18 y 20 GB de almacenamiento. Mientras se descarga el modelo en segundo plano, se instruye al usuario para lanzar Chaos Cypher mediante Docker. El contenedor expone los puertos 80 y 443 y monta un volumen para la persistencia de datos. En sistemas Linux que utilizan Docker Engine en lugar de Docker Desktop, se requiere una configuración adicional del gateway host para permitir que el contenedor se comunique con Ollama, que se ejecuta en la máquina anfitriona.
Una vez que los servicios están en línea, los usuarios suben un archivo PDF, DOCX o de texto a la interfaz de Chaos Cypher. El sistema comienza inmediatamente a indexar el documento dividiendo el texto en fragmentos y creando embeddings, un proceso que tarda unos 30 segundos por cada 100 páginas y no requiere el modelo de lenguaje grande. Tras la indexación, el sistema detecta el dominio del documento, como legal o técnico, y pone en cola la extracción de entidades. Esta fase de extracción depende del modelo de Ollama descargado previamente y puede tardar entre cinco y diez minutos para un documento de 100 páginas. Durante este tiempo, el sistema construye un grafo de nodos que representan personas, organizaciones y conceptos, conectados por aristas que definen sus relaciones.
La etapa final implica consultar el grafo generado a través de una interfaz de chat. Cuando un usuario hace una pregunta, Chaos Cypher recupera fragmentos de texto relevantes y contexto del grafo, pasándolos al LLM local. El modelo genera una respuesta con citas en línea que enlazan directamente al párrafo específico del documento fuente donde se encontró la información. Este paso de verificación asegura que las respuestas estén fundamentadas en los datos proporcionados y no sean alucinaciones. El autor señala que, aunque actualmente cada carga construye su propio grafo, la resolución de entidades entre fuentes está prevista para futuras actualizaciones.
Detalles clave
- La configuración requiere descargar el modelo qwen3:30b-instruct, que tiene un tamaño aproximado de 18-20 GB.
- Chaos Cypher se ejecuta en un contenedor Docker y suele tardar entre 30 y 60 segundos en iniciar todos los servicios internos.
- La indexación y creación de embeddings ocurren localmente sin el modelo de lenguaje grande, procesando a una tasa de aproximadamente 30 segundos por cada 100 páginas.
- La extracción de entidades utiliza el LLM local y tarda unos 5-10 minutos para un documento de 100 páginas en un modelo de clase 30B.
- Las citas en la interfaz de chat enlazan a fragmentos de texto exactos, permitiendo a los usuarios verificar la fuente de cada afirmación.
- El sistema admite mezclar procesamiento local para privacidad con proveedores en la nube para la extracción si se necesita mayor calidad en documentos complejos.
Contexto
GraphRAG extiende la Generación Aumentada por Recuperación tradicional al incorporar grafos de conocimiento en el proceso de recuperación. Los sistemas RAG estándar dividen los documentos en fragmentos y los recuperan basándose en similitud semántica, lo cual puede pasar por alto relaciones contextuales más amplias entre partes distantes de un documento. GraphRAG identifica entidades como personas, lugares y eventos, y luego mapea las relaciones entre ellas. Esta estructura permite a la IA razonar sobre conceptos conectados en lugar de solo fragmentos de texto aislados, generando respuestas más completas para consultas complejas.
Ejecutar estos modelos localmente aborda las crecientes preocupaciones sobre la privacidad de datos y los costos operativos. Al utilizar herramientas como Ollama, las organizaciones pueden mantener documentos sensibles dentro de su propia infraestructura. Esto elimina el riesgo de filtración de datos a proveedores de API de terceros y elimina las tarifas variables de uso. Sin embargo, la implementación local requiere recursos de hardware suficientes, especialmente memoria GPU, para manejar la carga computacional tanto de la creación de embeddings como de la inferencia del modelo de lenguaje grande.
Por qué es importante
Para equipos que gestionan propiedad intelectual sensible o datos regulados, la capacidad de analizar documentos sin exposición externa es crítica. Los servicios de IA en la nube a menudo requieren que los datos salgan de la red corporativa, creando obstáculos de cumplimiento normativo para industrias como la salud, las finanzas y los servicios legales. Un enfoque local-first garantiza que la información propietaria permanezca on-premises o dentro de un entorno de nube privada. Esta configuración otorga a los líderes de TI control total sobre la retención de datos, los registros de acceso y las políticas de seguridad, alineando la adopción de IA con estándares estrictos de gobernanza interna.
Además, la ejecución local ofrece estructuras de rendimiento y costos predecibles. A diferencia de las APIs en la nube que cobran por token o solicitud, los modelos locales tienen un costo inicial fijo en hardware y electricidad. Una vez descargado el modelo, no hay cuotas recurrentes por consultar el grafo de conocimiento. Esto facilita que las pequeñas y medianas empresas presupuesten capacidades de IA sin preocuparse por picos inesperados en las facturas de uso. También reduce la dependencia de proveedores externos, asegurando que las operaciones comerciales continúen incluso si los servicios de terceros experimentan caídas.
Qué puedes hacer
- Evalúa tu hardware actual para asegurar que tenga suficiente VRAM para ejecutar un modelo de 30 mil millones de parámetros localmente, o planifica usar un modelo más pequeño para pruebas iniciales.
- Instala Docker y Ollama en una máquina de prueba para replicar el flujo de trabajo descrito, comenzando con un documento pequeño no sensible.
- Configura cuidadosamente los ajustes de red, especialmente si usas Docker Engine en Linux, para garantizar una comunicación segura entre contenedores y servicios del host.
- Establece un protocolo para verificar las citas generadas por la IA mediante el muestreo aleatorio de respuestas y la comprobación de la precisión de los fragmentos fuente enlazados.
- Considera enfoques híbridos donde los datos sensibles permanecen locales mientras que tareas menos críticas podrían aprovechar recursos en la nube para velocidad o calidad, si la política lo permite.
- Monitorea el uso de recursos durante la fase de extracción para optimizar los presets de VRAM y ajustar los tamaños de lote para mejor rendimiento en tu hardware específico.



