Configuration locale de GraphRAG avec Ollama et Chaos Cypher expliquée
Un nouveau tutoriel démontre comment exécuter un graphe de connaissances en local à l'aide d'Ollama et de Chaos Cypher, permettant ainsi l'analyse privée de documents sans recourir aux API cloud.
Traduit automatiquement depuis l’original en anglais.
Un guide récent publié le 28 septembre 2026 décrit une méthode pour exécuter entièrement sur du matériel local la génération augmentée par récupération de graphes (GraphRAG). Le tutoriel, rédigé par Denis MacPherson pour Chaos Cypher, montre comment combiner le moteur local de grands modèles de langage Ollama avec la plateforme Chaos Cypher pour traiter des documents en toute confidentialité. Cette approche permet aux développeurs et aux administrateurs système de construire des graphes de connaissances et de les interroger avec des citations, sans envoyer de données vers des services cloud externes ni engager de coûts liés aux API.
Ce qui s'est passé
L'article propose un guide étape par étape pour mettre en place un pipeline IA local qui extrait les entités et les relations des documents téléchargés. Le processus commence par l'installation d'Ollama et le téléchargement d'un modèle spécifique, qwen3:30b-instruct, qui nécessite environ 18 à 20 Go de stockage. Pendant que ce téléchargement s'effectue en arrière-plan, il est demandé aux utilisateurs de lancer Chaos Cypher via Docker. Le conteneur expose les ports 80 et 443 et monte un volume pour la persistance des données. Sur les systèmes Linux utilisant Docker Engine plutôt que Docker Desktop, une configuration supplémentaire de la passerelle hôte est requise pour permettre au conteneur de communiquer avec Ollama tournant sur la machine hôte.
Une fois les services opérationnels, les utilisateurs téléversent un fichier PDF, DOCX ou texte dans l'interface de Chaos Cypher. Le système commence immédiatement l'indexation du document en découpant le texte et en créant des embeddings (représentations vectorielles), un processus qui prend environ 30 secondes pour 100 pages et ne nécessite pas le grand modèle de langage. Après l'indexation, le système détecte le domaine du document, tel que juridique ou technique, et met en file d'attente l'extraction des entités. Cette phase d'extraction repose sur le modèle Ollama précédemment téléchargé et peut prendre de cinq à dix minutes pour un document de 100 pages. Durant cette période, le système construit un graphe de nœuds représentant des personnes, des organisations et des concepts, connectés par des arêtes qui définissent leurs relations.
La dernière étape consiste à interroger le graphe généré via une interface de chat. Lorsqu'un utilisateur pose une question, Chaos Cypher récupère les fragments de texte pertinents et le contexte du graphe, puis les transmet au LLM local. Le modèle génère une réponse avec des citations en ligne qui renvoient directement au paragraphe spécifique du document source où l'information a été trouvée. Cette étape de vérification garantit que les réponses sont fondées sur les données fournies et non hallucinées. L'auteur note que bien que chaque téléversement construise actuellement son propre graphe, la résolution d'entités inter-sources est prévue pour les mises à jour futures.
Détails clés
- La configuration nécessite le téléchargement du modèle qwen3:30b-instruct, dont la taille est d'environ 18-20 Go.
- Chaos Cypher fonctionne dans un conteneur Docker et prend généralement 30 à 60 secondes pour démarrer tous ses services internes.
- L'indexation et la création d'embeddings se déroulent localement sans utiliser le grand modèle de langage, à un rythme d'environ 30 secondes pour 100 pages.
- L'extraction des entités utilise le LLM local et prend environ 5 à 10 minutes pour un document de 100 pages sur un modèle de classe 30B.
- Les citations dans l'interface de chat renvoient à des fragments de texte exacts, permettant aux utilisateurs de vérifier la source de chaque affirmation.
- Le système permet de mélanger le traitement local pour la confidentialité avec des fournisseurs cloud pour l'extraction si une qualité supérieure est nécessaire pour des documents complexes.
Contexte
GraphRAG étend la génération augmentée par récupération traditionnelle en intégrant des graphes de connaissances dans le processus de récupération. Les systèmes RAG standards divisent les documents en fragments et les récupèrent sur la base de la similarité sémantique, ce qui peut négliger les relations contextuelles plus larges entre des parties éloignées d'un document. GraphRAG identifie des entités telles que des personnes, des lieux et des événements, puis cartographie les relations entre elles. Cette structure permet à l'IA de raisonner sur des concepts connectés plutôt que sur de simples fragments de texte isolés, conduisant à des réponses plus complètes pour les requêtes complexes.
L'exécution locale de ces modèles répond aux préoccupations croissantes concernant la confidentialité des données et les coûts opérationnels. En utilisant des outils comme Ollama, les organisations peuvent garder les documents sensibles au sein de leur propre infrastructure. Cela élimine le risque de fuite de données vers des fournisseurs d'API tiers et supprime les frais d'utilisation variables. Cependant, le déploiement local nécessite des ressources matérielles suffisantes, notamment en mémoire GPU, pour gérer la charge de calcul liée à la création d'embeddings et à l'inférence du grand modèle de langage.
Pourquoi c'est important
Pour les équipes gérant des actifs intellectuels sensibles ou des données réglementées, la capacité d'analyser des documents sans exposition externe est cruciale. Les services IA basés sur le cloud exigent souvent que les données quittent le réseau de l'entreprise, créant des obstacles de conformité pour des secteurs comme la santé, la finance et les services juridiques. Une approche « local-first » garantit que les informations propriétaires restent sur site ou dans un environnement cloud privé. Cette configuration donne aux responsables IT un contrôle total sur la rétention des données, les journaux d'accès et les politiques de sécurité, alignant l'adoption de l'IA sur des normes de gouvernance interne strictes.
De plus, l'exécution locale offre des performances et des structures de coûts prévisibles. Contrairement aux API cloud facturées par jeton ou par requête, les modèles locaux ont un coût initial fixe lié au matériel et à l'électricité. Une fois le modèle téléchargé, il n'y a pas de frais récurrents pour interroger le graphe de connaissances. Cela facilite la budgétisation des capacités IA pour les petites et moyennes entreprises, sans craindre des pics inattendus dans les factures d'utilisation. Cela réduit également la dépendance vis-à-vis des fournisseurs externes, garantissant la continuité des opérations commerciales même en cas de panne des services tiers.
Que pouvez-vous faire
- Évaluez votre matériel actuel pour vous assurer qu'il dispose de suffisamment de VRAM pour exécuter un modèle de 30 milliards de paramètres localement, ou prévoyez d'utiliser un modèle plus petit pour les tests initiaux.
- Installez Docker et Ollama sur une machine de test pour reproduire le workflow décrit, en commençant par un petit document non sensible.
- Configurez soigneusement les paramètres réseau, surtout si vous utilisez Docker Engine sous Linux, pour garantir une communication sécurisée entre les conteneurs et les services hôtes.
- Établissez un protocole pour vérifier les citations générées par l'IA en échantillonnant aléatoirement les réponses et en contrôlant l'exactitude des fragments de source liés.
- Envisagez des approches hybrides où les données sensibles restent locales tandis que les tâches moins critiques pourraient tirer parti des ressources cloud pour la vitesse ou la qualité, si la politique le permet.
- Surveillez l'utilisation des ressources pendant la phase d'extraction afin d'optimiser les préréglages de VRAM et d'ajuster les tailles de lot pour de meilleures performances sur votre matériel spécifique.



