Dokumenten-KI & OCR

Lokales GraphRAG-Setup mit Ollama und Chaos Cypher erklärt

Ein neues Tutorial zeigt, wie Sie ein lokales Wissensgraphen-System mit Ollama und Chaos Cypher betreiben, um Dokumente privat zu analysieren, ohne Cloud-APIs zu nutzen.

Vorschau von DocBento

Automatisch aus dem englischen Original übersetzt.

Ein am 28. September 2026 veröffentlichter Leitfaden beschreibt eine Methode zur vollständigen lokalen Ausführung von Graph Retrieval-Augmented Generation (GraphRAG). Das von Denis MacPherson für Chaos Cypher verfasste Tutorial demonstriert, wie der lokale Large-Language-Model-Runner Ollama mit der Plattform Chaos Cypher kombiniert wird, um Dokumente privat zu verarbeiten. Dieser Ansatz ermöglicht es Entwicklern und Systemadministratoren, Wissensgraphen zu erstellen und diese unter Angabe von Quellenbelegen abzufragen, ohne Daten an externe Cloud-Dienste zu senden oder API-Kosten zu verursachen.

Was passiert ist

Der Artikel bietet eine Schritt-für-Schritt-Anleitung zum Aufbau einer lokalen KI-Pipeline, die Entitäten und Beziehungen aus hochgeladenen Dokumenten extrahiert. Der Prozess beginnt mit der Installation von Ollama und dem Herunterladen eines bestimmten Modells, qwen3:30b-instruct, das etwa 18 bis 20 GB Speicherplatz benötigt. Während dieser Modell-Download im Hintergrund läuft, werden die Benutzer angewiesen, Chaos Cypher über Docker zu starten. Der Container stellt die Ports 80 und 443 bereit und bindet ein Volume zur Datenspeicherung ein. Auf Linux-Systemen, die Docker Engine anstelle von Docker Desktop verwenden, ist eine zusätzliche Host-Gateway-Konfiguration erforderlich, damit der Container mit dem auf dem Host-Rechner laufenden Ollama kommunizieren kann.

Sobald die Dienste online sind, laden Benutzer eine PDF-, DOCX- oder Textdatei in die Chaos-Cypher-Oberfläche hoch. Das System beginnt sofort mit der Indexierung des Dokuments, indem es den Text in Abschnitte unterteilt und Einbettungen (Embeddings) erstellt – ein Vorgang, der etwa 30 Sekunden pro 100 Seiten dauert und kein großes Sprachmodell erfordert. Nach der Indexierung erkennt das System die Domäne des Dokuments, beispielsweise rechtlich oder technisch, und stellt die Extraktion von Entitäten in die Warteschlange. Diese Extraktionsphase nutzt das zuvor heruntergeladene Ollama-Modell und kann bei einem 100-seitigen Dokument fünf bis zehn Minuten dauern. In dieser Zeit baut das System einen Graphen aus Knoten auf, die Personen, Organisationen und Konzepte repräsentieren, verbunden durch Kanten, die ihre Beziehungen definieren.

Die letzte Stufe umfasst die Abfrage des generierten Graphen über eine Chat-Schnittstelle. Wenn ein Benutzer eine Frage stellt, ruft Chaos Cypher relevante Textabschnitte und den Graphenkontext ab und übergibt sie an das lokale LLM. Das Modell generiert eine Antwort mit Inline-Zitaten, die direkt auf den spezifischen Absatz im Quelldokument verweisen, in dem die Information gefunden wurde. Dieser Verifikationsschritt stellt sicher, dass Antworten auf den bereitgestellten Daten basieren und nicht halluziniert sind. Der Autor merkt an, dass jeder Upload derzeit seinen eigenen Graphen aufbaut, die Entitätsauflösung über mehrere Quellen hinweg jedoch für zukünftige Updates geplant ist.

Wichtige Details

  • Für das Setup muss das Modell qwen3:30b-instruct heruntergeladen werden, das ungefähr 18–20 GB groß ist.
  • Chaos Cypher läuft in einem Docker-Container und benötigt typischerweise 30–60 Sekunden, um alle internen Dienste zu starten.
  • Indexierung und Embedding erfolgen lokal ohne das große Sprachmodell mit einer Rate von etwa 30 Sekunden pro 100 Seiten.
  • Die Entitätsextraktion nutzt das lokale LLM und dauert bei einem 100-seitigen Dokument auf einem Modell der 30B-Klasse etwa 5–10 Minuten.
  • Zitate in der Chat-Schnittstelle verlinken auf exakte Textabschnitte, sodass Benutzer die Quelle jeder Aussage überprüfen können.
  • Das System unterstützt die Kombination von lokaler Verarbeitung für Datenschutz mit Cloud-Anbietern für die Extraktion, wenn bei komplexen Dokumenten eine höhere Qualität erforderlich ist.

Hintergrund

GraphRAG erweitert das traditionelle Retrieval-Augmented Generation (RAG), indem Wissensgraphen in den Abrufprozess integriert werden. Standard-RAG-Systeme teilen Dokumente in Abschnitte auf und rufen sie basierend auf semantischer Ähnlichkeit ab, was breitere kontextuelle Beziehungen zwischen entfernten Teilen eines Dokuments übersehen kann. GraphRAG identifiziert Entitäten wie Personen, Orte und Ereignisse und kartiert anschließend die Beziehungen zwischen ihnen. Diese Struktur ermöglicht es der KI, über verbundene Konzepte statt nur über isolierte Textfragmente zu schlussfolgern, was zu umfassenderen Antworten bei komplexen Abfragen führt.

Die lokale Ausführung dieser Modelle adressiert wachsende Bedenken hinsichtlich Datenschutz und Betriebskosten. Durch die Nutzung von Tools wie Ollama können Organisationen sensible Dokumente innerhalb ihrer eigenen Infrastruktur behalten. Dies eliminiert das Risiko von Datenlecks an Drittanbieter-APIs und variable Nutzungsgebühren. Allerdings erfordert die lokale Bereitstellung ausreichende Hardware-Ressourcen, insbesondere GPU-Speicher, um die Rechenlast sowohl für die Erstellung von Embeddings als auch für die Inferenz großer Sprachmodelle zu bewältigen.

Warum es wichtig ist

Für Teams, die sensibles geistiges Eigentum oder regulierte Daten verwalten, ist die Fähigkeit, Dokumente ohne externe Exposition zu analysieren, entscheidend. Cloud-basierte KI-Dienste erfordern oft, dass Daten das Unternehmensnetzwerk verlassen, was Compliance-Hürden für Branchen wie Gesundheitswesen, Finanzen und Rechtsdienstleistungen schafft. Ein lokaler Ansatz stellt sicher, dass proprietäre Informationen vor Ort oder in einer privaten Cloud-Umgebung bleiben. Dieses Setup gibt IT-Leitern volle Kontrolle über Datenaufbewahrung, Zugriffsprotokolle und Sicherheitsrichtlinien und richtet die KI-Nutzung an strengen internen Governance-Standards aus.

Darüber hinaus bietet die lokale Ausführung vorhersehbare Leistung und Kostenstrukturen. Im Gegensatz zu Cloud-APIs, die pro Token oder Anfrage abrechnen, haben lokale Modelle feste Vorabkosten für Hardware und Strom. Sobald das Modell heruntergeladen ist, fallen keine wiederkehrenden Gebühren für die Abfrage des Wissensgraphen an. Dies erleichtert kleinen und mittleren Unternehmen die Budgetplanung für KI-Fähigkeiten, ohne sich Sorgen über unerwartete Spitzen in den Rechnungen machen zu müssen. Es reduziert zudem die Abhängigkeit von externen Anbietern und stellt sicher, dass Geschäftsbetriebe auch dann weiterlaufen, wenn Drittdienstleister Ausfälle erleben.

Was Sie tun können

  • Bewerten Sie Ihre aktuelle Hardware, um sicherzustellen, dass sie über genügend VRAM verfügt, um ein Modell mit 30 Milliarden Parametern lokal auszuführen, oder planen Sie die Verwendung eines kleineren Modells für erste Tests.
  • Installieren Sie Docker und Ollama auf einem Testrechner, um den beschriebenen Workflow nachzubilden, beginnend mit einem kleinen, nicht sensiblen Dokument.
  • Konfigurieren Sie die Netzwerkeinstellungen sorgfältig, insbesondere bei Verwendung von Linux Docker Engine, um eine sichere Kommunikation zwischen Containern und Host-Diensten zu gewährleisten.
  • Etablieren Sie ein Protokoll zur Überprüfung KI-generierter Zitate, indem Sie Antworten zufällig auswählen und die verknüpften Quellabschnitte auf Genauigkeit prüfen.
  • Erwägen Sie hybride Ansätze, bei denen sensible Daten lokal bleiben, während weniger kritische Aufgaben Cloud-Ressourcen für Geschwindigkeit oder Qualität nutzen könnten, sofern die Richtlinien dies zulassen.
  • Überwachen Sie die Ressourcennutzung während der Extraktionsphase, um VRAM-Voreinstellungen zu optimieren und Stapelgrößen für bessere Leistung auf Ihrer spezifischen Hardware anzupassen.

Weitere News

Alle News