Self-Hosting

Neues Open-Source-Tool verwandelt lokale Bücher in strukturierte KI-Kurse

Eine neue selbst gehostete Anwendung namens Tutor konvertiert EPUB- und PDF-Dateien mithilfe großer Sprachmodelle in interaktive Lernpläne.

Books turning into digital network nodes on a server rack
Für diesen Artikel erstellte Illustration

Automatisch aus dem englischen Original übersetzt.

Ein Entwickler hat das Open-Source-Projekt Tutor veröffentlicht, das persönliche digitale Bibliotheken in strukturierte, interaktive Kurse umwandelt. Das Tool wurde am 10. Oktober 2026 von Demetrius Edelin auf GitHub publiziert. Es läuft lokal auf dem Computer des Nutzers und nutzt externe APIs großer Sprachmodelle, um Konzepte aus hochgeladenen Büchern zu vermitteln.

Was passiert ist

Das Projekt befindet sich derzeit in der Version 0.1.0 und ermöglicht es Nutzern, Lernfächer wie SQL oder Rust zu erstellen und diese mit EPUB-Dateien, getaggten PDFs oder Online-Dokumentationen zu füllen. Im Gegensatz zu Standard-Chatbots, die Ad-hoc-Fragen beantworten, analysiert diese Anwendung das Quellmaterial, um Schlüsselkonzepte, fettgedruckte Begriffe und kursiv gesetzte Definitionen zu extrahieren. Anschließend ordnet sie diese Elemente in einer Konzeptkarte an und erstellt einen linearen Lernpfad anstelle eines freien Gesprächs.

Das System arbeitet über eine Befehlszeilenschnittstelle für die Einrichtung und Datenaufnahme, gefolgt von einer browserbasierten Oberfläche für das eigentliche Lernen. Nutzer müssen ihre eigenen API-Schlüssel für unterstützte Anbieter bereitstellen, darunter Anthropic, OpenAI oder OpenRouter. Die Anwendung enthält kein integriertes Modell, sodass alle Verarbeitungskosten und Datenschutzkontrollen beim Nutzer verbleiben. Der Entwickler weist darauf hin, dass das Tool für den Einsatz auf einem einzelnen Rechner durch einen einzelnen Nutzer konzipiert ist, obwohl Container-Support für zukünftige Releases geplant ist.

Wichtige Details

  • Unterstützte Formate: Der Parser verarbeitet EPUB-Dateien optimal und nutzt das Publisher-CSS für die Struktur. Er unterstützt auch getaggte PDFs, lehnt jedoch ungetaggte oder gescannte PDFs ab, es sei denn, das LLM kann Bilder verarbeiten.
  • Modellkompatibilität: Nutzer können Modelle von Anthropic, OpenAI oder OpenRouter auswählen. Jüngste Tests zeigen, dass Claude Haiku 5.5 und GPT-6 Luna gute Ergebnisse liefern, wobei die Reasoning-Level über die Konfiguration angepasst werden können.
  • Aufnahmeprozess: Der Befehl ingest scannt Kapitel und Bilder und speichert die Ergebnisse im Cache, um wiederholte API-Gebühren zu vermeiden. Nutzer können ganze Bücher oder spezifische Kapitel unter Verwendung von Flags wie --chapters aufnehmen.
  • Lernablauf: Die App verfügt über eine Diagnosephase zur Überprüfung vorhandenen Wissens, eine Warteschlange für neue Konzepte und Lektionen, die auf bestimmte Buchabschnitte verweisen. Sie enthält einen Einspruchsmechanismus für fehlerhafte KI-Bewertungen.
  • Technischer Stack: Entwickelt mit TypeScript auf Node.js 22, unter Verwendung von Fastify für den Server, React 19 für das Frontend und SQLite für die lokale Datenspeicherung.
  • Datenschutzkontrollen: Buchtexte und API-Schlüssel werden in einem lokalen Ordner data/ gespeichert, der aus Git ausgeschlossen ist. Der Online-Fetcher respektiert robots.txt und fügt Verzögerungen zwischen Anfragen ein.

Hintergrund

Dieses Tool stellt einen Wandel von Retrieval-Augmented Generation (RAG)-Systemen, die Dokumente lediglich durchsuchen, hin zu agentischen Systemen dar, die Pädagogik strukturieren. Traditionelle RAG-Implementierungen ermöglichen es Nutzern, Fragen zu einem Dokumentenkörper zu stellen und relevante Auszüge zurückzugeben. Im Gegensatz dazu führt diese Anwendung eine semantische Analyse durch, um Unterrichtseinheiten – Konzepte – zu identifizieren und den Meisterschaftsstatus des Nutzers über die Zeit zu verfolgen. Sie stützt sich auf die strukturellen Metadaten digitaler Bücher, wie Überschriftenhierarchien und typografische Hervorhebungen, um festzustellen, was eine lernbare Einheit darstellt. Durch die lokale Ausführung vermeidet sie das kontinuierliche Senden ganzer Buchinhalte an Drittanbieterserver und sendet nur spezifische Abschnitte während der Generierungsphase der Lektion.

Warum es wichtig ist

Für Teams und Einzelpersonen, die proprietäre Dokumentation oder spezialisierte technische Bibliotheken verwalten, bietet dieser Ansatz eine Möglichkeit, Wissen zu institutionalisieren, ohne auf öffentliche Cloud-Trainingsdaten angewiesen zu sein. Selbsthosting stellt sicher, dass sensible interne Handbücher oder gekaufte technische Referenzen unter lokaler Kontrolle bleiben. Die Fähigkeit, statische PDFs und EPUBs in interaktive Lehrpläne umzuwandeln, reduziert die Hürden bei der Einarbeitung neuer Teammitglieder in komplexe Codebasen oder regulatorische Rahmenwerke. Es verwandelt passives Lesen in aktive Verifizierung und stellt sicher, dass Lernende das Material tatsächlich verstehen, anstatt es nur zu überfliegen.

Darüber hinaus entspricht das Bring-your-own-Key-Modell kostenbewussten Engineering-Praktiken. Organisationen können die API-Nutzung präzise überwachen und aufgenommene Inhalte cachen, um redundante Verarbeitungsgebühren zu verhindern. Dies steht im Gegensatz zu abonnementbasierten Lernplattformen, bei denen der Inhalt fixiert und die Preisgestaltung intransparent ist. Für IT-Leads bedeutet die Anforderung von Node.js 22 und lokalen SQLite-Datenbanken, dass das Tool auf bestehenden Entwicklungsworkstations ohne hohen Infrastruktur-Aufwand eingesetzt werden kann, although der fehlende Multi-User-Support die Nutzung in kollaborativen Teamumgebungen derzeit einschränkt.

Was Sie tun können

  • Installieren Sie Node.js 22 oder höher und klonen Sie das Repository von GitHub, um die Aufnahmepipeline mit einer Beispiel-EPUB-Datei zu testen.
  • Konfigurieren Sie eine .env-Datei mit API-Schlüsseln von Anthropic, OpenAI oder OpenRouter und wählen Sie ein Modell, das für Reasoning-Aufgaben optimiert ist.
  • Verwenden Sie den Befehl npm run parse, um Kapitelstrukturen und Konzeptextraktion vor der vollständigen Datenbankaufnahme zu überprüfen.
  • Beginnen Sie mit getaggten PDFs oder nativen EPUBs, um eine genaue Konzeptabbildung zu gewährleisten, und vermeiden Sie gescannte Dokumente ohne Textebene.
  • Überwachen Sie API-Kosten, indem Sie während der initialen Einrichtung das Flag --preview verwenden, um den Tokenverbrauch für große Lehrbücher oder Dokumentationssets zu schätzen.
  • Geben Sie Feedback im GitHub-Repository bezüglich der geplanten Container-Image-Funktion, wenn serverbasierte Bereitstellung für Ihren Workflow erforderlich ist.

Weitere News

Alle News