Squidbrake ergänzt KI-Agenten-Tool-Aufrufe um menschliche Genehmigung und Audit-Trails
Ein neues Open-Source-Gateway fängt Aktionen von KI-Agenten ab, erzwingt Regeln und verlangt für riskante Operationen wie Datenbankänderungen oder Zahlungen eine menschliche Genehmigung.
Automatisch aus dem englischen Original übersetzt.
Der GitHub-Nutzer batrapulkit hat Squidbrake veröffentlicht, ein Open-Source-Tool, das als Sicherheitsschicht für autonome KI-Agenten fungiert soll. Das am 29. September 2026 vorgestellte Projekt stellt ein selbst gehostetes Gateway vor, das jeden Tool-Aufruf eines Agenten abfängt und vor der Ausführung anhand vordefinierter Regeln prüft. Dieser Ansatz stellt sicher, dass risikoreiche Aktionen, wie Finanztransaktionen oder Datenbankmodifikationen, zur menschlichen Überprüfung angehalten werden können, anstatt automatisch ausgeführt zu werden.
Was ist passiert
Squidbrake fungiert als Middleware-Proxy zwischen KI-Agenten und den von ihnen genutzten Tools, wie z. B. Befehlszeilenschnittstellen, Dateisystemen oder externen APIs. Wenn ein Agent versucht, eine Aktion auszuführen, wird die Anfrage zunächst an das Squidbrake-Gateway gesendet. Das System bewertet die Anfrage anhand einer Konfigurationsdatei namens rules.yaml, in der festgelegt ist, welche Aktionen sofort ausgeführt werden dürfen, welche vollständig blockiert sind und welche eine manuelle Genehmigung erfordern. Im Gegensatz zu einigen Sicherheitstools, die auf großen Sprachmodellen basieren, um Entscheidungen zu treffen, nutzt Squidbrake deterministische Regeln. Dies gewährleistet eine konsistente und vorhersehbare Durchsetzung ohne die Variabilität der KI-Interpretation.
Das Tool integriert sich direkt in gängige Entwicklungsumgebungen und Agent-Frameworks. Es unterstützt Claude Code, indem es sich in jeden Tool-Aufruf einklinkt, einschließlich Bash-Befehlen, Dateiänderungen und Webabrufen. Es funktioniert auch mit jeder Anwendung, die das Model Context Protocol (MCP) verwendet, sodass Tools für Plattformen wie Antigravity, Cursor und Claude Desktop umhüllt werden können. Für Datenbankinteraktionen bietet es spezifische Schutzmechanismen: Lesevorgänge werden durchgelassen, während Schreib-, Update- oder Löschbefehle zur Genehmigung angehalten werden. Falls das Gateway nicht verfügbar ist, ist das System so konzipiert, dass es im Fehlerfall geschlossen bleibt (fail-closed). Das bedeutet, dass geschützte Tools nicht ausgeführt werden, was unüberwachte Aktionen bei Ausfällen verhindert.
Wichtige Details
- Deterministische Durchsetzung: Entscheidungen basieren auf statischen Regeln in
rules.yamlund nicht auf Echtzeit-Analysen durch LLMs, was Mehrdeutigkeiten aus Sicherheitsrichtlinien eliminiert. - Human-in-the-loop-Genehmigung: Riskante Aktionen pausieren in einem Dashboard oder über Slack-/Telefonbenachrichtigungen und erfordern, dass ein designated Approver die Aufgabe genehmigt oder ablehnt.
- Manipulationssichere Audit-Trails: Jedes Ereignis, einschließlich Eingaben, Ausgaben und Genehmigungsentscheidungen, wird in einem Write-once-Protokoll aufgezeichnet, das für Compliance-Prüfungen als CSV exportiert werden kann.
- Fail-Closed-Architektur: Wenn der Squidbrake-Dienst ausgefallen oder nicht erreichbar ist, werden verbundene Agenten daran gehindert, geschützte Tools auszuführen, wobei Sicherheit Vorrang vor Verfügbarkeit hat.
- Selbst gehostete Privatsphäre: Die Software läuft lokal auf einem Laptop oder privaten Server, sodass sensible Daten und interne Tool-Payloads niemals die Infrastruktur des Nutzers verlassen.
- Teamverwaltung: Unterstützt mehrere Benutzer mit unterschiedlichen Schlüsseln und Rollen, sodass Organisationen Genehmigungsrechte bestimmten Teams zuweisen können, z. B. der Finanzabteilung für Überweisungen.
Hintergrund
Da KI-Agenten immer besser in der Lage sind, mit externen Systemen zu interagieren, wächst das Risiko unbeabsichtigter Konsequenzen. Ein Agent könnte einen Prompt falsch interpretieren und einen destruktiven Befehl ausführen, wie z. B. das Löschen einer Produktionsdatenbank oder das Senden einer fehlerhaften Rückerstattung. Traditionelle Berechtigungsmodelle in Coding-Assistenten verlassen sich oft auf einfache „Erlauben oder Fragen“-Prompts, denen Kontext oder historisches Bewusstsein fehlen. Squidbrake adressiert dies durch die Einführung einer zentralisierten Policy-Engine, die den Kontext einer Aktion versteht. Sie kann Muster erkennen, wie z. B. wenn ein Agent versucht, eine zuvor abgelehnte Aktion erneut zu versuchen, oder mit einer verdächtigen Domain interagiert, die eine legitime Domain imitiert.
Das Model Context Protocol (MCP) ist ein aufstrebender Standard, der es KI-Modellen ermöglicht, sicher mit verschiedenen Datenquellen und Tools zu verbinden. Durch die Unterstützung von MCP kann Squidbrake eine breite Palette von Integrationen schützen, die über reine Codebearbeitung hinausgehen, einschließlich Stripe für Zahlungen, GitHub für Repository-Verwaltung und interne SQL-Datenbanken. Diese breite Kompatibilität macht es geeignet für Unternehmen, die Agenten in verschiedenen Abteilungen einsetzen, vom Engineering bis zum Kundensupport, wo die Risiken für Fehler erheblich variieren.
Warum es wichtig ist
Für Teams, die ihre eigene Software betreiben, schaffen autonome Agenten eine neue Angriffsfläche für operative Risiken. Ohne eine Governance-Schicht könnte ein Agent versehentlich sensible Daten preisgeben oder Dienste stören. Squidbrake bietet eine notwendige Kontroll-Ebene, die es IT-Leitern und Entwicklern ermöglicht, klare Grenzen zu definieren. Indem die Entscheidungslogik vom Agenten selbst getrennt wird, können Organisationen Compliance-Richtlinien konsistent über alle Benutzer und Agenten hinweg durchsetzen, anstatt sich auf individuelle Disziplin oder Ad-hoc-Konfigurationen zu verlassen.
Die Möglichkeit, jede Aktion zu auditieren, ist kritisch für die Analyse nach Vorfällen und die regulatorische Compliance. Da das Tool den vollständigen Kontext jedes Ereignisses aufzeichnet, einschließlich dessen, was zu einer spezifischen Aktion geführt hat, können Teams die Ursache von Fehlern oder Sicherheitsverletzungen nachverfolgen. Diese Transparenz schafft Vertrauen in die Adoption von KI, da Stakeholder genau sehen können, was der Agent tut und wer risikoreiche Operationen genehmigt hat. Darüber hinaus entspricht die selbst gehostete Natur des Tools den Bedürfnissen von Unternehmen, die proprietären Code oder Kundendaten nicht zur Verarbeitung an Drittanbieter-Cloud-Dienste senden können.
Was Sie tun können
- Live-Demo testen: Besuchen Sie das GitHub-Repository, um die browserbasierte Sandbox auszuführen, die simuliert, wie ein Agent E-Mails bearbeitet und eine betrügerische Überweisung blockiert.
- Lokal installieren: Klonen Sie das Repository und führen Sie das bereitgestellte Startskript aus, um das Gateway auf Ihrem Rechner einzurichten; Admin- und Agentenschlüssel werden sofort generiert.
- Strenge Regeln definieren: Erstellen Sie eine
rules.yaml-Datei, um festzulegen, welche Tools eine Genehmigung erfordern, setzen Sie Timeouts und weisen Sie bestimmte Approver für sensible Kategorien wie Zahlungen zu. - Agenten verbinden: Verwenden Sie die Verbindungsskripte, um Squidbrake mit Claude Code oder anderen MCP-kompatiblen Clients zu integrieren, sodass alle Tool-Aufrufe über das Gateway geleitet werden.
- Über Dashboard überwachen: Öffnen Sie das lokale Dashboard, um Echtzeit-Ereignisse anzuzeigen, nach Status oder Quelle zu filtern und ausstehende Aktionen von Ihrem Desktop oder Mobilgerät aus zu genehmigen oder abzulehnen.
- Teamzugriff konfigurieren: Generieren Sie eindeutige Schlüssel für Teammitglieder und weisen Sie Approver-Rollen zu, um sicherzustellen, dass nur autorisiertes Personal risikoreiche Operationen genehmigen kann.



