Squidbrake ajoute l'approbation humaine et les pistes d'audit aux appels d'outils des agents IA
Une nouvelle passerelle open-source intercepte les actions des agents IA, applique des règles et exige une approbation humaine pour les opérations à risque comme les modifications de base de données ou les paiements.
Traduit automatiquement depuis l’original en anglais.
L'utilisateur GitHub batrapulkit a publié Squidbrake, un outil open-source conçu pour agir comme couche de sécurité pour les agents IA autonomes. Publié le 29 septembre 2026, le projet introduit une passerelle auto-hébergée qui intercepte chaque appel d'outil tenté par un agent, le vérifiant contre des règles prédéfinies avant son exécution. Cette approche garantit que les actions à haut risque, telles que les transactions financières ou les modifications de base de données, peuvent être mises en attente pour une revue humaine plutôt que d'être exécutées automatiquement.
Ce qui s'est passé
Squidbrake fonctionne comme un proxy middleware entre les agents IA et les outils qu'ils utilisent, tels que les interfaces en ligne de commande, les systèmes de fichiers ou les API externes. Lorsqu'un agent tente d'effectuer une action, la requête est envoyée d'abord à la passerelle Squidbrake. Le système évalue la requête contre un fichier de configuration nommé rules.yaml, qui définit quelles actions sont autorisées à procéder immédiatement, lesquelles sont entièrement bloquées, et lesquelles nécessitent une approbation manuelle. Contrairement à certains outils de sécurité qui reposent sur de grands modèles de langage (LLM) pour prendre des décisions, Squidbrake utilise des règles déterministes, assurant une application cohérente et prévisible sans la variabilité de l'interprétation par l'IA.
L'outil s'intègre directement aux environnements de développement populaires et aux frameworks d'agents. Il prend en charge Claude Code en s'accrochant à chaque appel d'outil, y compris les commandes bash, les modifications de fichiers et les récupérations web. Il fonctionne également avec toute application utilisant le Model Context Protocol (MCP), permettant d'envelopper les outils pour des plateformes comme Antigravity, Cursor et Claude Desktop. Pour les interactions avec les bases de données, il fournit des garde-fous spécifiques, laissant passer les opérations de lecture tout en mettant en attente les commandes d'écriture, de mise à jour ou de suppression pour approbation. Si la passerelle devient indisponible, le système est conçu pour échouer en mode fermé (« fail closed »), ce qui signifie que les outils protégés ne s'exécuteront pas, empêchant ainsi les actions non surveillées pendant les pannes.
Détails clés
- Application déterministe : Les décisions sont basées sur des règles statiques dans
rules.yaml, et non sur une analyse LLM en temps réel, éliminant l'ambiguïté des politiques de sécurité. - Approbation humaine dans la boucle : Les actions risquées sont suspendues dans un tableau de bord ou via des notifications Slack/téléphone, nécessitant qu'un approbateur désigné autorise ou rejette la tâche.
- Piste d'audit infalsifiable : Chaque événement, y compris les entrées, les sorties et les décisions d'approbation, est enregistré dans un journal en écriture unique qui peut être exporté au format CSV pour les revues de conformité.
- Architecture « fail-closed » : Si le service Squidbrake est hors ligne ou inaccessible, les agents connectés sont bloqués dans l'exécution des outils protégés, privilégiant la sécurité sur la disponibilité.
- Confidentialité auto-hébergée : Le logiciel tourne localement sur un ordinateur portable ou un serveur privé, garantissant que les données sensibles et les charges utiles des outils internes ne quittent jamais l'infrastructure de l'utilisateur.
- Gestion d'équipe : Prend en charge plusieurs utilisateurs avec des clés et des rôles distincts, permettant aux organisations de restreindre les droits d'approbation à des équipes spécifiques, comme la finance pour les virements bancaires.
Contexte
À mesure que les agents IA deviennent plus capables d'interagir avec des systèmes externes, le risque de conséquences involontaires augmente. Un agent pourrait mal interpréter une invite et exécuter une commande destructrice, telle que la suppression d'une base de données de production ou l'envoi d'un remboursement erroné. Les modèles de permissions traditionnels dans les assistants de codage reposent souvent sur de simples invites « autoriser ou demander » qui manquent de contexte ou de conscience historique. Squidbrake répond à cela en introduisant un moteur de politique centralisé qui comprend le contexte d'une action. Il peut détecter des motifs, tels qu'un agent tentant de réessayer une action précédemment rejetée ou interagissant avec un domaine suspect imitant un domaine légitime.
Le Model Context Protocol (MCP) est une norme émergente qui permet aux modèles IA de se connecter de manière sécurisée à diverses sources de données et outils. En prenant en charge MCP, Squidbrake peut protéger un large éventail d'intégrations au-delà de la simple édition de code, incluant Stripe pour les paiements, GitHub pour la gestion des dépôts et les bases de données SQL internes. Cette compatibilité étendue le rend adapté aux entreprises déployant des agents dans différents départements, de l'ingénierie au support client, où les enjeux liés aux erreurs varient considérablement.
Pourquoi c'est important
Pour les équipes gérant leurs propres logiciels, l'introduction d'agents autonomes crée un nouveau vecteur de risque opérationnel. Sans couche de gouvernance, un agent pourrait exposer involontairement des données sensibles ou perturber les services. Squidbrake fournit un plan de contrôle nécessaire qui permet aux responsables IT et aux développeurs de définir des limites claires. En séparant la logique de décision de l'agent lui-même, les organisations peuvent appliquer des politiques de conformité de manière cohérente pour tous les utilisateurs et agents, plutôt que de compter sur la discipline individuelle ou des configurations ad hoc.
La capacité d'auditer chaque action est cruciale pour l'analyse post-incident et la conformité réglementaire. Comme l'outil enregistre le contexte complet de chaque événement, y compris ce qui a conduit à une action spécifique, les équipes peuvent retracer la cause racine des erreurs ou des violations de sécurité. Cette transparence renforce la confiance dans l'adoption de l'IA, car les parties prenantes peuvent voir exactement ce que fait l'agent et qui a approuvé les opérations à haut risque. De plus, la nature auto-hébergée de l'outil répond aux besoins des entreprises qui ne peuvent pas envoyer de code propriétaire ou de données clients à des services cloud tiers pour traitement.
Ce que vous pouvez faire
- Tester la démo en direct : Visitez le dépôt GitHub pour exécuter le bac à sable basé sur navigateur, qui simule un agent gérant des e-mails et bloquant un virement bancaire frauduleux.
- Installer localement : Clonez le dépôt et exécutez le script de démarrage fourni pour configurer la passerelle sur votre machine, générant instantanément des clés admin et agent.
- Définir des règles strictes : Créez un fichier
rules.yamlpour spécifier quels outils nécessitent une approbation, définissez des délais d'expiration et désignez des approbateurs spécifiques pour les catégories sensibles comme les paiements. - Connecter votre agent : Utilisez les scripts de connexion pour intégrer Squidbrake avec Claude Code ou d'autres clients compatibles MCP, en veillant à ce que tous les appels d'outils soient routés via la passerelle.
- Surveiller via le tableau de bord : Ouvrez le tableau de bord local pour visualiser les événements en temps réel, filtrer par statut ou source, et approuver ou rejeter les actions en attente depuis votre bureau ou appareil mobile.
- Configurer l'accès équipe : Générez des clés uniques pour les membres de l'équipe et assignez des rôles d'approbateur pour garantir que seul le personnel autorisé puisse autoriser les opérations à haut risque.



