Squidbrake añade aprobación humana y registros de auditoría a las llamadas a herramientas de agentes de IA
Un nuevo gateway de código abierto intercepta las acciones de los agentes de IA, aplicando reglas y exigiendo aprobación humana para operaciones riesgosas como cambios en bases de datos o pagos.
Traducido automáticamente del original en inglés.
El usuario de GitHub batrapulkit ha lanzado Squidbrake, una herramienta de código abierto diseñada para actuar como capa de seguridad para agentes de IA autónomos. Publicado el 29 de septiembre de 2026, el proyecto introduce un gateway autoalojado que intercepta cada llamada a herramienta que intenta realizar un agente, verificándola contra reglas predefinidas antes de su ejecución. Este enfoque garantiza que las acciones de alto riesgo, como transacciones financieras o modificaciones de bases de datos, puedan quedar pendientes para revisión humana en lugar de ejecutarse automáticamente.
Qué ocurrió
Squidbrake funciona como un proxy middleware entre los agentes de IA y las herramientas que utilizan, como interfaces de línea de comandos, sistemas de archivos o APIs externas. Cuando un agente intenta realizar una acción, la solicitud se envía primero al gateway de Squidbrake. El sistema evalúa la solicitud contra un archivo de configuración llamado rules.yaml, que define qué acciones pueden proceder inmediatamente, cuáles están bloqueadas por completo y cuáles requieren aprobación manual. A diferencia de algunas herramientas de seguridad que dependen de modelos de lenguaje grandes (LLM) para tomar decisiones, Squidbrake utiliza reglas deterministas, lo que garantiza una aplicación consistente y predecible sin la variabilidad de la interpretación de la IA.
La herramienta se integra directamente con entornos de desarrollo populares y frameworks de agentes. Soporta Claude Code mediante la conexión a cada llamada a herramienta, incluyendo comandos bash, ediciones de archivos y obtenciones web. También funciona con cualquier aplicación que utilice el Model Context Protocol (MCP), permitiendo envolver herramientas para plataformas como Antigravity, Cursor y Claude Desktop. Para interacciones con bases de datos, proporciona salvaguardas específicas, permitiendo que las operaciones de lectura pasen mientras retiene los comandos de escritura, actualización o eliminación para su aprobación. Si el gateway deja de estar disponible, el sistema está diseñado para fallar cerrado (fail-closed), lo que significa que las herramientas protegidas no se ejecutarán, evitando acciones no monitorizadas durante interrupciones.
Detalles clave
- Aplicación determinista: Las decisiones se basan en reglas estáticas en
rules.yaml, no en análisis de LLM en tiempo real, eliminando la ambigüedad de las políticas de seguridad. - Aprobación con intervención humana: Las acciones riesgosas se pausan en un panel de control o mediante notificaciones de Slack/teléfono, requiriendo que un aprobador designado autorice o rechace la tarea.
- Registro de auditoría a prueba de manipulaciones: Cada evento, incluidas entradas, salidas y decisiones de aprobación, se registra en un log de escritura única que puede exportarse a CSV para revisiones de cumplimiento.
- Arquitectura fail-closed: Si el servicio Squidbrake está caído o es inalcanzable, los agentes conectados quedan bloqueados para ejecutar herramientas protegidas, priorizando la seguridad sobre la disponibilidad.
- Privacidad autoalojada: El software se ejecuta localmente en una laptop o servidor privado, asegurando que los datos sensibles y las cargas útiles internas de las herramientas nunca abandonen la infraestructura del usuario.
- Gestión de equipos: Admite múltiples usuarios con claves y roles distintos, permitiendo a las organizaciones restringir los derechos de aprobación a equipos específicos, como finanzas para transferencias bancarias.
Contexto
A medida que los agentes de IA se vuelven más capaces de interactuar con sistemas externos, aumenta el riesgo de consecuencias no deseadas. Un agente podría interpretar mal una indicación y ejecutar un comando destructivo, como eliminar una base de datos de producción o enviar un reembolso erróneo. Los modelos tradicionales de permisos en asistentes de codificación a menudo dependen de simples prompts de permitir-o-preguntar que carecen de contexto o conciencia histórica. Squidbrake aborda esto introduciendo un motor de políticas centralizado que comprende el contexto de una acción. Puede detectar patrones, como un agente intentando reintentar una acción previamente rechazada o interactuando con un dominio sospechoso que imita uno legítimo.
El Model Context Protocol (MCP) es un estándar emergente que permite a los modelos de IA conectarse de forma segura a diversas fuentes de datos y herramientas. Al soportar MCP, Squidbrake puede proteger una amplia gama de integraciones más allá de la simple edición de código, incluyendo Stripe para pagos, GitHub para gestión de repositorios y bases de datos SQL internas. Esta amplia compatibilidad lo hace adecuado para empresas que despliegan agentes en diferentes departamentos, desde ingeniería hasta soporte al cliente, donde los riesgos por error varían significativamente.
Por qué importa
Para los equipos que ejecutan su propio software, la introducción de agentes autónomos crea un nuevo vector de riesgo operativo. Sin una capa de gobernanza, un agente podría exponer inadvertidamente datos sensibles o interrumpir servicios. Squidbrake proporciona un plano de control necesario que permite a los líderes de TI y desarrolladores definir límites claros. Al separar la lógica de decisión del agente mismo, las organizaciones pueden aplicar políticas de cumplimiento de manera consistente en todos los usuarios y agentes, en lugar de depender de la disciplina individual o configuraciones ad-hoc.
La capacidad de auditar cada acción es crítica para el análisis post-incidente y el cumplimiento normativo. Dado que la herramienta registra el contexto completo de cada evento, incluido lo que llevó a una acción específica, los equipos pueden rastrear la causa raíz de errores o violaciones de seguridad. Esta transparencia genera confianza en la adopción de IA, ya que las partes interesadas pueden ver exactamente qué está haciendo el agente y quién aprobó las operaciones de alto riesgo. Además, la naturaleza autoalojada de la herramienta se alinea con las necesidades de empresas que no pueden enviar código propietario o datos de clientes a servicios en la nube de terceros para su procesamiento.
Qué puedes hacer
- Prueba la demo en vivo: Visita el repositorio de GitHub para ejecutar el sandbox basado en navegador, que simula un agente manejando correos electrónicos y bloqueando una transferencia bancaria fraudulenta.
- Instala localmente: Clona el repositorio y ejecuta el script de inicio proporcionado para configurar el gateway en tu máquina, generando claves de administrador y de agente instantáneamente.
- Define reglas estrictas: Crea un archivo
rules.yamlpara especificar qué herramientas requieren aprobación, estableciendo tiempos de espera y designando aprobadores específicos para categorías sensibles como pagos. - Conecta tu agente: Usa los scripts de conexión para integrar Squidbrake con Claude Code u otros clientes compatibles con MCP, asegurando que todas las llamadas a herramientas sean dirigidas a través del gateway.
- Monitorea vía dashboard: Abre el panel de control local para ver eventos en tiempo real, filtrar por estado o fuente, y aprobar o rechazar acciones pendientes desde tu escritorio o dispositivo móvil.
- Configura acceso de equipo: Genera claves únicas para los miembros del equipo y asigna roles de aprobador para asegurar que solo personal autorizado pueda autorizar operaciones de alto riesgo.



