AI & mô hình ngôn ngữ

Squidbrake bổ sung phê duyệt của con người và nhật ký kiểm toán cho các lệnh gọi công cụ của tác nhân AI

Một cổng (gateway) mã nguồn mở mới sẽ chặn các hành động của tác nhân AI, thực thi các quy tắc và yêu cầu sự phê duyệt của con người đối với những thao tác rủi ro cao như thay đổi cơ sở dữ liệu hoặc thanh toán.

Một phanh cơ học đang chặn dòng dữ liệu kỹ thuật số
Ảnh minh họa tạo riêng cho bài viết

Bài được dịch tự động từ bản gốc tiếng Anh.

Người dùng GitHub batrapulkit đã phát hành Squidbrake, một công cụ mã nguồn mở được thiết kế để đóng vai trò là lớp an toàn cho các tác nhân AI tự chủ. Được công bố vào ngày 29 tháng 9 năm 2026, dự án này giới thiệu một cổng tự lưu trữ (self-hosted gateway) có khả năng chặn mọi lệnh gọi công cụ mà tác nhân cố gắng thực hiện, kiểm tra chúng dựa trên các quy tắc định trước trước khi thực thi. Cách tiếp cận này đảm bảo rằng các hành động rủi ro cao, chẳng hạn như giao dịch tài chính hoặc sửa đổi cơ sở dữ liệu, có thể được giữ lại để xem xét bởi con người thay vì tự động thực thi.

Chuyện gì đã xảy ra

Squidbrake hoạt động như một proxy middleware giữa các tác nhân AI và các công cụ mà chúng sử dụng, chẳng hạn như giao diện dòng lệnh, hệ thống tệp hoặc API bên ngoài. Khi một tác nhân cố gắng thực hiện một hành động, yêu cầu đó sẽ được gửi đến cổng Squidbrake trước tiên. Hệ thống đánh giá yêu cầu dựa trên một tệp cấu hình có tên rules.yaml, trong đó xác định những hành động nào được phép tiến hành ngay lập tức, những hành động nào bị chặn hoàn toàn và những hành động nào cần sự phê duyệt thủ công. Khác với một số công cụ bảo mật dựa vào mô hình ngôn ngữ lớn (LLM) để đưa ra phán đoán, Squidbrake sử dụng các quy tắc xác định (deterministic), đảm bảo việc thực thi nhất quán và dễ dự đoán mà không gặp phải sự biến thiên do cách diễn giải của AI.

Công cụ này tích hợp trực tiếp với các môi trường phát triển phổ biến và khung làm việc tác nhân. Nó hỗ trợ Claude Code bằng cách can thiệp vào mọi lệnh gọi công cụ, bao gồm các lệnh bash, chỉnh sửa tệp và truy xuất web. Nó cũng hoạt động với bất kỳ ứng dụng nào sử dụng Model Context Protocol (MCP), cho phép nó bọc các công cụ cho các nền tảng như Antigravity, Cursor và Claude Desktop. Đối với tương tác cơ sở dữ liệu, nó cung cấp các biện pháp bảo vệ cụ thể, cho phép các thao tác đọc đi qua trong khi giữ lại các lệnh ghi, cập nhật hoặc xóa để chờ phê duyệt. Nếu cổng trở nên không khả dụng, hệ thống được thiết kế theo nguyên tắc "fail closed" (mặc định chặn), nghĩa là các công cụ được bảo vệ sẽ không chạy, ngăn ngừa các hành động không được giám sát trong thời gian gián đoạn.

Chi tiết chính

  • Thực thi xác định: Các quyết định dựa trên các quy tắc tĩnh trong rules.yaml, không phải phân tích LLM theo thời gian thực, loại bỏ sự mơ hồ khỏi các chính sách bảo mật.
  • Phê duyệt có sự tham gia của con người (Human-in-the-loop): Các hành động rủi ro sẽ tạm dừng trong bảng điều khiển (dashboard) hoặc thông qua thông báo Slack/điện thoại, yêu cầu một người phê duyệt được chỉ định ủy quyền hoặc từ chối nhiệm vụ.
  • Nhật ký kiểm toán chống giả mạo: Mọi sự kiện, bao gồm đầu vào, đầu ra và các quyết định phê duyệt, đều được ghi lại trong một nhật ký chỉ ghi một lần (write-once log) có thể xuất ra CSV để phục vụ các cuộc rà soát tuân thủ.
  • Kiến trúc fail-closed: Nếu dịch vụ Squidbrake bị sập hoặc không thể truy cập, các tác nhân kết nối sẽ bị chặn không cho thực thi các công cụ được bảo vệ, ưu tiên sự an toàn hơn tính sẵn sàng.
  • Quyền riêng tư tự lưu trữ: Phần mềm chạy cục bộ trên máy tính xách tay hoặc máy chủ riêng, đảm bảo rằng dữ liệu nhạy cảm và tải trọng (payload) của các công cụ nội bộ không bao giờ rời khỏi hạ tầng của người dùng.
  • Quản lý nhóm: Hỗ trợ nhiều người dùng với các khóa và vai trò riêng biệt, cho phép các tổ chức hạn chế quyền phê duyệt cho các nhóm cụ thể, chẳng hạn như bộ phận tài chính cho các chuyển khoản điện tử.

Bối cảnh

Khi các tác nhân AI ngày càng có khả năng tương tác với các hệ thống bên ngoài, rủi ro về những hậu quả không mong muốn cũng tăng lên. Một tác nhân có thể hiểu sai lời nhắc (prompt) và thực thi một lệnh phá hủy, chẳng hạn như xóa cơ sở dữ liệu sản xuất hoặc gửi một khoản hoàn tiền sai. Các mô hình cấp quyền truyền thống trong các trợ lý lập trình thường dựa vào các lời nhắc đơn giản kiểu "cho phép hoặc hỏi" thiếu ngữ cảnh hoặc nhận thức về lịch sử. Squidbrake giải quyết vấn đề này bằng cách giới thiệu một engine chính sách tập trung, hiểu rõ ngữ cảnh của một hành động. Nó có thể phát hiện các mẫu hành vi, chẳng hạn như một tác nhân cố gắng thử lại một hành động đã bị từ chối trước đó hoặc tương tác với một miền đáng ngờ bắt chước một miền hợp lệ.

Model Context Protocol (MCP) là một tiêu chuẩn mới nổi cho phép các mô hình AI kết nối an toàn với nhiều nguồn dữ liệu và công cụ khác nhau. Bằng cách hỗ trợ MCP, Squidbrake có thể bảo vệ phạm vi rộng các tích hợp vượt ra ngoài việc chỉ chỉnh sửa mã, bao gồm Stripe cho thanh toán, GitHub cho quản lý kho lưu trữ và các cơ sở dữ liệu SQL nội bộ. Tính tương thích rộng rãi này khiến nó phù hợp với các công ty triển khai tác nhân ở nhiều phòng ban khác nhau, từ kỹ thuật đến hỗ trợ khách hàng, nơi mức độ rủi ro của lỗi khác nhau đáng kể.

Tại sao điều này quan trọng

Đối với các đội ngũ vận hành phần mềm riêng, việc giới thiệu các tác nhân tự chủ tạo ra một vector rủi ro vận hành mới. Không có lớp quản trị, một tác nhân có thể vô tình lộ dữ liệu nhạy cảm hoặc làm gián đoạn dịch vụ. Squidbrake cung cấp một mặt phẳng điều khiển (control plane) cần thiết, cho phép các trưởng nhóm IT và nhà phát triển xác định các ranh giới rõ ràng. Bằng cách tách logic quyết định khỏi bản thân tác nhân, các tổ chức có thể thực thi nhất quán các chính sách tuân thủ trên tất cả người dùng và tác nhân, thay vì phụ thuộc vào kỷ luật cá nhân hoặc các cấu hình ad-hoc.

Khả năng kiểm toán mọi hành động là rất quan trọng đối với phân tích sau sự cố và tuân thủ quy định. Vì công cụ ghi lại toàn bộ ngữ cảnh của mỗi sự kiện, bao gồm những yếu tố dẫn đến một hành động cụ thể, các đội ngũ có thể truy vết nguyên nhân gốc rễ của lỗi hoặc vi phạm bảo mật. Sự minh bạch này xây dựng niềm tin vào việc áp dụng AI, vì các bên liên quan có thể thấy chính xác những gì tác nhân đang làm và ai đã phê duyệt các hoạt động rủi ro cao. Hơn nữa, tính chất tự lưu trữ của công cụ đáp ứng nhu cầu của các công ty không thể gửi mã độc quyền hoặc dữ liệu khách hàng sang các dịch vụ đám mây của bên thứ ba để xử lý.

Bạn có thể làm gì

  • Thử nghiệm demo trực tiếp: Truy cập kho lưu trữ GitHub để chạy sandbox dựa trên trình duyệt, mô phỏng một tác nhân xử lý email và chặn một chuyển khoản lừa đảo.
  • Cài đặt cục bộ: Nhân bản (clone) kho lưu trữ và chạy script khởi động được cung cấp để thiết lập cổng trên máy của bạn, tạo ngay lập tức các khóa admin và agent.
  • Định nghĩa các quy tắc nghiêm ngặt: Tạo một tệp rules.yaml để chỉ định những công cụ nào cần phê duyệt, thiết lập thời gian chờ và chỉ định những người phê duyệt cụ thể cho các danh mục nhạy cảm như thanh toán.
  • Kết nối tác nhân của bạn: Sử dụng các script kết nối để tích hợp Squidbrake với Claude Code hoặc các client tương thích MCP khác, đảm bảo tất cả các lệnh gọi công cụ đều được định tuyến qua cổng.
  • Giám sát qua dashboard: Mở dashboard cục bộ để xem các sự kiện theo thời gian thực, lọc theo trạng thái hoặc nguồn, và phê duyệt hoặc từ chối các hành động đang chờ xử lý từ máy tính để bàn hoặc thiết bị di động của bạn.
  • Cấu hình quyền truy cập nhóm: Tạo các khóa duy nhất cho các thành viên nhóm và gán các vai trò phê duyệt để đảm bảo rằng chỉ những nhân sự được ủy quyền mới có thể phê duyệt các hoạt động rủi ro cao.

Tin khác

Tất cả tin