AI tài liệu & OCR

Hướng dẫn thiết lập GraphRAG cục bộ với Ollama và Chaos Cypher

Một hướng dẫn mới minh họa cách chạy đồ thị tri thức (knowledge graph) cục bộ bằng Ollama và Chaos Cypher, cho phép phân tích tài liệu riêng tư mà không cần API đám mây.

Ảnh xem trước DocBento

Bài được dịch tự động từ bản gốc tiếng Anh.

Một bài hướng dẫn gần đây được công bố vào ngày 28 tháng 9 năm 2026 trình bày phương pháp chạy hoàn toàn trên phần cứng cục bộ cho Graph Retrieval-Augmented Generation (GraphRAG). Hướng dẫn này, do Denis MacPherson viết cho nền tảng Chaos Cypher, minh họa cách kết hợp trình chạy mô hình ngôn ngữ lớn (LLM) cục bộ Ollama với nền tảng Chaos Cypher để xử lý tài liệu một cách bảo mật. Cách tiếp cận này cho phép các nhà phát triển và quản trị hệ thống xây dựng đồ thị tri thức và truy vấn chúng kèm theo trích dẫn nguồn mà không cần gửi dữ liệu đến các dịch vụ đám mây bên ngoài hay chịu phí API.

Điều gì đã xảy ra

Bài viết cung cấp hướng dẫn từng bước để thiết lập một quy trình AI cục bộ nhằm trích xuất thực thể và mối quan hệ từ các tài liệu được tải lên. Quy trình bắt đầu bằng việc cài đặt Ollama và tải về một mô hình cụ thể là qwen3:30b-instruct, yêu cầu khoảng 18 đến 20 GB dung lượng lưu trữ. Trong khi quá trình tải mô hình diễn ra ở chế độ nền, người dùng được hướng dẫn khởi động Chaos Cypher thông qua Docker. Container này mở các cổng 80 và 443 và gắn một volume để lưu trữ dữ liệu bền vững. Trên các hệ thống Linux sử dụng Docker Engine thay vì Docker Desktop, cần cấu hình thêm host gateway để cho phép container giao tiếp với Ollama đang chạy trên máy chủ (host).

Sau khi các dịch vụ trực tuyến, người dùng tải lên một tệp PDF, DOCX hoặc văn bản thuần túy vào giao diện Chaos Cypher. Hệ thống ngay lập tức bắt đầu chỉ mục hóa tài liệu bằng cách chia nhỏ văn bản và tạo embeddings, một quy trình mất khoảng 30 giây cho mỗi 100 trang và không yêu cầu mô hình ngôn ngữ lớn. Sau khi chỉ mục hóa, hệ thống xác định lĩnh vực của tài liệu, chẳng hạn như pháp lý hoặc kỹ thuật, và xếp hàng chờ trích xuất thực thể. Giai đoạn trích xuất này dựa vào mô hình Ollama đã tải trước đó và có thể mất từ năm đến mười phút cho một tài liệu 100 trang. Trong thời gian này, hệ thống xây dựng một đồ thị gồm các nút đại diện cho con người, tổ chức và khái niệm, được kết nối bởi các cạnh định nghĩa mối quan hệ giữa chúng.

Giai đoạn cuối cùng liên quan đến việc truy vấn đồ thị đã tạo thông qua giao diện trò chuyện. Khi người dùng đặt câu hỏi, Chaos Cypher truy xuất các đoạn văn bản liên quan và ngữ cảnh đồ thị, sau đó chuyển chúng cho LLM cục bộ. Mô hình tạo ra câu trả lời kèm theo các trích dẫn nội dòng liên kết trực tiếp đến đoạn văn cụ thể trong tài liệu nguồn nơi tìm thấy thông tin. Bước xác minh này đảm bảo rằng các câu trả lời được dựa trên dữ liệu được cung cấp chứ không phải do ảo giác (hallucinated). Tác giả lưu ý rằng mặc dù mỗi lần tải lên hiện tại đều xây dựng đồ thị riêng, nhưng việc giải quyết xung đột thực thể giữa nhiều nguồn (cross-source entity resolution) đã được lên kế hoạch cho các bản cập nhật trong tương lai.

Chi tiết chính

  • Thiết lập yêu cầu tải xuống mô hình qwen3:30b-instruct, có kích thước khoảng 18-20 GB.
  • Chaos Cypher chạy trong một container Docker và thường mất 30-60 giây để khởi động tất cả các dịch vụ nội bộ.
  • Việc chỉ mục hóa và tạo embeddings diễn ra cục bộ mà không cần mô hình ngôn ngữ lớn, với tốc độ xử lý khoảng 30 giây cho mỗi 100 trang.
  • Trích xuất thực thể sử dụng LLM cục bộ và mất khoảng 5-10 phút cho một tài liệu 100 trang trên mô hình cỡ 30B.
  • Các trích dẫn trong giao diện trò chuyện liên kết đến chính xác các đoạn văn bản, cho phép người dùng xác minh nguồn gốc của từng tuyên bố.
  • Hệ thống hỗ trợ kết hợp xử lý cục bộ để bảo mật với các nhà cung cấp đám mây cho việc trích xuất nếu cần chất lượng cao hơn cho các tài liệu phức tạp.

Bối cảnh

GraphRAG mở rộng Retrieval-Augmented Generation truyền thống bằng cách tích hợp đồ thị tri thức vào quy trình truy xuất. Các hệ thống RAG tiêu chuẩn chia tài liệu thành các đoạn và truy xuất chúng dựa trên mức độ tương đồng ngữ nghĩa, điều này có thể bỏ lỡ các mối quan hệ ngữ cảnh rộng lớn hơn giữa những phần xa nhau của tài liệu. GraphRAG xác định các thực thể như con người, địa điểm và sự kiện, sau đó ánh xạ các mối quan hệ giữa chúng. Cấu trúc này cho phép AI suy luận trên các khái niệm liên kết thay vì chỉ các mảnh vỡ văn bản rời rạc, dẫn đến câu trả lời toàn diện hơn cho các truy vấn phức tạp.

Việc chạy các mô hình này cục bộ giải quyết những lo ngại ngày càng tăng về quyền riêng tư dữ liệu và chi phí vận hành. Bằng cách sử dụng các công cụ như Ollama, các tổ chức có thể giữ tài liệu nhạy cảm trong hạ tầng riêng của họ. Điều này loại bỏ rủi ro rò rỉ dữ liệu sang các nhà cung cấp API bên thứ ba và xóa bỏ các khoản phí sử dụng biến đổi. Tuy nhiên, triển khai cục bộ đòi hỏi tài nguyên phần cứng đủ mạnh, đặc biệt là bộ nhớ GPU, để xử lý tải tính toán của cả việc tạo embeddings và suy luận mô hình ngôn ngữ lớn.

Tại sao điều này quan trọng

Đối với các đội ngũ quản lý tài sản trí tuệ nhạy cảm hoặc dữ liệu được quy định chặt chẽ, khả năng phân tích tài liệu mà không bị lộ ra bên ngoài là rất quan trọng. Các dịch vụ AI dựa trên đám mây thường yêu cầu dữ liệu phải rời khỏi mạng doanh nghiệp, tạo ra rào cản tuân thủ cho các ngành như y tế, tài chính và dịch vụ pháp lý. Cách tiếp cận ưu tiên cục bộ đảm bảo rằng thông tin độc quyền vẫn nằm trên máy chủ nội bộ (on-premises) hoặc trong môi trường đám mây riêng tư. Thiết lập này mang lại cho các lãnh đạo IT toàn quyền kiểm soát việc lưu giữ dữ liệu, nhật ký truy cập và chính sách bảo mật, giúp việc áp dụng AI phù hợp với các tiêu chuẩn quản trị nội bộ nghiêm ngặt.

Ngoài ra, việc thực thi cục bộ mang lại hiệu suất và cấu trúc chi phí dự đoán được. Khác với các API đám mây tính phí theo token hoặc yêu cầu, các mô hình cục bộ có chi phí ban đầu cố định cho phần cứng và điện năng. Một khi mô hình đã được tải xuống, sẽ không có phí định kỳ cho việc truy vấn đồ thị tri thức. Điều này giúp các công ty vừa và nhỏ dễ dàng lập ngân sách cho năng lực AI mà không lo lắng về những đợt tăng đột biến bất ngờ trong hóa đơn sử dụng. Nó cũng giảm sự phụ thuộc vào các nhà cung cấp bên ngoài, đảm bảo hoạt động kinh doanh tiếp tục diễn ra ngay cả khi các dịch vụ bên thứ ba gặp sự cố gián đoạn.

Bạn có thể làm gì

  • Đánh giá phần cứng hiện tại của bạn để đảm bảo nó có đủ VRAM để chạy mô hình 30 tỷ tham số cục bộ, hoặc lên kế hoạch sử dụng một mô hình nhỏ hơn cho giai đoạn thử nghiệm ban đầu.
  • Cài đặt Docker và Ollama trên một máy thử nghiệm để tái tạo quy trình làm việc được mô tả, bắt đầu với một tài liệu nhỏ không nhạy cảm.
  • Cấu hình cẩn thận các thiết lập mạng, đặc biệt nếu sử dụng Docker Engine trên Linux, để đảm bảo giao tiếp an toàn giữa các container và dịch vụ trên máy chủ.
  • Thiết lập một quy trình để xác minh các trích dẫn do AI tạo ra bằng cách lấy mẫu ngẫu nhiên các câu trả lời và kiểm tra độ chính xác của các đoạn nguồn được liên kết.
  • Cân nhắc các phương pháp lai, nơi dữ liệu nhạy cảm vẫn được xử lý cục bộ trong khi các tác vụ ít quan trọng hơn có thể tận dụng tài nguyên đám mây để tăng tốc độ hoặc chất lượng, nếu chính sách cho phép.
  • Giám sát mức sử dụng tài nguyên trong giai đoạn trích xuất để tối ưu hóa các preset VRAM và điều chỉnh kích thước batch để đạt hiệu suất tốt hơn trên phần cứng cụ thể của bạn.

Tin khác

Bảo mật & quyền riêng tư

Tên miền giữ chỗ và các lỗ hổng Citrix đang bị khai thác làm nổi bật rủi ro chuỗi cung ứng

Tin tặc đã đăng ký một tên miền giữ chỗ phổ biến trong tài liệu để phát tán mã độc, trong khi Citrix phải vá khẩn cấp các lỗ hổng nghiêm trọng đang bị khai thác. Những sự cố này tiết lộ những rủi ro tiềm ẩn trong cơ sở hạ tầng tự quản lý (self-hosted).

Tất cả tin