Giảm chi phí LLM bằng cách chuyển việc tổng hợp dữ liệu bảng tính sang phía máy chủ
Một kỹ sư dữ liệu đã giảm mức sử dụng token xuống 2.300 lần đối với các bảng tính lớn bằng cách thực hiện tính toán trên máy chủ cục bộ thay vì gửi các hàng dữ liệu thô đến mô hình AI.
Bài được dịch tự động từ bản gốc tiếng Anh.
Kỹ sư dữ liệu Andrei Kushniarou đã phát triển một máy chủ Model Context Protocol (MCP) cục bộ có tên là gsheets-mcp để xử lý các tập dữ liệu Google Sheets lớn mà không làm ảnh hưởng đến quyền riêng tư hay gây ra chi phí AI quá cao. Được công bố vào cuối tháng 9 năm 2026, bài phân tích kỹ thuật chuyên sâu của anh cho thấy việc chuyển dịch xử lý dữ liệu từ mô hình ngôn ngữ sang máy chủ có thể giúp giảm mức tiêu thụ token từ hàng triệu xuống dưới một nghìn đối với các truy vấn tài chính phức tạp.
Chuyện gì đã xảy ra
Kushniarou cần phân tích các báo cáo thanh toán thương mại điện tử chứa hàng chục nghìn dòng bằng Claude Opus 5.5. Anh từ chối các máy chủ MCP của bên thứ ba do lo ngại về quyền riêng tư dữ liệu và tự xây dựng một giải pháp cục bộ tương tác trực tiếp với API của Google Sheets. Để kiểm thử hệ thống, anh sử dụng một báo cáo Amazon Settlement giả lập gồm 50.009 dòng và 24 cột, yêu cầu mô hình phân tách doanh thu theo loại số tiền. Cách tiếp cận ban đầu là gửi dữ liệu thô đến mô hình tỏ ra kém hiệu quả và tốn kém, dẫn đến một loạt các tối ưu hóa.
Phiên bản đầu tiên của máy chủ trả về dữ liệu dưới dạng JSON thụt lề, tiêu tốn 1,83 triệu token cho một truy vấn duy nhất. Con số này vượt quá giới hạn cửa sổ ngữ cảnh của hầu hết các mô hình và gây ra lỗi phía client trong Claude Code, vốn giới hạn đầu ra của lệnh gọi công cụ ở mức 25.000 token. Ngoài ra, chi phí cho token đầu vào của Opus 5.5 là 4 USD mỗi triệu token, khiến việc đọc lặp lại các tập dữ liệu lớn trở nên không bền vững về mặt tài chính. Kushniarou lưu ý rằng ngay cả khi dữ liệu vừa khớp, việc dựa vào LLM để thực hiện phép tính cộng trên 50.000 dòng là không đáng tin cậy cho mục đích kế toán.
Thông qua các cải tiến lặp đi lặp lại, Kushniarou đã giảm số lượng token xuống chỉ còn 787 cho cùng một truy vấn. Kiến trúc cuối cùng sử dụng phương pháp tổng hợp phía máy chủ, trong đó máy chủ cục bộ thực hiện việc nhóm và tính tổng trước khi chỉ gửi kết quả đến mô hình. Cách tiếp cận này đảm bảo rằng dữ liệu tài chính nhạy cảm vẫn nằm trong hạ tầng của người dùng, đồng thời cung cấp cho AI những bản tóm tắt ngắn gọn, chính xác thay vì các tập dữ liệu thô, nhiễu.
Chi tiết chính
- Hiệu suất kém ban đầu: Máy chủ v0.1 gửi các bản ghi JSON thụt lề, tiêu tốn 1,83 triệu token mỗi truy vấn và vượt quá giới hạn đầu ra của client.
- Tối ưu hóa định dạng: Chuyển từ JSON thụt lề sang Giá trị phân tách bằng Tab (TSV) đã giảm mức sử dụng token mỗi dòng từ 199 xuống 116, tức giảm 42%.
- Lựa chọn cột: Cho phép mô hình yêu cầu các cột cụ thể thay vì toàn bộ hàng đã giảm tổng số token từ 1,03 triệu xuống còn 580.000.
- Tổng hợp phía máy chủ: Hàm
gsheets_aggregatethực hiện các thao tác tính tổng, đếm và nhóm cục bộ, giảm số lượng token cuối cùng xuống còn 787. - Giảm chi phí: Việc tối ưu hóa đã hạ thấp chi phí mỗi truy vấn từ khoảng 23 USD xuống còn 0,39 USD, tức giảm hơn 98%.
- Bảo vệ quyền riêng tư: Tất cả quá trình xử lý dữ liệu diễn ra trên máy chủ cục bộ, đảm bảo rằng các bản ghi tài chính thô không bao giờ được truyền tới các nhà cung cấp AI bên ngoài.
Bối cảnh
Model Context Protocol (MCP) là một tiêu chuẩn mở cho phép các trợ lý AI kết nối an toàn với các nguồn dữ liệu và công cụ cục bộ. Trong bối cảnh này, một máy chủ MCP đóng vai trò là cầu nối giữa mô hình AI và Google Sheets. Thay vì cố gắng diễn giải trực tiếp một bảng tính khổng lồ, mô hình sẽ gửi chỉ thị đến máy chủ MCP, nơi sẽ truy xuất và xử lý dữ liệu. Token là các đơn vị cơ bản của văn bản mà các mô hình ngôn ngữ xử lý; cả văn bản đầu vào và đầu ra đều được chia thành các token. Các định dạng dữ liệu phức tạp như JSON có thụt lề tiêu tốn nhiều token hơn đáng kể so với các định dạng gọn nhẹ như CSV vì chúng lặp lại các khóa và bao gồm các ký tự khoảng trắng.
Tại sao điều này quan trọng
Đối với các đội ngũ vận hành phần mềm nội bộ hoặc quản lý đường ống dữ liệu, nghiên cứu tình huống này làm nổi bật những chi phí ẩn của việc tích hợp AI một cách ngây thơ. Việc gửi các bản dump cơ sở dữ liệu thô hoặc bảng tính lớn đến LLM không chỉ tốn kém mà thường bất khả thi về mặt kỹ thuật do giới hạn cửa sổ ngữ cảnh. Bằng cách đưa việc tính toán gần hơn với dữ liệu, các tổ chức có thể tận dụng AI cho suy luận cấp cao trong khi vẫn dựa vào mã truyền thống, đáng tin cậy cho việc thao tác dữ liệu và tính toán số học. Cách tiếp cận lai này ngăn ngừa hiện tượng "ảo giác" (hallucination) về kết quả toán học và đảm bảo tính toàn vẹn của dữ liệu.
Hơn nữa, các hàm ý về quyền riêng tư rất quan trọng đối với các doanh nghiệp vừa và nhỏ. Nhiều công ty ngần ngại áp dụng các công cụ AI vì sợ lộ dữ liệu khách hàng hoặc hồ sơ tài chính cho các API của bên thứ ba. Kiến trúc máy chủ MCP cục bộ cho phép các công ty này sử dụng các mô hình AI mạnh mẽ để phân tích mà không bao giờ để dữ liệu thô nhạy cảm rời khỏi môi trường được kiểm soát của họ. Thiết lập này tuân thủ các chính sách quản trị dữ liệu nghiêm ngặt trong khi vẫn cho phép tự động hóa nâng cao và tạo ra thông tin chi tiết.
Bạn có thể làm gì
- Kiểm toán định dạng dữ liệu: Kiểm tra xem các công cụ AI của bạn có đang nhận JSON thụt lề hoặc XML dài dòng hay không. Chuyển sang các định dạng gọn nhẹ như CSV hoặc TSV để giảm mức sử dụng token ngay lập tức.
- Triển khai lọc cột: Cấu hình các connector dữ liệu của bạn để cho phép AI chỉ yêu cầu các cột cụ thể cần thiết cho một tác vụ, thay vì tải xuống toàn bộ bảng.
- Chuyển việc tổng hợp sang máy chủ: Sử dụng SQL hoặc script phía máy chủ để thực hiện tính tổng, đếm và trung bình trước khi truyền dữ liệu đến LLM. Đừng bao giờ yêu cầu LLM cộng dồn hàng nghìn dòng.
- Sử dụng máy chủ MCP cục bộ: Đối với dữ liệu nhạy cảm, hãy triển khai các máy chủ MCP cục bộ tương tác với cơ sở dữ liệu hoặc bảng tính nội bộ của bạn, giữ dữ liệu thô trong mạng của bạn.
- Xác minh kiểu dữ liệu: Đảm bảo đường ống dữ liệu của bạn xử lý đúng các định dạng hỗn hợp, chẳng hạn như ký hiệu tiền tệ hoặc phần trăm, trước khi tổng hợp để tránh các lỗi âm thầm.
- Theo dõi mức sử dụng token: Theo dõi số lượng token cho mỗi lệnh gọi công cụ để xác định các điểm kém hiệu quả. Cố gắng giữ kết quả của công cụ dưới giới hạn đầu ra của client để tránh lỗi cắt xén.



