Réduction des coûts des LLM en déplaçant l'agrégation de feuilles de calcul côté serveur
Un ingénieur data a réduit la consommation de tokens par un facteur de 2 300 pour les grandes feuilles de calcul en effectuant les calculs sur un serveur local plutôt qu'en envoyant les lignes brutes à un modèle d'IA.
Traduit automatiquement depuis l’original en anglais.
L'ingénieur data Andrei Kushniarou a développé un serveur local Model Context Protocol (MCP) nommé gsheets-mcp pour gérer de grands jeux de données Google Sheets sans compromettre la confidentialité ni engendrer de coûts excessifs liés à l'IA. Publié fin septembre 2026, son analyse technique approfondie démontre comment le transfert du traitement des données du modèle linguistique vers le serveur peut réduire la consommation de tokens de plusieurs millions à moins d'un millier pour des requêtes financières complexes.
Ce qui s'est passé
Kushniarou devait analyser des rapports de règlement e-commerce contenant des dizaines de milliers de lignes à l'aide de Claude Opus 5.5. Il a rejeté les serveurs MCP tiers en raison de préoccupations liées à la confidentialité des données et a construit une solution locale qui interagit directement avec l'API Google Sheets. Pour tester le système, il a utilisé un rapport Amazon Settlement synthétique comportant 50 009 lignes et 24 colonnes, demandant au modèle de ventiler les revenus par type de montant. L'approche initiale consistant à envoyer les données brutes au modèle s'est avérée inefficace et coûteuse, ce qui a conduit à une série d'optimisations.
La première version du serveur renvoyait les données sous forme de JSON indenté, générant 1,83 million de tokens pour une seule requête. Cela dépassait les limites de fenêtre de contexte de la plupart des modèles et déclenchait des erreurs côté client dans Claude Code, qui plafonne les sorties d'appels d'outils à 25 000 tokens. De plus, le coût des tokens d'entrée pour Opus 5.5 est de 4 $ par million, rendant les lectures répétées de grands jeux de données financièrement intenable. Kushniarou a noté que même si les données tenaient dans la limite, se fier à un LLM pour effectuer des calculs arithmétiques sur 50 000 lignes n'est pas fiable à des fins comptables.
Grâce à des améliorations itératives, Kushniarou a réduit le nombre de tokens à seulement 787 pour la même requête. L'architecture finale utilise l'agrégation côté serveur, où le serveur local effectue les regroupements et les sommes avant d'envoyer uniquement les résultats au modèle. Cette approche garantit que les données financières sensibles restent au sein de l'infrastructure de l'utilisateur tout en fournissant à l'IA des résumés concis et précis plutôt que des jeux de données bruts et bruités.
Points clés
- Inefficacité initiale : Le serveur v0.1 envoyait des enregistrements JSON indentés, coûtant 1,83 million de tokens par requête et dépassant les limites de sortie du client.
- Optimisation du format : Le passage du JSON indenté aux valeurs séparées par des tabulations (TSV) a réduit l'utilisation de tokens par ligne de 199 à 116, soit une diminution de 42 %.
- Sélection des colonnes : Permettre au modèle de demander des colonnes spécifiques plutôt que des lignes entières a réduit le total des tokens de 1,03 million à 580 000.
- Agrégation côté serveur : La fonction
gsheets_aggregateeffectue les opérations de somme, de comptage et de regroupement localement, réduisant le nombre final de tokens à 787. - Réduction des coûts : L'optimisation a fait baisser le coût par requête d'environ 23 $ à 0,39 $, soit une réduction de plus de 98 %.
- Préservation de la confidentialité : Tout le traitement des données s'effectue sur un serveur local, garantissant que les registres financiers bruts ne sont jamais transmis à des fournisseurs d'IA externes.
Contexte
Le Model Context Protocol (MCP) est un standard ouvert qui permet aux assistants IA de se connecter en toute sécurité à des sources de données et des outils locaux. Dans ce contexte, un serveur MCP agit comme un pont entre le modèle IA et Google Sheets. Au lieu que le modèle tente d'interpréter directement une immense feuille de calcul, il envoie des instructions au serveur MCP, qui récupère et traite les données. Les tokens sont les unités de base du texte traitées par les modèles linguistiques ; le texte d'entrée et de sortie est divisé en tokens. Les formats de données complexes comme le JSON avec indentation consomment considérablement plus de tokens que les formats compacts comme le CSV car ils répètent les clés et incluent des caractères d'espace blanc.
Pourquoi c'est important
Pour les équipes qui exécutent leurs propres logiciels ou gèrent des pipelines de données internes, cette étude de cas met en lumière les coûts cachés de l'intégration naïve de l'IA. Envoyer des dumps de bases de données bruts ou de grandes feuilles de calcul à un LLM est non seulement coûteux, mais souvent techniquement impossible en raison des limites de la fenêtre de contexte. En rapprochant le calcul des données, les organisations peuvent tirer parti de l'IA pour le raisonnement de haut niveau tout en s'appuyant sur du code traditionnel et fiable pour la manipulation des données et les calculs arithmétiques. Cette approche hybride empêche l'« hallucination » de résultats mathématiques et assure l'intégrité des données.
De plus, les implications en matière de confidentialité sont significatives pour les petites et moyennes entreprises. Beaucoup hésitent à adopter des outils d'IA par crainte d'exposer les données clients ou les registres financiers à des API tierces. Une architecture de serveur MCP local permet à ces entreprises d'utiliser des modèles d'IA puissants pour l'analyse sans jamais laisser les données brutes sensibles quitter leur environnement contrôlé. Cette configuration est conforme aux politiques strictes de gouvernance des données tout en permettant une automatisation avancée et la génération d'informations.
Ce que vous pouvez faire
- Auditez vos formats de données : Vérifiez si vos outils d'IA reçoivent du JSON indenté ou du XML verbeux. Passez à des formats compacts comme CSV ou TSV pour réduire immédiatement l'utilisation de tokens.
- Implémentez le filtrage par colonnes : Configurez vos connecteurs de données pour permettre à l'IA de demander uniquement les colonnes spécifiques nécessaires à une tâche, plutôt que de télécharger des tables entières.
- Déplacez l'agrégation côté serveur : Utilisez SQL ou des scripts côté serveur pour effectuer les sommes, les comptages et les moyennes avant de passer les données au LLM. Ne demandez jamais à un LLM de sommer des milliers de lignes.
- Utilisez des serveurs MCP locaux : Pour les données sensibles, déployez des serveurs MCP locaux qui interagissent avec vos bases de données ou feuilles de calcul internes, gardant les données brutes au sein de votre réseau.



