Datos y hojas de cálculo

Reducir los costes de los LLM trasladando la agregación de hojas de cálculo al lado del servidor

Un ingeniero de datos redujo el uso de tokens en 2.300 veces para grandes hojas de cálculo realizando cálculos en un servidor local en lugar de enviar filas sin procesar a un modelo de IA.

Vista previa de Excel Import Mapper

Traducido automáticamente del original en inglés.

El ingeniero de datos Andrei Kushniarou desarrolló un servidor local de Model Context Protocol (MCP) llamado gsheets-mcp para gestionar grandes conjuntos de datos de Google Sheets sin comprometer la privacidad ni incurrir en costes excesivos de IA. Publicado a finales de septiembre de 2026, su análisis técnico detallado demuestra cómo desplazar el procesamiento de datos desde el modelo de lenguaje hacia el servidor puede reducir el consumo de tokens de millones a menos de mil para consultas financieras complejas.

Qué ocurrió

Kushniarou necesitaba analizar informes de liquidación de comercio electrónico que contenían decenas de miles de filas utilizando Claude Opus 5.5. Rechazó los servidores MCP de terceros debido a preocupaciones sobre la privacidad de los datos y construyó una solución local que interactúa directamente con la API de Google Sheets. Para probar el sistema, utilizó un informe sintético de Amazon Settlement con 50.009 filas y 24 columnas, pidiendo al modelo que desglosara los ingresos por tipo de importe. El enfoque inicial de enviar datos sin procesar al modelo resultó ineficiente y costoso, lo que motivó una serie de optimizaciones.

La primera versión del servidor devolvía los datos como JSON indentado, lo que resultaba en 1,83 millones de tokens para una sola consulta. Esto superaba los límites de la ventana de contexto de la mayoría de los modelos y provocaba errores en el lado del cliente en Claude Code, que limita las salidas de las llamadas a herramientas a 25.000 tokens. Además, el coste de los tokens de entrada para Opus 5.5 es de 4 dólares por millón, lo que hace insostenible financieramente la lectura repetida de grandes conjuntos de datos. Kushniarou señaló que, incluso si los datos cupieran, depender de un LLM para realizar operaciones aritméticas sobre 50.000 filas no es fiable para fines contables.

Mediante mejoras iterativas, Kushniarou redujo el recuento de tokens a solo 787 para la misma consulta. La arquitectura final utiliza la agregación en el lado del servidor, donde el servidor local realiza agrupamientos y sumatorias antes de enviar únicamente los resultados al modelo. Este enfoque garantiza que los datos financieros sensibles permanezcan dentro de la infraestructura del usuario mientras se proporciona a la IA resúmenes concisos y precisos en lugar de conjuntos de datos brutos y ruidosos.

Detalles clave

  • Ineficiencia inicial: El servidor v0.1 enviaba registros JSON indentados, costando 1,83 millones de tokens por consulta y superando los límites de salida del cliente.
  • Optimización de formato: Cambiar de JSON indentado a Valores Separados por Tabuladores (TSV) redujo el uso de tokens por fila de 199 a 116, una disminución del 42%.
  • Selección de columnas: Permitir que el modelo solicite columnas específicas en lugar de filas completas redujo el total de tokens de 1,03 millones a 580.000.
  • Agregación en el lado del servidor: La función gsheets_aggregate realiza operaciones de suma, conteo y agrupamiento localmente, reduciendo el recuento final de tokens a 787.
  • Reducción de costes: La optimización bajó el coste por consulta de aproximadamente 23 dólares a 0,39 dólares, una reducción de más del 98%.
  • Preservación de la privacidad: Todo el procesamiento de datos ocurre en un servidor local, asegurando que los registros financieros brutos nunca se transmitan a proveedores externos de IA.

Antecedentes

Model Context Protocol (MCP) es un estándar abierto que permite a los asistentes de IA conectarse de forma segura a fuentes de datos y herramientas locales. En este contexto, un servidor MCP actúa como puente entre el modelo de IA y Google Sheets. En lugar de que el modelo intente interpretar una hoja de cálculo masiva directamente, envía instrucciones al servidor MCP, que recupera y procesa los datos. Los tokens son las unidades básicas de texto que procesan los modelos de lenguaje; tanto el texto de entrada como el de salida se dividen en tokens. Los formatos de datos complejos como JSON con indentación consumen significativamente más tokens que los formatos compactos como CSV porque repiten claves e incluyen caracteres de espacio en blanco.

Por qué importa

Para equipos que ejecutan su propio software o gestionan pipelines internos de datos, este caso de estudio destaca los costes ocultos de la integración ingenua de IA. Enviar volcados de bases de datos sin procesar o grandes hojas de cálculo a un LLM no solo es caro, sino a menudo técnicamente imposible debido a los límites de la ventana de contexto. Al mover el cómputo más cerca de los datos, las organizaciones pueden aprovechar la IA para razonamientos de alto nivel mientras confían en código tradicional y fiable para la manipulación de datos y la aritmética. Este enfoque híbrido previene la "alucinación" de resultados matemáticos y garantiza la integridad de los datos.

Además, las implicaciones de privacidad son significativas para pequeñas y medianas empresas. Muchas negocios dudan en adoptar herramientas de IA porque temen exponer datos de clientes o registros financieros a APIs de terceros. Una arquitectura de servidor MCP local permite a estas empresas utilizar potentes modelos de IA para análisis sin dejar que los datos brutos sensibles salgan jamás de su entorno controlado. Esta configuración cumple con políticas estrictas de gobernanza de datos mientras sigue habilitando la automatización avanzada y la generación de insights.

Qué puedes hacer

  • Audita tus formatos de datos: Comprueba si tus herramientas de IA están recibiendo JSON indentado o XML verboso. Cambia a formatos compactos como CSV o TSV para reducir inmediatamente el uso de tokens.
  • Implementa filtrado de columnas: Configura tus conectores de datos para permitir que la IA solicite solo las columnas específicas necesarias para una tarea, en lugar de descargar tablas enteras.
  • Mueve la agregación al servidor: Usa SQL o scripts del lado del servidor para realizar sumas, conteos y promedios antes de pasar los datos al LLM. Nunca pidas a un LLM que sume miles de filas.
  • Usa servidores MCP locales: Para datos sensibles, despliega servidores MCP locales que interactúen con tus bases de datos internas u hojas de cálculo, manteniendo los datos brutos dentro de tu red.
  • Valida tipos de datos: Asegúrate de que tu pipeline de datos maneje correctamente formatos mixtos, como símbolos de moneda o porcentajes, antes de la agregación para evitar errores silenciosos.
  • Monitorea el uso de tokens: Rastrea el recuento de tokens para cada llamada a herramienta para identificar ineficiencias. Intenta mantener los resultados de las herramientas por debajo del límite de salida del cliente para evitar errores de truncamiento.

Más noticias

Todas las noticias