Daten & Tabellen

Senkung der LLM-Kosten durch serverseitige Aggregation von Tabellenkalkulationsdaten

Ein Data Engineer reduzierte den Tokenverbrauch bei großen Tabellenkalkulationen um das 2.300-Fache, indem Berechnungen auf einem lokalen Server durchgeführt wurden, anstatt Rohzeilen an ein KI-Modell zu senden.

Vorschau von Excel Import Mapper

Automatisch aus dem englischen Original übersetzt.

Der Data Engineer Andrei Kushniarou entwickelte einen lokalen Model Context Protocol (MCP)-Server namens gsheets-mcp, um große Google Sheets-Datensätze zu verarbeiten, ohne die Privatsphäre zu gefährden oder übermäßige KI-Kosten zu verursachen. In seinem technischen Deep-Dive, veröffentlicht Ende September 2026, zeigt er, wie die Verlagerung der Datenverarbeitung vom Sprachmodell zum Server den Tokenverbrauch für komplexe Finanzabfragen von Millionen auf unter tausend reduzieren kann.

Was passiert ist

Kushniarou musste E-Commerce-Abrechnungsberichte mit zehntausenden Zeilen unter Verwendung von Claude Opus 5.5 analysieren. Er lehnte Drittanbieter-MCP-Server aufgrund von Bedenken hinsichtlich des Datenschutzes ab und baute eine lokale Lösung, die direkt mit der Google Sheets API interagiert. Zum Testen des Systems verwendete er einen synthetischen Amazon Settlement Report mit 50.009 Zeilen und 24 Spalten und bat das Modell, die Umsätze nach Betragsart aufzuschlüsseln. Der anfängliche Ansatz, Rohdaten an das Modell zu senden, erwies sich als ineffizient und teuer, was zu einer Reihe von Optimierungen führte.

Die erste Version des Servers gab Daten als eingerücktes JSON zurück, was 1,83 Millionen Tokens für eine einzelne Abfrage ergab. Dies überschritt die Kontextfensterlimits der meisten Modelle und löste clientseitige Fehler in Claude Code aus, wo die Ausgabe von Tool-Aufrufen auf 25.000 Tokens begrenzt ist. Darüber hinaus kosten Input-Tokens für Opus 5.5 $4 pro Million, was wiederholte Lesevorgänge großer Datensätze finanziell nicht tragbar machen. Kushniarou merkte an, dass selbst wenn die Daten gepasst hätten, die Nutzung eines LLMs für Arithmetik über 50.000 Zeilen hinweg für Buchhaltungszwecke unzuverlässig sei.

Durch iterative Verbesserungen reduzierte Kushniarou die Tokenanzahl für dieselbe Abfrage auf nur noch 787. Die endgültige Architektur nutzt serverseitige Aggregation, wobei der lokale Server Gruppierungs- und Summierungsvorgänge durchführt, bevor nur die Ergebnisse an das Modell gesendet werden. Dieser Ansatz stellt sicher, dass sensible Finanzdaten innerhalb der Infrastruktur des Benutzers bleiben, während die KI prägnante, genaue Zusammenfassungen erhält, anstatt rohe, verrauschte Datensätze.

Wichtige Details

  • Anfängliche Ineffizienz: Der v0.1-Server sendete eingerückte JSON-Datensätze, was 1,83 Millionen Tokens pro Abfrage kostete und die Client-Ausgabelimits überschritt.
  • Formatoptimierung: Der Wechsel von eingerücktem JSON zu Tab-Separated Values (TSV) reduzierte den Tokenverbrauch pro Zeile von 199 auf 116, eine Verringerung um 42 %.
  • Spaltenauswahl: Die Möglichkeit für das Modell, spezifische Spalten statt ganzer Zeilen anzufordern, reduzierte die Gesamtzahl der Tokens von 1,03 Millionen auf 580.000.
  • Serverseitige Aggregation: Die Funktion gsheets_aggregate führt Summen-, Zähl- und Gruppenoperationen lokal aus und reduziert die finale Tokenanzahl auf 787.
  • Kostenreduzierung: Die Optimierung senkte die Kosten pro Abfrage von etwa $23 auf $0,39, eine Reduzierung um mehr als 98 %.
  • Wahrung der Privatsphäre: Alle Datenverarbeitungen erfolgen auf einem lokalen Server, sodass rohe Finanzdatensätze niemals an externe KI-Anbieter übertragen werden.

Hintergrund

Das Model Context Protocol (MCP) ist ein offener Standard, der es KI-Assistenten ermöglicht, sich sicher mit lokalen Datenquellen und Tools zu verbinden. In diesem Kontext fungiert ein MCP-Server als Brücke zwischen dem KI-Modell und Google Sheets. Anstatt dass das Modell versucht, eine massive Tabellenkalkulation direkt zu interpretieren, sendet es Anweisungen an den MCP-Server, der die Daten abruft und verarbeitet. Tokens sind die grundlegenden Texteinheiten, die Sprachmodelle verarbeiten; sowohl Eingabe- als auch Ausgabedaten werden in Tokens zerlegt. Komplexe Datenformate wie JSON mit Einrückungen verbrauchen deutlich mehr Tokens als kompakte Formate wie CSV, da sie Schlüssel wiederholen und Leerzeichen enthalten.

Warum es wichtig ist

Für Teams, die ihre eigene Software betreiben oder interne Datenpipelines verwalten, verdeutlicht diese Fallstudie die versteckten Kosten einer naiven KI-Integration. Das Senden von Rohdatenbank-Dumps oder großen Tabellenkalkulationen an ein LLM ist nicht nur teuer, sondern oft technisch unmöglich aufgrund der Limits des Kontextfensters. Durch die Verlagerung der Berechnungen näher an die Daten können Organisationen KI für hochrangiges Reasoning nutzen, während sie für Datenmanipulation und Arithmetik auf traditionelle, zuverlässigen Code setzen. Dieser hybride Ansatz verhindert die "Halluzination" mathematischer Ergebnisse und stellt die Datenintegrität sicher.

Darüber hinaus sind die Auswirkungen auf den Datenschutz für kleine und mittelständische Unternehmen erheblich. Viele Unternehmen zögern, KI-Tools einzuführen, weil sie befürchten, Kundendaten oder Finanzunterlagen über APIs Dritter preiszugeben. Eine lokale MCP-Server-Architektur ermöglicht es diesen Unternehmen, leistungsstarke KI-Modelle für Analysen zu nutzen, ohne dass sensible Rohdaten jemals ihre kontrollierte Umgebung verlassen. Dieses Setup erfüllt strenge Data-Governance-Richtlinien und ermöglicht dennoch fortschrittliche Automatisierung und Erkenntnisgewinnung.

Was Sie tun können

  • Prüfen Sie Ihre Datenformate: Überprüfen Sie, ob Ihre KI-Tools eingerücktes JSON oder verbose XML erhalten. Wechseln Sie zu kompakten Formaten wie CSV oder TSV, um den Tokenverbrauch sofort zu reduzieren.
  • Implementieren Sie Spaltenfilterung: Konfigurieren Sie Ihre Datenkonnektoren so, dass die KI nur die spezifischen Spalten anfordern kann, die für eine Aufgabe benötigt werden, anstatt ganze Tabellen herunterzuladen.
  • Verlagern Sie die Aggregation auf den Server: Nutzen Sie SQL oder serverseitige Skripte, um Summen, Zählungen und Durchschnittswerte zu berechnen, bevor die Daten an das LLM übergeben werden. Bitten Sie niemals ein LLM, Tausende von Zeilen zu summieren.
  • Nutzen Sie lokale MCP-Server: Für sensible Daten stellen Sie lokale MCP-Server bereit, die mit Ihren internen Datenbanken oder Tabellenkalkulationen interagieren und Rohdaten innerhalb Ihres Netzwerks halten.
  • Validieren Sie Datentypen: Stellen Sie sicher, dass Ihre Datenpipeline gemischte Formate wie Währungssymbole oder Prozentwerte vor der Aggregation korrekt behandelt, um stille Fehler zu vermeiden.
  • Überwachen Sie den Tokenverbrauch: Verfolgen Sie die Tokenanzahl für jeden Tool-Aufruf, um Ineffizienzen zu identifizieren. Halten Sie die Tool-Ergebnisse unter dem Ausgabelimit des Clients, um Trunkierungsfehler zu vermeiden.

Weitere News

Alle News