Air-gapped AI-Architektur für industrielle Sicherheit in Pakistan
Ein Öl- und Gasunternehmen in Pakistan hat einen vollständig selbst gehosteten KI-Stack eingesetzt, um Sicherheitsvorfälle vorherzusagen, ohne Daten in die Cloud zu senden.
Automatisch aus dem englischen Original übersetzt.
Ein Öl- und Gasunternehmen in Pakistan hat ein vollständig air-gapped (netzwerkisoliertes) System zur künstlichen Intelligenz implementiert, um Vorfälle im Bereich Gesundheit, Sicherheit und Umwelt (HSE) vorherzusagen, bevor sie eintreten. Das Projekt, das in einer Referenzarchitektur vom 3. Oktober 2026 detailliert beschrieben wird, verlässt sich vollständig auf selbst gehostete Modelle und lokale Infrastruktur, um sicherzustellen, dass keine sensiblen Betriebsdaten die Kontrolle des Unternehmens verlassen. Dieser Ansatz zeigt, wie die Schwerindustrie fortschrittliche KI nutzen kann, während sie gleichzeitig strenge Anforderungen an die Datensouveränität erfüllt.
Was passiert ist
Das Unternehmen wollte seine Sicherheitsabteilung von reaktiver Berichterstattung zu proaktiver Warnung transformieren. Die Daten für diese Initiative waren bereits vorhanden, aber über SAP-EHS-Systeme, SCADA-Netzwerke, Fire-and-Gas-Historiker, Kamerafeeds und gescannte Untersuchungsdateien verteilt. Die primäre Einschränkung bestand darin, dass keine dieser Informationen an Drittanbieter-KI-APIs oder Cloud-Dienste gesendet werden durfte. Jede Komponente der Bereitstellungskette musste innerhalb der physischen Infrastruktur des Betreibers bleiben.
Um diese Anforderungen zu erfüllen, wählte das Engineering-Team Modelle aus, die auf offenen Lizenzen basierten und eine interne Nutzung ohne externe Abhängigkeiten ermöglichten. Die zentrale Reasoning-Engine verwendet GLM 5.3, ein Mixture-of-Experts-Modell mit 753 Milliarden Parametern, das mit FP8-Präzision läuft. Für die Anomalieerkennung in Zeitreihen setzt das System Amazon Chronos-2 ein, während Roboflow’s RF-DETR-Large für die Vision-Erkennung zuständig ist. Die optische Zeichenerkennung wird durch PaddlePaddle’s PaddleOCR-VL-1.6 verwaltet, und die mehrsprachige Suche unterstützt Englisch, Urdu und Roman Urdu über das BAAI-Modell bge-m3.
Die Hardware-Skalierung wurde auf Basis der Modellgewichte berechnet, nicht anhand von Marketing-Spezifikationen. Das GLM 5.3-Modell erfordert etwa 904 GB Speicher inklusive Reserve, was auf einem einzelnen Knoten mit acht 141 GB Beschleunigerkarten Platz findet. Diese Konfiguration lässt ausreichend Speicher für Key-Value-Caches und gleichzeitige Benutzer. Edge-Knoten übernehmen Echtzeit-Erkennung und Vorhersage lokal, sodass der Betrieb auch dann fortgesetzt wird, wenn die Verbindung zur zentralen Ebene unterbrochen ist.
Wichtige Details
- Das System nutzt offene Gewichte von GLM 5.3 für Reasoning-Aufgaben, lizenziert für rein interne Nutzung ohne Prüfung durch Managed Services.
- Die Hardwarekosten für den Besitz der Einrichtung über drei Jahre werden auf $670.000 geschätzt, deutlich niedriger als die Kosten für das Mieten vergleichbarer Cloud-GPUs.
- Alle Datenquellen verbinden über schreibgeschützte Adapter, die die Herkunft markieren und auf ein einheitliches Objektmodell abbilden.
- Apache Kafka auf KRaft ordnet Ereignisse pro Anlagen-Schlüssel, um die chronologische Genauigkeit für die Incident-Analyse aufrechtzuerhalten.
- Die Zeitsynchronisation wird von Chrony mit einem GNSS-Grandmaster übernommen, um Zeitstempel-Drift zwischen Sensoren und Servern zu verhindern.
- Das Design vermeidet RF-DETR-Checkpoints größer als Large aufgrund von Lizenzbeschränkungen für größere Versionen.
Hintergrund
Air-gapped-Systeme sind von unsicheren Netzwerken, wie dem öffentlichen Internet, isoliert, um sensible Daten zu schützen. In industriellen Umgebungen ist diese Isolation kritisch für Operational Technology, die physische Prozesse steuert. Das Ausführen von KI in solchen Umgebungen erfordert das Selbsthosting aller Modelle, da Aufrufe externer APIs die Air-Gap brechen würden. Dies bedeutet, dass die Organisation den gesamten Lebenszyklus der Software verwalten muss, einschließlich Inferenz-Engines, Vektor-Datenbanken und Modell-Updates.
Die Skalierung der Hardware für große Sprachmodelle umfasst die Berechnung des Speichers, der für die Modellgewichte erforderlich ist, sowie des zusätzlichen Raums, der für Aktivierungen und Key-Value-Caches während der Inferenz benötigt wird. Präzisionsformate wie FP8 reduzieren die Speichernutzung im Vergleich zu FP16 oder FP32, wodurch größere Modelle auf verfügbarer Hardware Platz finden. Dies erfordert jedoch spezifische Unterstützung durch Beschleuniger und sorgfältige Planung, um sicherzustellen, dass die Leistung unter Last nicht leidet.
Warum es wichtig ist
Für Teams, die ihre eigene Software betreiben, hebt diese Architektur die greifbaren Kostenvorteile des Selbsthostings gegenüber Cloud-Mietmodellen für stetige, hochvolumige Workloads hervor. Die dreijährigen Kosten für den Besitz der Hardware waren weniger als halb so hoch wie die Kosten für das Mieten vergleichbarer Ressourcen bei einem großen Cloud-Anbieter in der UAE-Region. Darüber hinaus hätte die Nutzung geschlossener Frontier-Modelle nach Token-Kosten zwischen $1,04 Millionen und $2,95 Millionen für fünfzig Benutzer verursacht, was Selbsthosting zur wirtschaftlichsten Option für langfristige Bereitstellungen macht.
Datensouveränität ist ein weiterer kritischer Faktor. Da kein Hyperscaler eine Region innerhalb Pakistans betreibt, würde jede cloudbasierte Lösung die Verlagerung von Daten ins Ausland erfordern, was die Sicherheitsauflagen des Betreibers verletzen würde. Durch die lokale Verarbeitung behält der Betreiber die volle Kontrolle über sein geistiges Eigentum und seine Betriebsdaten. Dieser Ansatz eliminiert zudem die Abhängigkeit von der Verfügbarkeit externer APIs und gewährleistet einen kontinuierlichen Betrieb unabhängig von Internetverbindung oder Status von Drittanbieterdiensten.
Die Verwendung von Open-Source-Modellen mit permissiven Lizenzen ermöglicht es dem Betreiber, die Gewichte bei Bedarf fein abzustimmen und zu modifizieren. Diese Flexibilität ist entscheidend, um generische Modelle an spezifische industrielle Kontexte anzupassen, wie etwa das Erkennen einzigartiger Gerätekonfigurationen oder das Verständnis lokaler Sicherheitsprotokolle. Sie stellt außerdem sicher, dass die Organisation die KI-Fähigkeiten besitzt, die sie aufbaut, anstatt sie von einem Anbieter zu mieten.
Was Sie tun können
- Prüfen Sie Ihre aktuellen Datenquellen, um silierte Informationen zu identifizieren, die von einer vereinheitlichten KI-Analyse profitieren könnten.
- Evaluieren Sie Open-Weight-Modelle, die eine interne Nutzung gestatten, ohne externe API-Aufrufe oder Managed Services zu erfordern.
- Berechnen Sie Hardware-Anforderungen basierend auf Parameteranzahlen und Präzisionsformaten der Modelle statt auf Empfehlungen des Anbieters.
- Implementieren Sie schreibgeschützte Adapter für bestehende Systeme, um Datenintegrität und Nachverfolgung der Herkunft sicherzustellen.
- Verwenden Sie präzise Zeitsynchronisationsprotokolle wie Chrony mit GNSS-Quellen, um Ereignisse über verteilte Sensoren hinweg zu korrelieren.
- Vergleichen Sie die Gesamtbetriebskosten (TCO) für selbst gehostete Hardware mit Cloud-Mietmodellen und tokenbasierten Preisen für Ihren spezifischen Workload.



