IA y LLM

Arquitectura de IA aislada para la seguridad industrial en Pakistán

Una operadora de petróleo y gas en Pakistán implementó una pila de IA totalmente autoalojada para predecir incidentes de seguridad sin enviar datos a la nube.

Vista previa de DocBento

Traducido automáticamente del original en inglés.

Una operadora de petróleo y gas en Pakistán ha implementado un sistema de inteligencia artificial totalmente aislado (air-gapped) para predecir incidentes de salud, seguridad y medio ambiente antes de que ocurran. El proyecto, detallado en una arquitectura de referencia publicada el 3 de octubre de 2026, se basa exclusivamente en modelos autoalojados e infraestructura local para garantizar que ningún dato operativo sensible salga del control de la empresa. Este enfoque demuestra cómo la industria pesada puede aprovechar la IA avanzada cumpliendo al mismo tiempo con estrictos requisitos de soberanía de datos.

Qué ocurrió

La operadora buscaba transformar su departamento de seguridad pasando de reportes reactivos a advertencias proactivas. Los datos para esta iniciativa ya existían, pero estaban aislados en sistemas SAP EHS, redes SCADA, historiadores de fuego y gas, flujos de cámaras y archivos escaneados de investigaciones. La restricción principal era que ninguna de esta información podía enviarse a APIs de IA de terceros o servicios en la nube. Cada componente de la ruta de servicio debía permanecer dentro de la infraestructura física propia de la operadora.

Para satisfacer estas necesidades, el equipo de ingeniería seleccionó modelos basados en licencias abiertas que permitían el uso interno sin dependencias externas. El motor central de razonamiento utiliza GLM 5.3, un modelo mixture-of-experts de 753 mil millones de parámetros que funciona con precisión FP8. Para la detección de anomalías en series temporales, el sistema emplea Amazon Chronos-2, mientras que RF-DETR-Large de Roboflow se encarga de la detección visual. El reconocimiento óptico de caracteres es gestionado por PaddleOCR-VL-1.6 de PaddlePaddle, y la recuperación multilingüe soporta inglés, urdu y urdu romanizado mediante el modelo bge-m3 de BAAI.

El dimensionamiento del hardware se calculó basándose en los pesos del modelo y no en las especificaciones de marketing. El modelo GLM 5.3 requiere aproximadamente 904 GB de memoria con margen, lo cual cabe en un solo nodo equipado con ocho tarjetas aceleradoras de 141 GB. Esta configuración deja suficiente memoria para cachés clave-valor y usuarios concurrentes. Los nodos de borde manejan la detección y previsión en tiempo real localmente, asegurando que las operaciones continúen incluso si se interrumpe el enlace con la capa central.

Detalles clave

  • El sistema utiliza pesos abiertos de GLM 5.3 para el razonamiento, licenciados para uso puramente interno sin revisión de servicios gestionados.
  • Los costos de hardware por poseer la configuración durante tres años se estiman en $670,000, significativamente inferiores al alquiler de GPUs equivalentes en la nube.
  • Todas las fuentes de datos se conectan mediante adaptadores de solo lectura que etiquetan la procedencia y se mapean a un modelo de objetos unificado.
  • Apache Kafka sobre KRaft ordena los eventos por clave de equipo para mantener la exactitud cronológica en el análisis de incidentes.
  • La sincronización temporal es gestionada por Chrony con un grandmaster GNSS para evitar la deriva de marcas de tiempo entre sensores y servidores.
  • El diseño evita puntos de control (checkpoints) de RF-DETR más grandes que Large debido a restricciones de licencia en versiones mayores.

Contexto

Los sistemas air-gapped están aislados de redes inseguras, como internet público, para proteger datos sensibles. En entornos industriales, este aislamiento es crítico para la tecnología operativa que controla procesos físicos. Ejecutar IA en tales entornos requiere alojar todos los modelos internamente, ya que llamar a APIs externas rompería el aislamiento. Esto significa que la organización debe gestionar todo el ciclo de vida del software, incluyendo motores de inferencia, bases de datos vectoriales y actualizaciones de modelos.

Dimensionar el hardware para grandes modelos de lenguaje implica calcular la memoria requerida para los pesos del modelo y el espacio adicional necesario para activaciones y cachés clave-valor durante la inferencia. Formatos de precisión como FP8 reducen el uso de memoria en comparación con FP16 o FP32, permitiendo que modelos más grandes quepan en el hardware disponible. Sin embargo, esto requiere soporte específico de acelerador y una planificación cuidadosa para asegurar que el rendimiento no se vea afectado bajo carga.

Por qué importa

Para equipos que ejecutan su propio software, esta arquitectura destaca los beneficios tangibles de costos del autoalojamiento frente al alquiler en la nube para cargas de trabajo constantes y de alto volumen. El costo de tres años de posesión del hardware fue menos de la mitad del costo de alquilar recursos equivalentes de un proveedor importante de nube en la región de EAU. Además, usar modelos frontier cerrados por token habría costado entre $1.04 millones y $2.95 millones para cincuenta usuarios, haciendo del autoalojamiento la opción más económica para despliegues a largo plazo.

La soberanía de datos es otro factor crítico. Dado que ningún hyperscaler opera una región dentro de Pakistán, cualquier solución basada en la nube requeriría mover datos al extranjero, violando las restricciones de seguridad de la operadora. Al mantener todo el procesamiento local, la operadora conserva el control total sobre su propiedad intelectual y datos operativos. Este enfoque también elimina la dependencia de la disponibilidad de APIs externas, asegurando la operación continua independientemente de la conectividad a internet o el estado de servicios de terceros.

El uso de modelos de código abierto con licencias permisivas permite a la operadora ajustar y modificar los pesos según sea necesario. Esta flexibilidad es esencial para adaptar modelos genéricos a contextos industriales específicos, como reconocer configuraciones únicas de equipos o comprender protocolos de seguridad localizados. También asegura que la organización sea dueña de las capacidades de IA que construye, en lugar de alquilarlas de un proveedor.

Qué puedes hacer

  • Audita tus fuentes de datos actuales para identificar información aislada que podría beneficiarse de un análisis unificado con IA.
  • Evalúa modelos de pesos abiertos que permitan el uso interno sin requerir llamadas a APIs externas o servicios gestionados.
  • Calcula los requisitos de hardware basándote en conteos de parámetros del modelo y formatos de precisión, no en recomendaciones del vendedor.
  • Implementa adaptadores de solo lectura para sistemas existentes para asegurar la integridad de los datos y el seguimiento de la procedencia.
  • Usa protocolos de sincronización temporal precisos como Chrony con fuentes GNSS para correlacionar eventos entre sensores distribuidos.
  • Compara el costo total de propiedad del hardware autoalojado contra el alquiler en la nube y precios basados en tokens para tu carga de trabajo específica.

Más noticias

IA y LLM

Aleph Alpha lanza Kolibri, un LLM soberano en alemán e inglés

Aleph Alpha ha presentado Kolibri, un modelo de pesos abiertos y arquitectura de mezcla de expertos (MoE) entrenado en Europa. Prioriza la soberanía de los datos y el procesamiento eficiente del idioma alemán para despliegues autoalojados.

Todas las noticias