Son las 10 de la noche. ¿Sabes dónde están tus modelos de IA esta noche?
Si cree que el problema de la seguridad de la cadena de suministro de software es bastante difícil hoy en día, entonces abróchese el cinturón. La explosión en el uso de la inteligencia artificial (IA) hará que abordar estos problemas de la cadena de suministro sea exponencialmente más difícil en los próximos años.
Los desarrolladores, los profesionales de seguridad de aplicaciones y los profesionales de DevSecOps están llamados a abordar las vulnerabilidades de mayor riesgo que acechan en las combinaciones aparentemente interminables de componentes propietarios y de código abierto integrados en sus aplicaciones e infraestructura de nube. Pero es una batalla constante incluso entender qué componentes tienen, cuáles son vulnerables y qué fallas los ponen en mayor riesgo. Es evidente que ya están luchando por gestionar estas dependencias en su software tal como está.
Lo que se vuelve aún más difícil es el efecto multiplicador que la IA añadirá a la situación.
Modelos de IA como código autoejecutable
Las herramientas habilitadas para la IA y el aprendizaje automático (ML) son tan software como cualquier otro tipo de aplicación, y es igualmente probable que su código se vea afectado por las incertidumbres de la cadena de suministro. Sin embargo, añaden otra variable de activos a la mezcla que aumenta significativamente la superficie de ataque de la cadena de suministro de software de IA: los modelos AI/ML.
“Esto es lo que diferencia a las aplicaciones de IA de cualquier otra forma de software. [they rely] «En cierto sentido, se basa en el llamado modelo de aprendizaje automático», explica Daryan Dehghanpisheh, cofundador de Protect AI. «Como resultado, este modelo de aprendizaje automático es ahora un activo para su infraestructura». Si tiene un activo en su infraestructura, necesita poder escanear su entorno y determinar dónde está, qué contiene y quién tiene permisos. y lo que hace. Y si no puedes hacer eso con los modelos actuales, tampoco puedes gestionarlos”.
Los modelos de IA/ML forman la base de la capacidad de un sistema de IA para reconocer patrones, hacer predicciones, tomar decisiones, desencadenar acciones o crear contenido. Sin embargo, la verdad es que la mayoría de las empresas ni siquiera saben cómo obtener visibilidad de todos los modelos de IA integrados en su software. Los modelos y la infraestructura que los rodea se construyen de manera diferente a otros componentes de software, y las herramientas de software y seguridad tradicionales no están diseñadas para escanear o comprender cómo funcionan los modelos de IA o qué fallas tienen. Eso es lo que los hace únicos, dice Dehghanpisheh, quien explica que son esencialmente piezas ocultas de código autoejecutable.
“Un modelo es inherentemente un código autoejecutable. Tiene cierta agencia”, dice Dehghanpisheh. “Si le dijera que hay activos en toda su infraestructura que no puede ver, no puede identificar, no sabe lo que contienen, no sabe cuál es el código y se ejecutan solos y crean llamadas externas, eso suena sospechosamente a un virus de autorización, ¿no?
Uno de los primeros observadores de las incertidumbres de la IA
Irse un paso por delante de este problema fue el gran impulso para él y sus cofundadores para lanzar Protect AI en 2022. Esta es una de las muchas empresas nuevas que trabajan para resolver los problemas de seguridad de los modelos y procedencia de los datos que surgen en la era de la IA. Dehghanpisheh y el cofundador Ian Swanson vislumbraron el futuro cuando trabajaron juntos anteriormente en AWS para desarrollar soluciones de IA/ML. Dehghanpisheh fue el arquitecto de soluciones de IA/ML líder en el mundo.
«Durante nuestro tiempo juntos en AWS, vimos a clientes crear sistemas de IA/ML a un ritmo increíblemente rápido, mucho antes de que la IA generativa capturara los corazones y las mentes de todos, desde la alta dirección hasta el Congreso», explica que trabajó con varios de ingenieros y expertos en desarrollo empresarial, así como extensamente con los clientes. «Fue entonces cuando nos dimos cuenta de cómo y dónde se encuentran las vulnerabilidades de seguridad que son exclusivas de los sistemas AI/ML».
Observaron tres cosas fundamentales sobre la IA/ML que tendrían implicaciones increíbles para el futuro de la ciberseguridad, afirma. En primer lugar, el ritmo de adopción fue tan rápido que vieron de primera mano la rapidez con la que surgieron entidades de TI en la sombra en torno al desarrollo de la IA y la implementación empresarial, evadiendo el tipo de gobernanza que controlaría cualquier otro tipo de desarrollo en la empresa.
La segunda razón fue que la mayoría de las herramientas utilizadas, ya sean comerciales o de código abierto, fueron desarrolladas por científicos de datos y aspirantes a ingenieros de ML que nunca habían recibido formación en conceptos de seguridad.
«El resultado fueron herramientas realmente útiles, muy populares, ampliamente disponibles y utilizadas que no fueron diseñadas teniendo en cuenta la seguridad», afirma.
Los sistemas de IA no están diseñados para estar «orientados a la seguridad».
Como resultado, muchos sistemas AI/ML y herramientas compartidas carecen de los conceptos básicos de autenticación y autorización y, a menudo, otorgan demasiado acceso de lectura y escritura a los sistemas de archivos, explica. Combinado con configuraciones de red inseguras y los problemas asociados en los modelos, las empresas se encuentran cada vez más con problemas de seguridad en cascada en estos sistemas altamente complejos y difíciles de entender.
«Esto nos hizo darnos cuenta de que, sin importar lo lejos que se llegara, las herramientas, los procesos y los marcos de seguridad existentes carecían del contexto que necesitarían los ingenieros de aprendizaje automático, los científicos de datos y los desarrolladores de inteligencia artificial», afirma.
Finalmente, la tercera observación clave que él y Swanson hicieron durante esos días de AWS fue que no habría violaciones de IA. Ya habían llegado.
«Hemos visto que los clientes tienen violaciones de una variedad de sistemas de IA/ML que deberían haber sido detectadas pero no lo fueron», dice. “Esto nos mostró que el conjunto, los procesos y los elementos de la gestión de respuesta a incidentes no estaban diseñados específicamente para la forma en que se diseñó AI/ML. Este problema sólo ha empeorado a medida que la IA generativa ha ido ganando terreno».
Los modelos de IA están muy extendidos
Dehghanpisheh y Swanson también comenzaron a ver cómo los modelos y los datos de entrenamiento estaban creando una nueva cadena de suministro de IA única que debía tomarse tan en serio como el resto de la cadena de suministro de software. Al igual que con el resto del desarrollo de software moderno y la innovación nativa de la nube, los científicos de datos y los expertos en IA han impulsado avances en los sistemas de IA/ML mediante el uso generalizado de componentes compartidos y de código abierto, incluidos los modelos de IA y los datos que los impulsan, cuya capacitación es usado. Muchos sistemas de IA, académicos o comerciales, se basan en el modelo de otra persona. Y al igual que el resto del desarrollo moderno, la explosión en el desarrollo de la IA está dando como resultado una enorme afluencia de nuevos recursos modelo que proliferan a lo largo de la cadena de suministro todos los días, lo que significa que cada vez es más difícil realizar un seguimiento de ellos.
Tomemos como ejemplo Hugging Face. Este es uno de los repositorios en línea más utilizados para modelos de IA de código abierto en la actualidad; sus fundadores dicen que quieren ser el GitHub de la IA. En noviembre de 2022, los usuarios de Hugging Face ya habían compartido 93.501 modelos diferentes con la comunidad. En noviembre siguiente había 414.695 modelos. Ahora, sólo tres meses después, esa cifra ha aumentado a 527.244. Este es un problema cuya magnitud aumenta día a día. Y pondrá el problema de seguridad de la cadena de suministro de software “en esteroides”, dice Dehghanpisheh.
A análisis actual Su empresa descubrió que miles de modelos compartidos abiertamente en Hugging Face pueden ejecutar código arbitrario al cargar o inferir el modelo. Si bien Hugging Face realiza un escaneo básico de su repositorio en busca de problemas de seguridad, muchos modelos se pasan por alto en el proceso: al menos la mitad de los modelos de alto riesgo descubiertos en la investigación no fueron considerados inseguros por la plataforma, y Hugging Face deja esto claro en la documentación de que la decisión sobre la seguridad de un modelo es en última instancia responsabilidad de sus usuarios.
Pasos para abordar la cadena de suministro de IA
Dehghanpisheh cree que el eje de la ciberseguridad en la era de la IA será, en primer lugar, crear una comprensión estructurada del linaje de la IA. Esto incluye el linaje del modelo y el linaje de datos, que esencialmente representan el origen y la historia de estos activos, cómo cambiaron y los metadatos asociados.
“Ese es el primer punto de partida. «No puedes arreglar lo que no puedes ver, lo que no puedes saber y lo que no puedes definir, ¿verdad?», dice.
Dehghanpisheh cree que en el nivel operativo diario, las empresas necesitan desarrollar capacidades para escanear sus modelos en busca de errores que puedan afectar no sólo al fortalecimiento del sistema, sino también a la integridad de su producción. Entre ellos se incluyen cuestiones como el sesgo de la IA y fallos de funcionamiento que podrían causar daños físicos en el mundo real, por ejemplo, si un coche autónomo choca con un peatón.
«Lo primero que hay que hacer es escanear», dice. “Lo segundo es que hay que entender estos escaneos. Y la tercera cosa es que una vez que tienes algo marcado, básicamente tienes que dejar de activar ese modelo. Hay que limitar su capacidad de actuar”.
El impulso para MLSecOps
MLSecOps es un movimiento neutral respecto a los proveedores que refleja el movimiento DevSecOps en el mundo del software tradicional.
“Al igual que pasar de DevOps a DevSecOps, hay que hacer dos cosas al mismo tiempo. Lo primero que hay que hacer es concienciar a los profesionales de que la seguridad es un desafío y una responsabilidad compartida”, afirma Dehghanpisheh. “Lo segundo que hay que hacer es proporcionar contexto e incorporar la seguridad a las herramientas que los científicos de datos, los ingenieros de aprendizaje automático y los expertos pueden utilizar. [and] Los desarrolladores de IA están a la vanguardia e innovan constantemente, pero permiten que las preocupaciones de seguridad pasen a un segundo plano”.
Además, cree que las empresas deben comenzar a implementar políticas de gobernanza, riesgo y cumplimiento, así como capacidades de cumplimiento y procedimientos de respuesta a incidentes que ayuden a guiar las acciones y procesos que tienen lugar cuando se descubren incertidumbres. Al igual que con un ecosistema DevSecOps sólido, esto significa que MLSecOps requiere un fuerte compromiso de las partes interesadas del negocio hasta el nivel ejecutivo.
La buena noticia es que la seguridad de AI/ML se beneficia de algo que ninguna otra innovación tecnológica rápida ha tenido desde el principio: a saber, los requisitos regulatorios desde el principio.
«Piense en cualquier otra transición tecnológica», dice Dehghanpisheh. “Mencione un momento en el que un regulador federal o incluso un regulador estatal dijo tan temprano: ‘Vaya, espera, espera, tienes que contarme todo lo que hay en esto. Es necesario priorizar el conocimiento de este sistema. Esto es lo que hay que priorizar en una lista de materiales. No hay ninguno.»
Esto significa que muchos líderes en seguridad están consiguiendo aceptación para desarrollar capacidades de seguridad de IA mucho antes en el ciclo de vida de la innovación. Uno de los signos más obvios de este apoyo es el rápido cambio hacia la promoción de nuevas funciones laborales en las organizaciones.
“La mayor diferencia que ha traído la mentalidad regulatoria es que en enero de 2023, el concepto de director de seguridad de IA era nuevo e inexistente. Pero en junio empezaste a ver estos papeles”, dice Dehghanpisheh. «Ahora están en todas partes y cuentan con financiación».
Este contenido de ciberseguridad nos ha llegado de: DarkReading
Llegarás a la noticia original en el enlace que se encuentra a continuación: https://www.darkreading.com/cyber-risk/do-you-know-where-your-ai-models-are-tonight