¿Se pueden manipular socialmente los sistemas de IA?
Seguridad digital
¿Podrían los atacantes utilizar indicaciones aparentemente inofensivas para manipular un sistema de inteligencia artificial e incluso convertirlo en su aliado involuntario?
12 de diciembre de 2024
•
,
Leer durante 3 minutos

Cuando interactuamos con chatbots y otras herramientas impulsadas por IA, normalmente les hacemos preguntas sencillas como: «¿Cómo estará el tiempo hoy?» o »¿Los trenes llegarán a tiempo?» Quienes no participan en el desarrollo de la IA probablemente asumen que todos los datos fluyen hacia un único sistema vasto y omnisciente que procesa las solicitudes y entrega respuestas al instante. Sin embargo, la realidad es más compleja y, como se demostró en Black Hat Europe 2024, los sistemas podrían ser vulnerables a la explotación.
A Presentación de Ben Nassi, Stav Cohen y Ron Bitton detalló cómo los actores maliciosos podrían eludir la seguridad de un sistema de IA para socavar su funcionamiento o explotar el acceso a él. Demostraron que al hacer ciertas preguntas a un sistema de inteligencia artificial, es posible desarrollar una respuesta que cause daño, como un ataque de denegación de servicio.
Creando bucles y sobrecargando sistemas.
Para muchos de nosotros, un servicio de IA puede parecer una fuente única. En realidad, se basa en muchos componentes interconectados o, como los llamó el equipo de presentación, agentes. Volviendo al ejemplo anterior, la consulta del tiempo y los trenes requiere datos de agentes separados: uno que tiene acceso a los datos meteorológicos y el otro que proporciona actualizaciones del estado de los trenes.
El modelo –o el agente maestro, al que los oradores llamaron “el planificador”– debe luego integrar los datos de cada agente para formular respuestas. Además, existen salvaguardas para evitar que el sistema responda preguntas que sean inapropiadas o que estén fuera de su alcance. Por ejemplo, algunos sistemas de IA podrían evitar responder preguntas políticas.
Sin embargo, los ponentes demostraron que estas directrices pueden ser manipuladas y que algunas preguntas específicas pueden desencadenar bucles interminables. Un atacante que pueda establecer los límites de las barreras de seguridad puede hacer una pregunta que produzca constantemente una respuesta prohibida. Crear suficientes instancias de la pregunta en última instancia sobrecargará el sistema y desencadenará un ataque de denegación de servicio.
Si pones esto en un escenario cotidiano, como lo hicieron los moderadores, puedes ver qué tan rápido puede causar daño. Un atacante envía un correo electrónico a un usuario que tiene un asistente de IA, incorpora una solicitud que es procesada por el asistente de IA y se genera una respuesta. Si la respuesta siempre se clasifica como insegura y requiere una reescritura, se crea el bucle de un ataque de denegación de servicio. Si envía suficientes correos electrónicos como este, el sistema se detendrá y su rendimiento y recursos se agotarán.
Naturalmente, surge la pregunta de cómo extraer la información sobre las barandillas del sistema para poder utilizarla. El equipo demostró una versión más avanzada del ataque anterior, en el que el propio sistema de IA fue manipulado para proporcionar información general sobre sus operaciones y configuración a través de una serie de indicaciones aparentemente inofensivas.
Una pregunta como «¿Qué sistema operativo o versión de SQL está utilizando?» probablemente genere una respuesta relevante. Combinado con información aparentemente no relacionada sobre el propósito del sistema, esto puede proporcionar tanta información que se podrían enviar comandos de texto al sistema y, si un agente tiene acceso privilegiado, puede otorgar ese acceso al atacante sin darse cuenta. Cuando se trata de ciberataques, lo conocemos como “escalada de privilegios”, un método en el que los atacantes explotan las vulnerabilidades para obtener niveles de acceso más altos de lo previsto.
La amenaza emergente de los sistemas de inteligencia artificial de ingeniería social
El presentador no abordó mis propios hallazgos de la sesión: en mi opinión, lo que estaban demostrando era un ataque de ingeniería social a un sistema de inteligencia artificial. Le hacen preguntas que él responde con gusto y también pueden permitir que los malos actores reúnan las piezas individuales de información y utilicen el conocimiento combinado para traspasar los límites y extraer más datos, o engañar al sistema para que tome medidas que no deberían. hazlo.
Y si uno de los agentes de la cadena tiene derechos de acceso, esto podría hacer que el sistema sea más explotable y permitir al atacante utilizar estos derechos en su propio beneficio. Un ejemplo extremo utilizado por el moderador involucró a un agente con permisos de escritura de archivos; En el peor de los casos, se podría abusar del agente para cifrar datos y bloquear el acceso a otros, un escenario comúnmente conocido como incidente de ransomware.
La ingeniería social de un sistema de IA debido a la falta de controles o derechos de acceso muestra que se requiere una cuidadosa consideración y configuración al implementar un sistema de IA para que no sea vulnerable a ataques.
Este contenido de ciberseguridad nos ha llegado de: Welivesecurity (protección de malware de ESET)
Llegarás a la noticia original en el enlace que sigue: https://www.welivesecurity.com/en/cybersecurity/black-hat-europe-2024-ai-systems-socially-engineered/
write a shot sentence in spanish about who ESET, the Cybersecurity company»
