Por qué necesitas conocer el linaje de tu IA
COMENTARIO
La inteligencia artificial (IA) está transformando rápidamente casi todos los aspectos de nuestra vida diaria, desde la forma en que trabajamos hasta la forma en que absorbemos información y la forma en que elegimos a nuestros líderes. Como cualquier tecnología, la IA es amoral pero puede usarse para hacer avanzar la sociedad. hacer daño.
Los datos son los genes que impulsan las aplicaciones de IA. Es ADN y ARN en uno. Como se suele decir cuando se construyen sistemas de software: “Basura que entra/Basura sale”. La tecnología de IA es tan precisa, segura y funcional como las fuentes de datos en las que se basa. La clave para garantizar que la IA cumpla su promesa y evite sus pesadillas reside en la capacidad de mantener la basura fuera y evitar que se multiplique y replique en millones de aplicaciones de IA.
Esto se llama linaje de datos y estamos ansiosos por implementar controles para evitar que nuestro futuro de IA se convierta en una pila gigante de basura.
Los datos incorrectos conducen a modelos de IA que pueden difundir vulnerabilidades de ciberseguridad, información errónea y otros ataques en todo el mundo en cuestión de segundos. Hoy IA generativa (GenAI) son increíblemente complejos, pero en esencia, los modelos GenAI simplemente predicen el mejor siguiente bloque de datos para generar en función de un conjunto de datos anteriores existentes.
Una medida de precisión
Un modelo ChatGPT evalúa el grupo de palabras que componen la pregunta original y todas las palabras de la respuesta del modelo anterior para calcular la siguiente mejor palabra para el resultado. Esto continúa hasta que concluye que ha respondido suficientemente. Suponga que está evaluando la capacidad del modelo para unir palabras que formen oraciones bien formadas y gramaticalmente correctas que sean temática y generalmente relevantes para la conversación. En este caso, los modelos actuales son sorprendentemente buenos: una medida de precisión.
Sumérgete más profundo si el texto generado por IA siempre transmite información «correcta» e indica adecuadamente el nivel de confianza de la información proporcionada. Esto descubre problemas que surgen de modelos que predicen muy bien en promedio, pero no tan bien en casos extremos, lo que presenta un problema de robustez. Las cosas pueden empeorar aún más si los datos incorrectos de los modelos de IA se almacenan en línea y se utilizan como datos de entrenamiento futuros para estos y otros modelos.
Los malos resultados pueden reproducirse en una escala que nunca antes habíamos visto, lo que llevaría a una espiral descendente en la IA.
Si un actor malicioso quisiera ayudar en este proceso, podría fomentar intencionalmente la creación, el almacenamiento y la difusión de datos incorrectos adicionales, lo que daría como resultado que los chatbots arrojen aún más información errónea, o algo tan nefasto y aterrador como modelos de automóviles con piloto automático que decidan que necesitan. pueden conducir rápidamente un automóvil hacia la derecha a pesar de los obstáculos si «ven» una imagen especialmente creada frente a ellos (hipotéticamente, por supuesto).
Después de décadas, la industria del desarrollo de software, liderada por la Agencia de Seguridad de Infraestructura y Ciberseguridad, finalmente está implementando una Seguro por diseño Marco. Seguro por diseño exige que la ciberseguridad constituya la base del proceso de desarrollo de software, y uno de sus principios básicos es exigir la catalogación de cada componente de desarrollo de software: un Lista de materiales de software (SBOM) – fortalecer la seguridad y la resiliencia. En última instancia, la seguridad está reemplazando a la velocidad como el factor de comercialización más crítico.
Proteger los diseños de IA
La IA necesita algo similar. El circuito de retroalimentación de la IA evita técnicas comunes de defensa de la ciberseguridad anteriores, como el seguimiento de firmas de malware, la construcción de perímetros alrededor de los recursos de la red o el escaneo de códigos escritos por humanos en busca de vulnerabilidades. Necesitamos hacer que los diseños de IA seguros sean un requisito mientras la tecnología aún está en su infancia, para que la IA pueda volverse segura mucho antes de que se abra la Caja de Pandora.
¿Cómo resolvemos este problema? Deberíamos echar un vistazo al mundo de la ciencia. Capacitamos a los estudiantes con datos de capacitación cuidadosamente seleccionados, interpretados y comunicados por una industria docente. Continuamos con este enfoque para enseñar a los adultos, pero se espera que los adultos seleccionen más datos ellos mismos.
El entrenamiento de modelos de IA debe adoptar un enfoque de dos pasos con datos seleccionados. En primer lugar, los modelos básicos de IA se entrenarían utilizando métodos actuales y grandes cantidades de conjuntos de datos menos seleccionados. Estos modelos básicos de lenguaje grande (LLM) corresponderían aproximadamente a un recién nacido. Luego, los modelos base se entrenarían con conjuntos de datos cuidadosamente seleccionados, de manera similar a cómo se enseña y se cría a los niños hasta convertirse en adultos.
El esfuerzo por crear grandes conjuntos de datos de entrenamiento seleccionados para todo tipo de objetivos no será pequeño. Esto es comparable a todos los esfuerzos que hacen los padres, las escuelas y la sociedad para proporcionar a los niños un entorno e información de calidad a medida que se convierten (con suerte) en contribuyentes funcionales y de valor agregado a la sociedad. Ese es el esfuerzo necesario para crear conjuntos de datos de alta calidad para entrenar modelos de IA de alta calidad, de buen rendimiento y mínimamente corruptos, y podría llevar a toda una industria de IA y humanos a trabajar juntos para enseñar a los modelos de IA a cumplir bien su tarea objetivo.
El estado actual del proceso de formación en IA muestra algunos signos de este proceso de dos pasos. Sin embargo, debido a que la tecnología GenAI y la industria aún están en su infancia, demasiada capacitación requiere un enfoque de primer nivel menos curado.
Cuando se trata de seguridad de la IA, no podemos darnos el lujo de esperar una hora, y mucho menos una década. La IA necesita una aplicación 23andMe que permita una revisión completa de la “genealogía del algoritmo” para que los desarrolladores puedan comprender completamente la historia “familiar” de la IA para evitar que se repitan problemas crónicos, los sistemas críticos en los que confiamos nos abandonan todos los días, nos infectan y causan daños económicos y sociales que pueden ser irreversibles.
Nuestra seguridad nacional depende de ello.
Este contenido de ciberseguridad nos ha llegado de: DarkReading
Podrás encontrar la noticia original en el enlace que se encuentra a continuación: https://www.darkreading.com/vulnerabilities-threats/why-you-need-to-know-your-ai-ancestry