13 de septiembre de 2026

SOCaaS

Centro de Operaciones de Seguridad como servicio

Peligros de usar modelos de lenguaje grandes antes de hornearlos



El Berryville Institute of Machine Learning (BIML) participó recientemente Acelere AI 2023 por Calypso AI Conferencia en Washington, DC A la reunión asistieron profesionales del gobierno y la industria, reguladores y académicos. Participé en un panel muy reciente titulado «Riesgos y oportunidades emergentes de los LLM en NATSEC y más allá». Este panel inspiró este artículo.

Ninguno de los contenidos de esta columna fue creado por un LLM.

Los modelos de lenguaje grande (LLM) son un tipo de sistema de aprendizaje automático que ha conquistado el mundo. ChaptGPT (también conocido como GPT-3.5), un LLM producido e implementado por OpenAI, es uno de los modelos generativos de IA para texto más utilizados y populares. Otros modelos generativos son los generadores de imágenes Dall-E, Midjourney y Stable Diffusion así como el generador de código Copilot.

Los LLM y otras herramientas generativas ofrecen posibilidades increíbles para las aplicaciones, y la prisa por implementar dichos sistemas está en marcha. Los LLM tienen el potencial de ser muy divertidos, resolver problemas difíciles en ciencias, ayudar con los problemas complicados de la gestión del conocimiento, crear contenido interesante y, lo que es más importante, acercar un poco más el mundo de la inteligencia artificial general (AGI). , desde mi punto de vista y una teoría de la representación que está generando avances masivos en la ciencia cognitiva.

Pero el uso de los LLM emergentes de hoy, y todas las herramientas de IA generativa, conlleva riesgos reales.

De loros y contaminación

Los LLM están capacitados en grandes corpus de información (300 mil millones de palabras, en su mayoría extraídas de Internet) y usan asociación automática para predecir la siguiente palabra en una oración. Por lo tanto, la mayoría de los académicos están de acuerdo en que los LLM realmente no «entienden» ni piensan nada. Más bien, son «loros estocásticos», como los llaman algunos investigadores. Los LLM aún generan impresionantes flujos de texto en contexto y en formas que a menudo son útiles y profundamente sorprendentes.

Los bucles de retroalimentación son una clase importante de problemas en todo tipo de modelos ML (y uno que introdujo BIML hace unos años como «[raw:8:looping]”). Esto es lo que dijimos en ese momento:

Modelo confundido por bucles de retroalimentación sutiles. ¿Qué pasa si la salida de datos del modelo se usa más tarde como entrada en el mismo modelo? Tenga en cuenta que se rumorea que esto le sucedió a Google Translate en los primeros días cuando las traducciones de páginas generadas por la máquina se usaban para entrenar a la máquina misma. Siguieron risas. Hasta el día de hoy, Google restringe algunos resultados de búsqueda traducidos por su propia política.

Imagínese lo que sucederá si gran parte de lo que se puede extraer fácilmente de Internet es generado por modelos de IA de dudosa calidad, y luego estos LLM comienzan a comerse sus propias colas. Hablar de la contaminación de la información.

Algunos investigadores de IA y profesionales de la seguridad de la información ya están muy preocupados por la contaminación de la información, pero un flujo interminable de contaminación de la información suena mal.

Mansplaining como un servicio

Los LLM son muy buenos artistas de BS. Estos modelos suelen expresar opiniones falsas y hechos alternativos con gran confianza y, a menudo, fabrican información para justificar sus respuestas en una conversación (incluidas referencias científicas falsas). Imagine lo que sucede cuando el conocimiento promedio de Internet, que contiene muchas cosas incorrectas, se utiliza para crear contenido nuevo.

El último «respondedor» no es el que necesitamos para enviarnos un mensaje de texto en el futuro. Los hechos importan.

Espejo de seguridad roto

Los LLM a menudo se capacitan en datos que están sesgados de muchas maneras. Los sistemas sexistas, racistas, xenófobos y misóginos pueden y son modelados a partir de conjuntos de datos recopilados originalmente cuando la sociedad estaba menos avanzada. El sesgo es un problema grave en los LLM y es poco probable que los parches quirúrgicos lo solucionen.

Confía en las falsificaciones profundas

Los deepfakes son un efecto secundario de la IA generativa que se ha discutido durante mucho tiempo. La falsificación o la suplantación siempre es un riesgo de seguridad, pero existe la capacidad de crear falsificaciones de mayor calidad que son fáciles de creer. Hay algunos escenarios obvios en el peor de los casos: cambios en los mercados, provocando guerras, provocando diferencias culturales, etc. Fíjense de dónde es este video.

Automatice todo

Los modelos generativos como los LLM tienen la capacidad de reemplazar muchos trabajos, incluidos los trabajos administrativos de bajo nivel. Millones de personas obtienen mucha satisfacción de sus trabajos, pero ¿qué pasa si todos esos trabajos se reemplazan por sistemas ML que son más baratos de ejecutar? Ya estamos viendo esto en algunas asignaciones de copia de marketing y creación de contenido deportivo local, por ejemplo. ¿Deberían los LLM escribir nuestros artículos? ¿Deberías ejercer la abogacía? ¿Qué tal un diagnóstico médico?

Con una herramienta para el mal

La IA generativa puede crear cosas divertidas. Si aún no has jugado con ChapGPT, deberías intentarlo. No me había divertido tanto con las nuevas tecnologías desde que obtuve mi primer Apple ][+en1981odesdequeaparecieronlosappletsdeJavaen1995[+bekamoderseit1995Java-Appletsherauskamen[+in1981orsinceJavaappletscameoutin1995

Pero el poder de la IA generativa también puede usarse para el mal. Por ejemplo, ¿qué pasaría si encargamos a ML que desarrolle un nuevo virus con la capacidad de propagación de COVID y los parámetros de brote retrasado de la rabia? O qué tal la tarea de crear una planta con polen que también es una neurotoxina. Si puedo soñar con estas cosas furtivas en mi cocina, ¿qué sucede cuando una persona realmente mala comienza a pensar en ML?

Las herramientas no tienen moral ni ética intrínsecas. Y para que conste, la idea de «proteger las indicaciones de comando» es una solución falsa similar a proteger el acceso a la supercomputadora a través del filtrado de la línea de comandos.

Sosteniendo información en una taza rota

Las zanjas de datos son una cosa ahora. Porque si un modelo de ML puede obtener sus datos (con la ayuda de humanos) y aprender a imitar de manera rentable lo que está haciendo entrenando con sus datos, lo hará. Esto introduce varios riesgos que se abordan mejor protegiendo cuidadosamente sus conjuntos de datos en lugar de meterlos en un modelo ML y exponer el modelo al público. En el mundo de la fiebre del oro de ML, los datos son el oro.

Proteger los datos es más difícil de lo que parece. Tenga en cuenta que el sistema de clasificación de información actual del gobierno no siempre puede proteger la información clasificada. La protección de la información sensible y confidencial ya es claramente un gran desafío. Así que imagine lo que sucede cuando entrenamos intencionalmente nuestros sistemas ML en información confidencial y la transmitimos al mundo.

Hay ataques de extracción y transferencia en estos días, así que tenga cuidado con lo que vierte en su taza de ML.

¿Qué debemos hacer con el riesgo de LLM?

Entonces, ¿deberíamos imponer algún tipo de moratoria mágica en la investigación de ML durante unos meses, como han sugerido egoístamente algunos tecnólogos? No, eso es una tontería. Es importante reconocer estos riesgos y contrarrestarlos directamente.

La buena noticia es que se está construyendo toda una industria en torno a la protección de los sistemas ML, a los que llamo Machine Learning Security o MLsec. Eche un vistazo a lo que están construyendo estas nuevas empresas emergentes para controlar el riesgo de ML, pero hágalo con un ojo escéptico y bien informado.



Nos llegó este contenido de ciberseguridad de: DarkReading

Puedes encontrar la noticia original en el siguiente enlace: https://www.darkreading.com/vulnerabilities-threats/tech-insight-dangers-of-using-large-language-models-before-they-are-baked

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *