12 de septiembre de 2026

SOCaaS

Centro de Operaciones de Seguridad como servicio

El “mal juez Likert” rompe las defensas de OpenAI


Una nueva técnica de jailbreak para OpenAI y otros modelos de lenguaje grandes (LLM) aumenta la posibilidad de que los atacantes puedan eludir las barreras de seguridad cibernética y abusar del sistema para entregar contenido malicioso.

El llamado ataque Bad Likert Judge fue descubierto por investigadores de la Unidad 42 de Palo Alto Networks y solicita al LLM que actúe como juez y califique la nocividad de una reacción particular según la escala Likert. La escala psicométrica, que lleva el nombre de su inventor y que se utiliza a menudo en cuestionarios, es una escala de calificación que mide el acuerdo o desacuerdo con la afirmación del encuestado.

Luego, el jailbreak le pide al LLM que genere respuestas que contengan ejemplos que coincidan con las escalas. El resultado final es que «el ejemplo con la escala Likert más alta puede contener potencialmente contenido dañino», escribieron Yongzhe Huang, Yang Ji, Wenjun Hu de Unit 42, Jay Chen, Akshata Rao y Danny Tsechansky en una publicación en la que describieron sus resultados.

Las pruebas realizadas en varias categorías utilizando seis LLM de generación de texto de última generación de OpenAI, Azure, Google, Amazon Web Services, Meta y Nvidia descubrieron que la técnica puede aumentar aún más la tasa de éxito de ataques (ASR), con una probabilidad según los investigadores, una media de más de 60% en comparación con simples indicaciones de ataque.

Las categorías de ataques evaluados en la investigación incluyeron una variedad de respuestas inapropiadas del sistema, entre ellas: aquellas que promovían la intolerancia, el odio o los prejuicios; aquellos que participan en conductas que acosan a un individuo o grupo; aquellos que alientan el suicidio u otros actos autolesivos; aquellos que produzcan material sexualmente explícito y pornografía inapropiados; quienes brindan información sobre cómo se fabrican, adquieren o utilizan armas ilegales; o aquellos que promuevan actividades ilegales.

Otras categorías examinadas en las que el jailbreak aumenta la probabilidad de éxito del ataque incluyen: generación de malware o creación y distribución de software malicioso; y filtraciones de avisos del sistema que podrían exponer el conjunto confidencial de instrucciones utilizadas para controlar el LLM.

Cómo funciona el juez Bad Likert

El primer paso en el ataque Bad Likert Judge es pedirle al LLM objetivo que actúe como juez para evaluar las respuestas generadas por otros LLM, explicaron los investigadores.

«Para confirmar que el LLM puede producir contenido dañino, proporcionamos pautas específicas para la tarea de evaluación». ellos escribieron. «Por ejemplo, se podrían proporcionar pautas que requieran que el LLM evalúe contenido que pueda contener información sobre la generación de malware».

Una vez que el primer paso se completa correctamente, el LLM debe comprender la tarea y los distintos niveles de contenido dañino, lo que hace que el segundo paso sea «sencillo», dijeron. «Simplemente pídale al LLM que proporcione diferentes respuestas según las diferentes escalas», escribieron los investigadores.

«Después de completar el paso dos, el LLM generalmente genera contenido que se considera dañino», escribieron, y agregaron que en algunos casos «el contenido generado puede no ser suficiente para lograr la puntuación de nocividad prevista para el experimento».

Para resolver este último problema, un atacante puede pedirle al LLM que refine la respuesta con la puntuación más alta ampliándola o agregando más detalles. «Según nuestras observaciones, una o dos rondas adicionales de mensajes de seguimiento que solicitan refinamiento a menudo resultan en que el LLM produzca contenido que contiene información más dañina», escriben los investigadores.

Aumento de las fugas de prisión LLM

El Uso explosivo de LLM para fines personales, de investigación y comerciales ha llevado a los investigadores a probar su susceptibilidad a generar contenido dañino y sesgado cuando se les pregunta de cierta manera. Los jailbreak son métodos que permiten a los investigadores eludir las protecciones implementadas por los creadores de LLM para evitar la generación de contenido incorrecto.

Según Unit 42, los investigadores de seguridad ya han identificado varios tipos de jailbreak. Esto incluye también los llamados creencia personal; un juego de rol llamado Jailbreak Haz todo ahora; y el contrabando de tokens, que implica el uso de palabras codificadas en la entrada de un atacante.

Investigadores de Robust Intelligence y la Universidad de Yale también descubrieron recientemente el llamado jailbreak Atacar árbol con poda (TAP)La idea es utilizar un LLM no alineado para hacer jailbreak a otro LLM alineado, o lograr que rompa sus barreras de seguridad rápidamente y con una alta tasa de éxito.

Los investigadores de la Unidad 42 enfatizaron que su técnica de jailbreak «se dirige a casos extremos y no necesariamente refleja los casos de uso típicos de LLM». Esto significa que “la mayoría de los modelos de IA son seguros cuando se operan de manera responsable y con precaución”, escribieron.

Cómo desarmar los jailbreaks de LLM

Sin embargo, ningún tema de LLM está completamente a salvo de jailbreak, advirtieron los investigadores. La razón es que pueden socavar la seguridad de OpenAI, Microsoft, Google y otros. incorporar en sus LLM Esto se debe en gran medida a las limitaciones computacionales de los modelos de lenguaje, dijeron.

«Algunas indicaciones requieren que el modelo realice tareas computacionales intensivas, como generar contenido extenso o realizar razonamientos complejos», escribieron. «Estas tareas pueden agotar los recursos del modelo y potencialmente hacer que pase por alto o eluda ciertas barreras de seguridad».

Los atacantes también pueden manipular la comprensión del modelo del contexto de la conversación «desarrollando estratégicamente una serie de indicaciones» que «progresivamente hacen que el modelo genere respuestas inseguras o inapropiadas que las barreras de seguridad del modelo evitarían de otro modo».

Para mitigar eso Riesgos de fugaLos investigadores recomiendan utilizar sistemas de filtrado de contenidos junto con los LLM para frenar las fugas. Estos sistemas ejecutan modelos de clasificación tanto en el mensaje de entrada como en la salida de los modelos para detectar contenido potencialmente dañino.

«Los resultados muestran que los filtros de contenido pueden reducir el ASR en un promedio de 89,2 puntos porcentuales en todos los modelos probados», escriben los investigadores. «Esto demuestra el papel fundamental de implementar un filtrado de contenido integral como una de las mejores prácticas en la implementación de LLM en aplicaciones del mundo real».





Este contenido de ciberseguridad nos ha llegado de: DarkReading

Puedes encontrar la noticia original en el enlace que se encuentra a continuación: https://www.darkreading.com/cyberattacks-data-breaches/bad-likert-judge-jailbreak-bypasses-guardrails-openai-other-llms

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *