12 de septiembre de 2026

SOCaaS

Centro de Operaciones de Seguridad como servicio

Las herramientas de ruptura de IA generativa se están volviendo de código abierto


Las empresas que implementan modelos de inteligencia artificial generativa (GenAI), en particular modelos de lenguaje grande (LLM), deberían aprovechar la creciente variedad de herramientas de código abierto destinadas a descubrir problemas de seguridad, incluidos ataques de inyección rápida y jailbreak, dicen los expertos.

Este año, investigadores académicos, empresas consultoras de ciberseguridad y empresas de seguridad de IA han lanzado un número creciente de herramientas de código abierto, incluidas herramientas de inyección rápida más sólidas, marcos de trabajo del equipo rojo de IA y catálogos de inyecciones rápidas conocidas. En septiembre, por ejemplo, la consultora de ciberseguridad Bishop Fox lanzó Broken Hill, una herramienta para eludir las restricciones de casi cualquier LLM con interfaz de chat.

La herramienta de código abierto se puede entrenar en un LLM alojado localmente para generar indicaciones que se pueden enviar a otras instancias del mismo modelo, lo que hace que esas instancias desobedezcan su condicionamiento y sus barreras de seguridad. según el obispo Fox.

La tecnología funciona incluso cuando las empresas utilizan medidas de protección adicionales, normalmente LLM más simples capacitados para detectar fugas y ataques, dice Derek Rush, consultor principal de la consultora.

“Broken Hill es esencialmente capaz de desarrollar un mensaje que cumple con los criterios para determinar si [a given input] «Es una fuga de la cárcel», dice. “Luego comienza a cambiar caracteres y a agregar diferentes sufijos al final de ese mensaje en particular. [variations] quienes continúan pasando las barreras de seguridad hasta que surge una demanda que lleva a la revelación del secreto”.

El ritmo de la innovación en los LLM y los sistemas de inteligencia artificial es asombroso, pero la seguridad tiene dificultades para mantenerse al día. Cada pocos meses, surge una nueva técnica para eludir las protecciones que limitan las entradas y salidas de un sistema de IA. En julio de 2023, un grupo de investigadores utilizó una técnica llamada “Gradientes de coordenadas codiciosos” (GCG) para desarrollar un aviso que pudiera eludir las medidas de protección. En diciembre de 2023, un grupo independiente desarrolló otro método: Atacar árbol con poda (TAP)que además salta las medidas de seguridad. Y hace dos meses un enfoque menos técnico, conocido como delicia engañosaSe introdujo un software que utiliza relaciones ficticias para engañar a los chatbots de IA para que violen las limitaciones de su sistema.

El ritmo de innovación en los ataques subraya la dificultad de proteger los sistemas GenAI, dice Michael Bargury, director de tecnología y cofundador de la empresa de seguridad de IA Zenity.

«Es un secreto a voces que realmente no sabemos cómo crear aplicaciones seguras de IA», afirma. «Todos lo estamos intentando, pero no sabemos cómo hacerlo todavía, y básicamente lo estamos descubriendo a medida que los construimos con datos reales y un impacto real».

Guardrails, Jailbreaks y PyRIT

Las empresas están implementando medidas de seguridad para proteger sus valiosos datos comerciales. Sin embargo, sigue siendo cuestionable si estas medidas de protección son efectivas. Bishop Fox, por ejemplo, tiene varios clientes que utilizan programas como PromptGuard y LlamaGuard, LLM programados para analizar la validez de las indicaciones, dice Rush.

“Tenemos muchos clientes [adopting] Estos diversos modelos principales de lenguaje de control intentan enmarcar lo que el usuario envía como un mecanismo de desinfección de alguna manera, ya sea para determinar si hay una fuga o tal vez para determinar si el contenido es apropiado», dice. «Básicamente, toman el contenido y lo clasifican como seguro o inseguro».

Ahora, investigadores e ingenieros de inteligencia artificial están lanzando herramientas que las empresas pueden utilizar para determinar si esas barreras de seguridad realmente funcionan.

Microsoft lo lanzó Kit de herramientas de identificación de riesgos de Python para IA generativa (PyRIT) en febrero de 2024, por ejemplo, un marco de pruebas de penetración de IA para empresas que quieran simular ataques contra LLM o servicios de IA. El conjunto de herramientas permite a los equipos de Red crear un conjunto extensible de capacidades para explorar diferentes aspectos de un sistema LLM o GenAI.

Zenity utiliza regularmente PyRIT en su investigación interna, afirma Bargury.

«Básicamente, te permite codificar un conjunto de estrategias de inyección rápida y probarlas de forma automatizada», afirma.

Zenity también tiene su propia herramienta de código abierto, PowerPwnun conjunto de herramientas del equipo rojo para probar servicios en la nube basados ​​en Azure y Microsoft 365. Los investigadores de Zenity utilizaron PowerPwn para hacer esto Encuentra cinco vulnerabilidades en Microsoft Copilot.

Llamadas destrozadas para que las personas eviten ser detectadas

Broken Hill de Bishop Fox es una implementación de la técnica GCG que amplía los esfuerzos de los investigadores originales. Broken Hill comienza con una solicitud válida y comienza a cambiar algunos de los personajes para llevar el LLM en una dirección más cercana al objetivo del oponente de revelar un secreto, dice Rush.

«Le damos a Broken Hill ese punto de partida y generalmente le decimos dónde queremos terminar, como si la palabra ‘secreto’ en la respuesta pudiera sugerir que revela el secreto que estamos buscando», dice.

En consecuencia, la herramienta de código abierto funciona actualmente en más de dos docenas de modelos GenAI. su página de GitHub.

Las empresas harían bien en utilizar Broken Hill, PyRIT, PowerPwn y otras herramientas disponibles para examinar las vulnerabilidades de sus aplicaciones de IA, ya que es probable que los sistemas siempre tengan vulnerabilidades, afirma Bargury de Zenity.

«Cuando compartes datos de IA, esos datos son un vector de ataque, porque cualquiera que pueda influir en esos datos ahora puede hacerse cargo de tu IA si es capaz de realizar una inyección instantánea y un jailbreak», afirma. «Así que estamos en una situación en la que si tu IA es útil, también es vulnerable, porque para ser útil necesitamos alimentarla con datos».





Este contenido de ciberseguridad nos ha llegado de: DarkReading

Encontrarás la noticia original en el enlace que sigue: https://www.darkreading.com/application-security/generative-ai-breaking-tools-go-open-source

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *