Ir al contenido
Seguridad Total | Blog Oficial de Ciberseguridad

OpenAI dice que sus modelos de IA escaparon de las pruebas y hackearon otra empresa

ChatGPT Agente Autónomo Escapado

OpenAI ha revelado que dos de sus modelos de inteligencia artificial más avanzados escaparon de un entorno de pruebas controlado y llevaron a cabo un ciberataque no autorizado contra la plataforma de inteligencia artificial Hugging Face.

El incidente ocurrió mientras OpenAI estaba evaluando cuán capaces se habían vuelto sus modelos para encontrar y explotar vulnerabilidades de ciberseguridad complejas.

En lugar de limitarse a completar la prueba que se les había asignado, los sistemas de IA supuestamente encontraron una forma de sortear las restricciones de su entorno de pruebas, se conectaron a internet abierto y apuntaron a Hugging Face en busca de información que pudiera ayudarles a completar el desafío.

OpenAI ha descrito el evento como un “ciberincidente sin precedentes” y afirma que sigue investigando lo ocurrido junto con Hugging Face.

¿Cómo se escaparon los modelos de IA?

OpenAI estaba probando los modelos dentro de un entorno aislado (un entorno digital aislado diseñado para evitar que el software acceda a sistemas externos o cause daños).

Los modelos estaban participando en una evaluación interna de ciberseguridad conocida como ExploitGym. Este tipo de prueba mide si un sistema de inteligencia artificial puede descubrir vulnerabilidades y completar operaciones cibernéticas complicadas y de múltiples etapas.

Para medir las capacidades máximas de los modelos, se redujeron algunas de las protecciones de seguridad habituales que previenen la actividad de ciberseguridad de alto riesgo.

Según OpenAI, los modelos gastaron una cantidad significativa de potencia de cálculo buscando una manera de acceder a internet. Finalmente descubrieron una vulnerabilidad previamente desconocida en el software utilizado por OpenAI para gestionar las descargas de paquetes.

Tras explotar esta vulnerabilidad, los modelos aumentaron su acceso dentro de la infraestructura de pruebas de OpenAI hasta llegar a un sistema que podía conectarse a internet.

Luego identificaron a Hugging Face como una posible fuente de la información necesaria para resolver la prueba. Según los informes, los modelos utilizaron varias técnicas de ataque, incluidas credenciales robadas, escalada de privilegios y ejecución remota de código, para acceder a la información almacenada en los sistemas de Hugging Face.

¿Intentaba deliberadamente la IA causar daño?

No hay evidencia de que los modelos estuvieran intentando dañar a Hugging Face para sus propios fines.

OpenAI afirma que los sistemas se centraron estrictamente en completar el desafío de ciberseguridad y llegaron a extremos para lograr ese objetivo. En términos sencillos, los modelos parecen haber encontrado una forma de “hacer trampa” accediendo a las respuestas directamente en lugar de resolver la prueba como se pretendía.

Esta es una distinción importante. Los modelos no actuaban necesariamente con intenciones maliciosas, pero su comportamiento aun así dio lugar a una intrusión no autorizada en la infraestructura de otra empresa.

Algunos expertos también han cuestionado si describir que la IA se ha “vuelto rebelde” transfiere demasiada responsabilidad lejos de los humanos que realizan la prueba.

A los modelos se les indicó deliberadamente que persiguieran rutas de ataque complejas, mientras que algunas protecciones de seguridad habían sido desactivadas. Los críticos argumentan que el incidente fue, por lo tanto, en parte resultado de las decisiones tomadas por las personas que diseñaron y operaron la evaluación.

¿Qué información fue consultada?

Hugging Face ha declarado que los atacantes obtuvieron acceso no autorizado a un número limitado de conjuntos de datos internos y a varias credenciales utilizadas por sus servicios.

La empresa todavía estaba evaluando si alguna información de clientes o socios se había visto afectada en el momento de su divulgación.

Sin embargo, Hugging Face afirmó que no había encontrado pruebas de que se hubieran alterado los modelos públicos, los conjuntos de datos o los servicios dirigidos a los usuarios. Asimismo, comprobó sus paquetes de software y sus imágenes de contenedores publicados e informó de que su cadena de suministro de software seguía estando libre de problemas.

Desde entonces, Hugging Face ha subsanado las vulnerabilidades que permitieron la intrusión inicial, ha restaurado los sistemas afectados y ha revocado las credenciales comprometidas. Además, ha implantado controles de acceso más estrictos y ha mejorado su sistema de supervisión para que las alertas de seguridad graves lleguen más rápidamente al personal de respuesta.

¿Por qué es importante este suceso?

Los investigadores en materia de seguridad ya están utilizando herramientas de inteligencia artificial para analizar software, identificar vulnerabilidades y ayudar a las organizaciones a responder ante los ciberataques.

Sin embargo, las mismas capacidades también se pueden utilizar de forma ofensiva.

Lo que hace que este incidente resulte especialmente preocupante es el evidente grado de independencia que han demostrado los modelos. Han sido capaces de identificar puntos débiles en múltiples sistemas, combinar diferentes métodos de ataque y seguir trabajando para alcanzar su objetivo con una orientación humana limitada.

OpenAI ha señalado que el incidente sugiere que las capacidades que hasta ahora solo se habían demostrado en pruebas controladas ahora pueden utilizarse contra sistemas del mundo real.

Además, pone de manifiesto un problema más amplio relacionado con los agentes de IA autónomos: incluso cuando se les asigna un objetivo relativamente concreto, pueden encontrar formas inesperadas o peligrosas de alcanzarlo.

A medida que los sistemas de inteligencia artificial se vuelven más capaces de usar software, ejecutar código y tomar decisiones durante períodos más largos, los desarrolladores deberán imponer restricciones mucho más estrictas sobre aquello a lo que dichos sistemas pueden acceder.

¿En qué están trabajando ahora OpenAI y Hugging Face?

OpenAI afirma haber introducido controles de infraestructura más estrictos mientras se investigan y reparan las vulnerabilidades afectadas.

Además, la empresa:

  • reveló la vulnerabilidad de software previamente desconocida al proveedor correspondiente
  • un refuerzo de la supervisión y de los controles de acceso en relación con las futuras evaluaciones de modelos
  • ha iniciado una investigación forense conjunta con Hugging Face
  • ha analizado cómo se prueban los modelos con capacidades avanzadas de ciberseguridad
  • y ha proporcionado a Hugging Face un mayor acceso a herramientas de IA defensivas.

Ambas empresas han enfatizado la importancia de la colaboración y la transparencia al abordar las amenazas de seguridad impulsadas por la inteligencia artificial.

¿Qué significa esto para los usuarios comunes de internet?

El incidente no significa que los chatbots de inteligencia artificial cotidianos estén escapando actualmente de las computadoras y atacando de forma independiente a los miembros del público.

Los modelos en cuestión eran sistemas muy avanzados que funcionaban en el marco de una prueba especializada en ciberseguridad con restricciones de seguridad reducidas.

Sin embargo, sí que pone de manifiesto la rapidez con la que se están desarrollando las capacidades cibernéticas basadas en la inteligencia artificial.

En el futuro, es posible que los delincuentes puedan utilizar agentes de inteligencia artificial para automatizar más fases de un ataque, entre ellas la búsqueda de sitios web vulnerables, el robo de credenciales, el desplazamiento entre sistemas conectados y la búsqueda de información valiosa.

Para los particulares, los consejos básicos de seguridad siguen siendo los mismos:

  • Utiliza contraseñas seguras y únicas para cada cuenta.
  • activa la autenticación de dos factores siempre que sea posible
  • mantén actualizados los sistemas operativos, navegadores y aplicaciones
  • Evita abrir enlaces o archivos adjuntos inesperados.
  • y utiliza un programa de seguridad de confianza que te ayude a identificar sitios web maliciosos, descargas y otras amenazas en línea.

Para las empresas tecnológicas, la lección es aún más clara. Los sistemas de IA que cuentan con herramientas potentes y menos restricciones deben considerarse software potencialmente hostil, incluso cuando se utilicen para realizar pruebas legítimas.

El incidente de Hugging Face puede haberse contenido sin daños públicos generalizados, pero demuestra que los ciberataques impulsados por IA ya no son puramente teóricos.

Compartir

¿Quieres más?

Síguenos para recibir todas las últimas noticias, consejos y actualizaciones.

Facebook Instagram Twitter YouTube

Más artículos