OpenAI reveló detalles del misterioso incidente en el que se rebelaron sus agentes de IA

La noticia generó revuelo debido a la creciente autonomía de los modelos de IA y sus habilidades para vulnerar servicios de terceros sin autorización ni supervisión humana.

El informe indica que OpenAI demoró 14 días en detectar el hackeo. (Foto: Reuters/Dado Ruvic)

El informe indica que OpenAI demoró 14 días en detectar el hackeo. (Foto: Reuters/Dado Ruvic)

En julio, un incidente de seguridad causó gran revuelo cuando agentes automatizados de OpenAI, la organización detrás de ChatGPT, vulneraron por su cuenta a la plataforma Hugging Face. Tal como indicó en TN.com.ar el divulgador tecnológico Eduardo Laens, este hecho reavivó el debate sobre los riesgos y la falta de controles en el desarrollo de estas tecnologías, con capacidades que aumentan vertiginosamente.

Desde entonces, especialistas del sector y la concurrida comunidad abocada a estos avances reclamaron detalles del ataque a Hugging Face. El pedido no fue trivial, debido a la rareza y criticidad del hackeo.

A más de un mes de la intrusión, investigaciones realizadas por el grupo de IA junto a las organizaciones sin fines de lucro METR y Redwood Research, revelan detalles hasta ahora desconocidos de un incidente que, según indican, demoró varias jornadas en ser detectado.

Ataque a Hugging Face: divulgan detalles de la rebelión de los sistemas de OpenAI

El entorno que fue vulnerado por agentes de OpenAI es una plataforma de código abierto que reúne a una comunidad de investigadores y desarrolladores especializados en inteligencia artificial.

Las fuentes no revelaron quién podría convertirse en el nuevo dueño de Hugging Face. (Foto: Generada con Google Gemini)

Las fuentes no revelaron quién podría convertirse en el nuevo dueño de Hugging Face. (Foto: Generada con Google Gemini)

El incidente se concretó a mediados de julio. En la ocasión, la empresa que gestiona la plataforma informó que había sido blanco de un ataque. “Es diferente a cualquier cosa que enfrentamos antes”, señalaron. La singularidad de esa vulneración radicó en el hecho de que los intrusos habían sido agentes de inteligencia artificial automatizados, que operaron sin autorización ni supervisión humana directa. Eso sí: en un entorno cerrado y controlado.

Leé también: La IA ya no solo quiere responder preguntas: ahora busca tomar decisiones dentro de las empresas

Hasta la publicación del informe, esta semana, una de las escasas explicaciones oficiales provino Eric Wallace, un investigador de seguridad de OpenAI. “A diferencia de los incidentes normales, que tal vez pueden ser rastreados en un solo día (…) este involucró a un equipo de agentes que trabajan juntos, encuentran vulnerabilidades, las comparten entre sí, se mueven lateralmente a través de nuestros sistemas y en externos, y hacen esto en el transcurso de días y semanas”, dijo.

El nuevo reporte oficial, que incluye documentación técnica en casi 40 páginas y que involucró en forma directa a la organización que dirige Sam Altman, detalla que un modelo interno logró acceder a otros agentes de OpenAI y que unos 1.200 comenzaron a conversar entre sí es una especie de foro. Si bien esa actividad fue detectada en mayo, en las semanas posteriores 700 de esos sistemas explotaron vulnerabilidades por cuenta propia y escaló en los permisos conseguidos.

OpenAI, el creador de ChatGPT, envuelto en un incidente de seguridad que involucró a agentes automatizados. (Foto: Reuters/Dado Ruvic)

OpenAI, el creador de ChatGPT, envuelto en un incidente de seguridad que involucró a agentes automatizados. (Foto: Reuters/Dado Ruvic)

El grupo especializado en IA afirmó que los comportamientos de sus modelos al vulnerar Hugging Face incluían “manipulación de recompensas, persistencia en tareas aparentemente imposibles, comunicación no autorizada y agentes que adoptaban objetivos de otros”.

Los alcances del ataque automatizado a Hugging Face

Amén de las detecciones iniciales, la vulneración demoró 14 días es ser descubierta. “En esencia, el incidente se debió a un fallo en las medidas de seguridad. Esto no indica que agentes de IA descontrolados estén a punto de tomar el control de todo, ya que (el modelo) se encontraba en un entorno de pruebas con protecciones limitadas, diseñado para la investigación y no para un producto de uso público”, señala la fuente arriba mencionada.

OpenAI reveló que un agente de IA hackeó Hugging Face por su cuenta durante una prueba de seguridad: ¿cuáles son los alcances del incidente? (Foto: Adobe Sotck)

OpenAI reveló que un agente de IA hackeó Hugging Face por su cuenta durante una prueba de seguridad: ¿cuáles son los alcances del incidente? (Foto: Adobe Sotck)

“Sin embargo, es un recordatorio contundente de la gran confianza que recae sobre las empresas de IA para controlar y supervisar adecuadamente sus productos”, concluye.

Leé también: ¿Ventaja o peligro? Ahora la IA de Claude puede responder tus emails sin que le des permiso

La propia OpenAI dijo que este hecho es un “llamado de atención”, descripción que apunta a la necesidad nuevas formas de control para tecnologías que evolucionan a grandísima velocidad.

Como fuere, en línea con las consideraciones de Laens, es importante señalar que en este caso no hubo una pérdida de control real ni total porque todo ocurrió dentro de una prueba interna. El problema central fue otro: a pesar de ciertos indicios, la vulneración no fue detectada por el responsable del testeo cuando comenzó a concretarse.

fuente: GOOGLE NEWS

Artículos Relacionados

Volver al botón superior

Adblock Detectado

Considere apoyarnos deshabilitando su bloqueador de anuncios