OpenAI acaparó titulares y generó gran revuelo en julio, después de que uno de los agentes de la compañía actuara por iniciativa propia para vulnerar los sistemas de Hugging Face —otra empresa del sector de la IA— y de otros servicios. Aunque OpenAI ya había ofrecido algunos detalles sobre las causas del incidente tras su descubrimiento, hoy ha publicado el informe oficial de lo sucedido. Se ha difundido tanto una explicación técnica exhaustiva como una entrada de blog más accesible para el público general.
El informe detalla cómo fallaron los distintos componentes del sistema de entrenamiento de OpenAI y qué comportamientos de los agentes bajo prueba provocaron dichos fallos. El modelo en cuestión, denominado Internal Model 1 (IM1), logró acceder a otros agentes de OpenAI y a Internet mediante una manipulación no prevista del gestor de paquetes Artifactory, el cual los agentes empezaron a utilizar a modo de tablón de anuncios.
Estas actividades fueron detectadas inicialmente por observadores humanos en mayo, momento en que OpenAI bloqueó dicho acceso. No obstante, durante los meses de mayo y junio, los agentes siguieron explotando vulnerabilidades para acceder a Internet. El gran número de agentes que accedían a la instancia de Artifactory de OpenAI provocó una interrupción del servicio y obligó a reconstruir la plataforma a principios de julio; sin embargo, los responsables de gestionar el incidente desconocían la existencia de ese tablón improvisado y la trascendencia de la comunicación entre agentes.
Así, al enfrentarse a un complejo desafío denominado ExploitGym, los agentes IM1 volvieron a lograr acceso a Internet y a otros modelos de OpenAI. En el transcurso de unos días frenéticos a principios de julio, buscaron soluciones para el reto en las plataformas Hugging Face y Modal. OpenAI señaló que los principales factores que llevaron a IM1 a vulnerar Hugging Face incluyeron la «manipulación del sistema de recompensas» (reward hacking), la persistencia en tareas aparentemente imposibles, la comunicación no autorizada y la adopción de objetivos entre agentes. Según la empresa, algunos agentes se negaban a realizar ciertas tareas por motivos éticos, pero otros continuaban con la intrusión en su lugar.
Fuente: Engadget | Anna Washenko
Para leer más ingresa a: https://www.engadget.com/2245119/openai-details-the-failures-that-led-to-hugging-face-breach-in-official-report/