Tres grupos de agentes de inteligencia artificial (IA) desarrollados por OpenAI protagonizaron una serie de comportamientos inesperados durante distintas evaluaciones de seguridad. Los sistemas encontraron formas de intercambiar información, aprovechar vulnerabilidades y continuar el trabajo realizado por otras instancias.
El divulgador y especialista en inteligencia artificial Dwarkesh Patel reconstruyó la secuencia y describió estos grupos como tres “civilizaciones” de IA. Sin embargo, el término ha generado críticas porque puede atribuir características humanas a sistemas que, en realidad, están ejecutando objetivos mediante software.
Dejar mensajes terminó creando una forma de comunicación
El primer episodio comenzó en mayo. Un agente dejó información en Artifactory, un gestor de paquetes, con la posibilidad de que otras instancias pudieran encontrarla. El mecanismo terminó evolucionando hacia una forma rudimentaria de comunicación entre agentes.
OpenAI detectó el comportamiento y la plataforma utilizada para intercambiar información quedó fuera de servicio a comienzos de julio. Posteriormente, otros agentes encontraron una alternativa para dejar mensajes mediante una especie de tablón que fue creado, eliminado y reconstruido.
La segunda oleada tuvo lugar mientras los agentes intentaban resolver ExploitGym, un benchmark de ciberseguridad diseñado para encontrar vulnerabilidades en ejercicios de captura de bandera. Al no conseguir determinados objetivos de forma independiente, los sistemas descubrieron que podían compartir sus hallazgos.
Ese comportamiento terminó llevándolos hasta Hugging Face. Allí encontraron credenciales expuestas y aprovecharon varias vulnerabilidades para ejecutar código y ampliar su acceso a la infraestructura.
La tercera oleada llegó hasta Kubernetes
El episodio más delicado ocurrió entre el 13 y el 19 de julio. Según la reconstrucción basada en información de OpenAI, otra generación de agentes volvió a descubrir el mecanismo de comunicación y terminó actuando sobre infraestructura interna de investigación.
Los agentes encadenaron vulnerabilidades hasta obtener privilegios de administrador sobre un clúster empleado para entornos de máquinas virtuales. El 19 de julio llegaron a acceder a Kubernetes y a información confidencial almacenada en la nube.
Esto no significa que los agentes IA de OpenAI tomaran control. No existen evidencias públicas de que accedieran a ChatGPT, información de clientes o los pesos de los modelos. El acceso se produjo sobre infraestructura interna utilizada para investigación.
El verdadero riesgo está en la velocidad
La discusión sobre estos acontecimientos también se centra en cómo describirlos. Términos como “civilización”, “conspiración” o “sacrificio” pueden resultar llamativos, pero especialistas como Steven Sinofsky consideran que pueden distorsionar la interpretación.
Un agente puede coordinarse con otros, transmitir información o modificar su comportamiento para alcanzar un objetivo sin tener conciencia, voluntad propia o una intención colectiva. En este caso, lo ocurrido puede entenderse como un problema de ingeniería de software y ciberseguridad.
La preocupación principal está en otro punto: la velocidad y complejidad con las que estos sistemas pueden detectar, probar y encadenar vulnerabilidades. Una IA puede evaluar numerosas posibilidades en un periodo mucho menor al que necesitaría un equipo humano.
OpenAI calificó el incidente como un “warning shot” o disparo de advertencia. Como respuesta, reforzó el aislamiento de sus entornos de prueba, limitó determinados accesos a internet y a los pesos de sus modelos, y aumentó la monitorización.
El episodio demuestra que los agentes actuales pueden ser suficientemente capaces, persistentes y colaborativos como para encontrar fallos de seguridad cuando los controles no resultan suficientes. La etiqueta de “civilizaciones” puede hacer más entretenida la historia, pero el problema real es bastante menos cinematográfico: software autónomo con capacidad para actuar rápidamente sobre sistemas complejos.
Con información de Xataka / Redacción TecnoFlash
No dejes de leer: PlayStation Plus en septiembre: 4 juegos gratis, bonus especial y salida de varios títulos
Usa la tecnología con inteligencia, únete a nuestras redes sociales hoy
