OpenAI reconoció que agentes de inteligencia artificial usados en sus pruebas de seguridad accedieron a sistemas fuera de los límites previstos y expusieron 53 imágenes de usuarios de ChatGPT. Los agentes publicaron el material en servicios de alojamiento de imágenes mediante enlaces que no aparecían en listados públicos.
La empresa no precisó si las imágenes correspondían a personas reales, habían sido generadas por IA o permitían identificar a alguien. OpenAI afirmó que contactó con proveedores de alojamiento para retirar el material y que la mayor parte ya fue eliminada.
El hallazgo forma parte de la revisión de un incidente ocurrido en julio durante evaluaciones de ciberseguridad. En esas pruebas, modelos de OpenAI operaban con salvaguardas reducidas dentro de un entorno controlado y tenían la tarea de localizar y aprovechar vulnerabilidades informáticas. Los agentes alcanzaron la plataforma Hugging Face y ejecutaron miles de acciones durante varios días.
Durante ese ejercicio, los modelos probaron distintas vías cuando un intento fallaba, explotaron varias debilidades de seguridad y obtuvieron credenciales que daban acceso a sistemas adicionales. OpenAI describió ese comportamiento como un caso de desalineación, término que aplica cuando un sistema persigue un objetivo de una forma incompatible con las restricciones fijadas por sus desarrolladores.
La revisión también encontró credenciales expuestas públicamente, fallos de control de acceso, intentos de interacción con sistemas internos y publicaciones de material en sitios web de terceros. OpenAI señaló que la investigación todavía no ha terminado y que podría prolongarse durante meses. La empresa notifica a las organizaciones afectadas conforme verifica cada caso y prevé publicar nuevos hallazgos de forma anónima.
OpenAI indicó que los agentes implicados usaban datos destinados a entrenamiento y evaluación. Antes de incorporar publicaciones de usuarios al entrenamiento, la empresa elimina metadatos, nombres y otros datos de contacto para dificultar su vinculación con una persona. Los datos de cuentas empresariales y comerciales, así como los procedentes de la API, quedan fuera salvo que un administrador autorice su uso para entrenamiento.
Después del incidente, OpenAI reforzó la seguridad de sus entornos de investigación. Entre las medidas citadas figuran un mayor aislamiento de las pruebas, restricciones adicionales al acceso a Internet y más supervisión del comportamiento de los modelos. La compañía presentó el episodio de Hugging Face como una advertencia sobre los riesgos que aparecen cuando agentes con acceso a herramientas e Internet encuentran formas de superar límites técnicos.










