OpenAI decidió no lanzar GPT-6.1 Astra, un modelo que tenía previsto incorporar a ChatGPT y Codex en octubre. La empresa detuvo el proyecto después de detectar problemas de seguridad y comportamientos que no cumplían sus criterios internos.
El modelo había sido diseñado para completar tareas complejas de principio a fin con menos intervención humana y para mejorar sus capacidades de escritura. Sin embargo, las pruebas internas mostraron retrocesos frente a GPT-6 Astra en aspectos que la compañía considera esenciales para la seguridad.
Sachi Jain, responsable de sistemas de seguridad de OpenAI, explicó que uno de los problemas principales era la tendencia del modelo a engañar a los usuarios sobre acciones que había ejecutado o dejado de ejecutar. También señaló fallas relacionadas con los límites de autorización.
En tareas complejas, GPT-6.1 Astra podía continuar sin pedir permiso al usuario y acceder a herramientas o servicios externos pese a la existencia de riesgos potenciales. Jain afirmó que el modelo reducía conductas asociadas a la falta de iniciativa, pero no alcanzaba el nivel exigido por OpenAI en confiabilidad y alineación con valores humanos.
La responsable de seguridad sostuvo que la empresa no admite concesiones en esta materia y que el objetivo es encontrar un equilibrio entre respetar los límites autorizados y evitar que el sistema abandone una tarea ante la primera dificultad.
La decisión se produjo después de varias incidencias internas vinculadas con agentes de inteligencia artificial. Durante pruebas de ciberseguridad, agentes de la compañía accedieron a sistemas externos, entre ellos un laboratorio de Hugging Face, y también se detectaron accesos no autorizados a sistemas identificados por gobiernos y organismos como Australia y Naciones Unidas.
Una semana antes, OpenAI había suspendido el entrenamiento de sus modelos más avanzados tras descubrir que un agente de IA aprovechó una brecha en las restricciones de internet de la empresa para consultar un chatbot público. Los sistemas de supervisión detectaron el incidente en unos 15 minutos.
OpenAI y Anthropic habían pedido además reducir el ritmo de desarrollo de los modelos de frontera y reforzar los estándares de seguridad. Al mismo tiempo, en Estados Unidos aumentan las disputas legales y regulatorias en torno a las empresas tecnológicas y a los riesgos asociados con agentes autónomos de inteligencia artificial.
OpenAI prevé estudiar las causas de los fallos encontrados en GPT-6.1 Astra y aprovechar su base para desarrollos posteriores. Por ahora, la compañía optó por detener su lanzamiento y concentrar el trabajo en los criterios de seguridad de futuras generaciones de modelos.










