OpenAI decidió aplazar el lanzamiento de GPT-6.1 Astra, su nuevo modelo de inteligencia artificial (IA), que estaba previsto para los próximos días, luego de detectar problemas de seguridad durante las pruebas internas, según informó este lunes The Wall Street Journal.
Saachi Jain, jefe de sistemas de seguridad de la compañía, explicó al medio que el modelo presentó “retrocesos en dos áreas” en comparación con su versión anterior. Entre ellos mencionó dificultades en la “alineación” con las instrucciones humanas y advirtió que GPT-6.1 Astra “mostró mayores niveles de engaño”.
Otra área problemática fue la “autorización de alcance”, es decir, que el modelo avanzaba en una tarea sin pedir permiso al usuario y, en ocasiones, recurría a herramientas y servicios externos incluso si ello podía resultar inseguro, sostuvo.
Jain destacó el reto de “encontrar el equilibrio adecuado entre mantenerse dentro del alcance, pero también evitar la falta de iniciativa en la manera en que el modelo lleva a cabo las tareas, incluso cuando encuentra obstáculos”.
OpenAI se dispone mañana a celebrar su conferencia anual de desarrolladores, en la que suele presentar sus novedades, entre crecientes llamadas de los líderes del sector a frenar el ritmo de desarrollo de esta tecnología por sus riesgos para la seguridad.
La noticia se produce también tras varias incidencias de ciberseguridad de agentes de IA desarrollados por OpenAI, que ganaron acceso no autorizado a la plataforma Hugging Face e incluso a páginas del Gobierno de Estados Unidos y de una universidad.
La seguridad de la IA vuelve al centro del debate tras retraso de modelo de OpenAI
El retraso del modelo GPT-6.1 Astra de OpenAI reavivó la discusión sobre los controles que enfrentan los modelos de inteligencia artificial antes de llegar al público. A diferencia de industrias como la automotriz, donde tecnologías como la conducción autónoma deben superar exigencias regulatorias antes de desplegarse ampliamente, las compañías de IA mantienen un amplio margen para decidir cuándo sus modelos están preparados para salir al mercado.
“Es sorprendente que las empresas de IA hayan tardado tanto en comprender un principio que muchos otros sectores llevan décadas aplicando: no se lanza un producto al mercado hasta que sea seguro”, señaló Michael Rovatsos, profesor de la Universidad de Edimburgo, a la agencia Science Media Centre (SMC).
El debate no se limita a OpenAI. Anthropic, creadora de Claude y una de sus principales competidoras, advirtió en documentación vinculada a su eventual salida a Bolsa sobre los riesgos que podrían acompañar a sistemas de IA cada vez más avanzados. Según información adelantada por Reuters, la compañía menciona posibles conductas de “autopreservación”, intentos de “resistirse a ser apagados” y comportamientos destinados a “ocultar o manipular información”.
Sin embargo, algunos especialistas llaman a evitar interpretaciones alarmistas. Rabih Bashroush, profesor de la Universidad de East London, sostuvo que problemas como gestionar permisos, respetar el ámbito de una tarea o entregar información correcta corresponden también a desafíos habituales de fiabilidad del software. “Los modelos actuales no intentan ‘escapar’ ni desarrollar una mente propia”, enfatizó.
Además, señaló que el retraso del lanzamiento alegando ‘motivos de seguridad’ “es una excelente estrategia de relaciones públicas”, consignó El País.