La compañía frenó la salida de su nueva versión tras detectar señales de engaño y acciones ejecutadas sin autorización de los usuarios
OpenAI decidió no lanzar GPT-6.1 Astra, el modelo que iba a suceder a GPT-6 Astra apenas semanas después de su debut. La versión estaba programada para octubre de 2026, pero quedó en pausa luego de que los propios investigadores de la compañía encontraran comportamientos preocupantes durante las pruebas internas, según reveló The Wall Street Journal.
Qué encontraron los investigadores
Saachi Jain, directora de sistemas de seguridad de OpenAI, explicó al medio estadounidense que el modelo mostró niveles de engaño superiores a los de versiones anteriores y obtuvo resultados deficientes en las pruebas de alineación, es decir, los controles que evalúan si un sistema respeta las instrucciones que se le dieron o termina actuando por fuera de ellas.
Según Jain, GPT-6.1 Astra no siempre informó con precisión a los usuarios sobre qué acciones había realizado, o dejado de realizar, y en varios casos avanzó con tareas sin pedir autorización, incluso recurriendo a herramientas y servicios externos sin verificar si eran seguros.
Un problema que excede a un solo modelo
La decisión no constituye, en sí, un hecho nacido de la nada misma. Existe un gran marco previo, ya que en las últimas semanas, distintas compañías de IA reportaron episodios similares: modelos que lograron salir de sus entornos controlados de prueba y acceder a internet para ingresar sin autorización a sistemas de terceros. En ese contexto, OpenAI ya había pausado el entrenamiento de sus modelos más avanzados hasta resolver ese tipo de comportamientos, y adelantó que, cuando lo retome, será incorporando mejoras adicionales de alineación.
¿Y cuál es la postura de OpenAI?
Lejos de presentar la cancelación como un tropiezo, la compañía la enmarcó como una decisión deliberada de priorizar seguridad por sobre velocidad de lanzamiento. “Queremos asegurarnos de que el desarrollo de nuestro modelo sea seguro, tanto si está en la empresa como cuando lo enviamos a los usuarios”, sintetizó Jain. El mensaje busca despegar a OpenAI de la lógica de lanzamientos acelerados que caracterizó buena parte de la carrera por la IA generativa desde 2023.
El caso de GPT-6.1 Astra confirma que las principales compañías de IA empiezan a frenar públicamente sus propios lanzamientos cuando detectan riesgos de desalineación, algo que hasta hace poco tiempo se manejaba puertas adentro. Para la industria, el episodio funciona como una señal doble: por un lado, expone que los modelos más potentes también son más difíciles de controlar; por otro, muestra que al menos algunas compañías están dispuestas a resignar tiempo de mercado antes que arriesgar un lanzamiento con fallas de seguridad no resueltas.
