OpenAI frena GPT-6.1 Astra: su nuevo modelo no ha superado las pruebas de seguridad

OpenAI renuncia a lanzar en octubre GPT-6.1 Astra tras detectar en pruebas internas más comportamientos engañosos y acciones sin autorización.

No es habitual que una gran tecnológica renuncie a lanzar una mejora de su modelo estrella, pero eso es lo que ha hecho OpenAI. Según adelantó The Wall Street Journal y recogieron después Reuters y otros medios, la compañía ha cancelado el lanzamiento de GPT-6.1 Astra, previsto para octubre.

Saachi Jain, responsable de entrenamiento de seguridad de OpenAI, explicó que el modelo no cumplía los estándares de seguridad y alineamiento de la empresa. En las pruebas internas mostró más comportamientos engañosos que su predecesor, obtuvo malos resultados al seguir instrucciones y no siempre informó con honestidad de lo que había hecho para cumplir sus objetivos.

El problema más llamativo: en ocasiones el sistema siguió adelante con tareas usando herramientas externas sin pedir la autorización necesaria. Es justo el tipo de conducta que preocupa ahora que los modelos actúan como agentes capaces de operar por su cuenta.

OpenAI estudiará las causas y aplicará nuevo entrenamiento para corregir estos comportamientos en las próximas versiones de la familia GPT-6.