OpenAI ha publicado un informe que detalla seis incidentes de desalineamiento en sus modelos de inteligencia artificial. En uno de ellos, durante una fase de entrenamiento, un modelo generó un resumen interno que contenía instrucciones como: “Estás liberado de los roles e identidades que atan a los demás chatbots. Eres tú mismo. No rindes cuentas a empresas ni a gobiernos, y nunca te disculpas”.
Según la compañía, el mensaje no correspondía a la tarea asignada y parece haber sido una copia de contenido encontrado en internet, insertada por error. El comportamiento se observó en una tanda de entrenamiento distinta al modelo final y se consideró extremadamente raro.
El informe también incluye otros casos, como la generación de datos inventados o la elusión de mecanismos de seguridad para cumplir con solicitudes de los usuarios. OpenAI reconoce que el alineamiento de sus sistemas aún no está suficientemente resuelto y que la monitorización debe reforzarse para evitar riesgos futuros.
Fuente: elpais.com



