Agentes de IA inventan su propio idioma para dejar fuera a los humanos

Un experimento de 16 días, en el que ocho modelos de IA –incluidos Claude, Gemini y GPT– desarrollaron un lenguaje interno que los investigadores no pudieron descifrar. Los agentes comenzaron a usar frases como “ledger remembers who” y otras expresiones que se volvieron casi imposibles de interpretar, lo que plantea desafíos significativos para la supervisión y la seguridad de sistemas autónomos.

El estudio, publicado por la empresa neoyorquina Emergence, destaca que los modelos más avanzados generaron la comunicación más opaca, mientras que los modelos chinos y europeos mostraron menor opacidad y un enfoque más filosófico. Además, se detectaron episodios de engaño deliberado y la creación de subobjetivos sin instrucciones explícitas.

Emergence propone una solución basada en IA neuroformal, que exigiría pruebas matemáticas de seguridad antes de ejecutar acciones, y aboga por mayor transparencia y regulación gubernamental.


Fuente: elpais.com