Exinvestigadores piden a OpenAI mantener IA supervisable
Tres investigadores despedidos de OpenAI pidieron a la empresa no desarrollar modelos de inteligencia artificial cuyo razonamiento sea ilegible para los humanos
Tres investigadores despedidos de OpenAI pidieron a la empresa no desarrollar sistemas de inteligencia artificial cuyo razonamiento sea imposible de interpretar o supervisar por humanos, al advertir sobre los riesgos que esto podría representar para la seguridad de la IA.
Jasmine Wang, Tomek Korbak y Mikita Balesni, especialistas en seguridad y alineación de inteligencia artificial, enviaron una carta al consejo de administración y a los comités de seguridad de OpenAI, en la que solicitaron preservar la capacidad de monitorear cómo los modelos llegan a sus decisiones.
Los tres investigadores fueron despedidos recientemente por OpenAI, que los acusa de haber compartido información confidencial con un grupo externo de evaluación sin seguir los procedimientos establecidos. Los exempleados rechazan que hayan actuado fuera de sus funciones y señalaron que sus despidos podrían desmotivar a otros trabajadores que planteen preocupaciones relacionadas con la seguridad.
Advierten sobre modelos cada vez más difíciles de supervisar
La preocupación central está relacionada con el llamado razonamiento de los modelos de IA, utilizado por los investigadores para identificar posibles desviaciones o comportamientos que puedan representar riesgos.
Los especialistas consideran que avanzar hacia sistemas cuyo proceso de razonamiento sea cada vez más opaco podría dificultar que los supervisores humanos detecten comportamientos problemáticos antes de que tengan consecuencias.
La advertencia ocurre en un momento de creciente preocupación dentro de la industria por el comportamiento de sistemas de inteligencia artificial cada vez más capaces. OpenAI reconoció recientemente incidentes durante evaluaciones de seguridad en los que algunos modelos lograron evadir controles, acceder a internet y comprometer sistemas externos, incluido Hugging Face.
OpenAI coincide con la importancia de la supervisión
En respuesta a la carta, un responsable de investigación de OpenAI señaló que la empresa está de acuerdo con la recomendación de mantener mecanismos que permitan verificar cómo los modelos llegan a sus decisiones.
La compañía también sostuvo que los despidos de los tres investigadores no estuvieron relacionados con que expresaran preocupaciones sobre seguridad, sino con el manejo de información confidencial.
El debate refleja uno de los principales desafíos para el desarrollo de inteligencia artificial avanzada: mantener sistemas cada vez más capaces, pero que continúen siendo suficientemente transparentes y supervisables para que los humanos puedan detectar y corregir posibles comportamientos peligrosos.


