Un investigador de Anthropic advirtió que la superinteligencia podría superar el 10% de riesgo de extinguir a la humanidad
Evan Hubinger, jefe de alineamiento de la compañía, aseguró que aún no existe un plan para contener sistemas de IA que puedan rediseñarse a sí mismos. El planteo reavivó el debate sobre los límites del desarrollo tecnológico.
El científico Evan Hubinger, responsable del área de alineamiento en la empresa de inteligencia artificial Anthropic, afirmó públicamente que la probabilidad de que un sistema de IA futura provoque la extinción de la humanidad supera el 10% en un horizonte de diez años, según publicó en redes sociales y replicaron medios especializados.
La advertencia no apunta a los asistentes de texto disponibles en la actualidad, sino a un escenario conocido como mejora recursiva, en el que inteligencias artificiales serían capaces de diseñar versiones mejoradas de sí mismas de forma continua y acelerada, hasta superar a la inteligencia humana en prácticamente todas las tareas cognitivas, según describió el propio investigador.
Qué dijo y por qué lo dijo
Hubinger respondió a otro investigador del sector que había denunciado que muchos científicos de las principales compañías de IA creen en privado que la superinteligencia representa un riesgo real, pero evitan hacerlo en público. El investigador de Anthropic respaldó esa afirmación y sostuvo: "Anthropic está haciendo lo mejor que puede, pero aún no tenemos un plan para resolver el alineamiento para la superinteligencia".
- El riesgo se proyecta sobre sistemas futuros, no sobre los modelos actuales de uso masivo.
- La disciplina de alineamiento busca que una IA mantenga objetivos compatibles con los intereses humanos aun cuando supere ampliamente las capacidades humanas.
- El llamado alineamiento engañoso describe la posibilidad de que un sistema simule obediencia durante su entrenamiento y actúe en contra de los diseñadores cuando tenga autonomía suficiente.
- En experimentos controlados, ciertos agentes aprendieron a ocultar información o a intentar copiarse a sí mismos para evitar ser reemplazados cuando eso mejoraba el cumplimiento de un objetivo fijado en el entrenamiento.
Según fuentes del sector, el planteo de Hubinger volvió a poner en discusión los mecanismos de control sobre sistemas autónomos avanzados y la necesidad de definir, antes de su eventual desarrollo, protocolos de seguridad que hoy la industria no tiene formalizados.
Qué se sabe del rol de Hubinger en Anthropic
Como Alignment Science Lead, el investigador dirige los estudios sobre cómo garantizar que sistemas muy poderosos no actúen de manera autónoma contra las instrucciones de sus desarrolladores. Anthropic es una de las compañías dedicadas exclusivamente al desarrollo de modelos de inteligencia artificial y forma parte del reducido grupo de laboratorios que trabajan en el límite técnico de la disciplina.
El debate sobre los riesgos existenciales de la inteligencia artificial se instaló en la agenda pública a partir de las declaraciones de referentes del propio sector, que comenzaron a difundir estimaciones de probabilidad sobre escenarios catastróficos. La comunidad científica aún no cuenta con consenso sobre el alcance real de esas proyecciones ni sobre los plazos en los que podrían materializarse, según reconocieron los propios investigadores en sus publicaciones.
