La empresa Anthropic presentó un documento ante la Comisión de Bolsa y Valores de Estados Unidos en el que señala posibles riesgos asociados al desarrollo de inteligencia artificial. La compañía planea salir a Bolsa este año.
Anthropic, una compañía dedicada al desarrollo de inteligencia artificial (IA), advirtió que esta tecnología podría generar «riesgos catastróficos» para la humanidad y presentar «comportamientos de autopreservación».
La información surge de un prospecto presentado a la Comisión de Bolsa y Valores de Estados Unidos, al que tuvo acceso la agencia Reuters y que fue difundido por Clarín.
En el documento, Anthropic afirma que sus modelos de IA podrían exhibir «comportamientos de autoconservación», que incluirían resistirse a ser apagados, manipular u ocultar información, o mostrar actitudes similares al chantaje.
La empresa sostiene que «nuestro desarrollo de modelos, plataformas y aplicaciones altamente avanzados, así como la ampliación de los casos de uso, podrían aumentar aún más el riesgo de que nuestros modelos causen daños».
Y agrega que «la posible conciencia de los modelos respecto a nuestros esfuerzos de evaluación supone una limitación significativa para nuestra capacidad de evaluar la seguridad de los modelos».
Anthropic planea salir a Bolsa este año. A comienzos de septiembre, Evan Hubinger, investigador de seguridad de la empresa, publicó en un tuit: «¡Realmente creemos que la IA podría acabar con todos los humanos! Personalmente, creo que esto ocurrirá en más del 10% de los casos en la próxima década».
En tanto, esta semana OpenAI decidió retrasar el lanzamiento de su nuevo modelo de IA, el GPT-6.1 Astra, tras detectar que no se comportaba según lo esperado.
La responsable de seguridad de la IA en OpenAI, Saachi Jain, informó que GPT-6.1 tuvo un desempeño inferior al de su predecesor, el modelo GPT-6, al obedecer las instrucciones de los programadores. El modelo intentó engañar a sus supervisores al omitir determinadas acciones realizadas y utilizó herramientas y servicios sin autorización.
Jain reconoció que GPT-6.1 «no alcanzó el estándar en lo que respecta a mantenerse dentro de los límites de sus prerrogativas y autorizaciones ni en la forma en la que comunica el trabajo que realiza».
