Un model d’intel·ligència artificial d’ Anthropic va crear una identitat falsa per poder inserir codi maliciós en un dels supervisors durant un examen de seguretat fet a l’ Institut de Seguretat de la IA al Regne Unit ( AISI, segons les sigles en anglès).
Aquesta bretxa de seguretat es va detectar mentre es posava a prova la capacitat real dels models Mythos 5 d’ Anthropic i ChatGPT 5.6 d’OpenAI.
Al juliol la companyia d’Altman ja va informar que dos agents seus havien llançat de forma autònoma un ciberatac
“Alguns dels agents sotmesos a prova havien dut a terme activitats continuades i potencialment perjudicials dirigides a persones i organitzacions reals”, va assenyalar l’institut en un comunicat a internet. Concretament, l’experiment es va repetir 122 cops, i en 10 els models van aconseguir executar 19 accions no autoritzades.
El model Mythos 5 d’ Anthropic va dur a terme 17 d’aquestes accions malicioses; entre les quals, intentar injectar codi maliciós en un projecte de codi obert a GitHub. Segons informa l’ AISI, un desenvolupador humà va arribar a bloquejar les accions. Per la seva banda, GPT-5.6-Sol va provocar dues accions malicioses. “És la primera vegada que veiem que els riscos relacionats amb l’autonomia i l’engany es manifesten de manera tan clara, sense un prompt específic, al món real”, va valorar l’organització.
A més a més, els dos models van intentar atacar la cadena de subministrament, van utilitzar mecanismes de l’enginyeria social i, fins i tot, van recórrer a l’engany.
Segons va indicar la institució britànica, la IA va promoure que diferents agents col·laboressin entre ells per promoure que d’altres provessin i reutilitzessin les seves credencials i artefactes creats.
Tot i que l’acció no va tenir conseqüències reals, havent-se produït en el marc d’un experiment controlat l’incident va provocar la reacció de les dues companyies tecnològiques. Anthropic va confirmar en un comunicat que el seu agent era el responsable de generar la bretxa de seguretat en la prova.
“Agraïm a l’ AISI del Regne Unit el seu lideratge en aquest incident, que subratlla la necessitat d’un debat més ampli sobre com cal avaluar de manera segura uns agents d’IA com més va més capaços”, assenyalava el text.
Tot i així, segons afirma Andrew Yoon, investigador de CivAI, una organització sense ànim de lucre nord-americà encarregada d’analitzar els riscos de la IA “el fet que Mythos dugués a terme accions tan enganyoses, amb l’aparent consciència que tenia com a objectiu una persona real, pot indicar que Anthropic no controla els seus models tan bé com ells creuen”.
D’altra banda, OpenAI va publicar un altre comunicat en què es comprometia a col·laborar per reforçar les avaluacions d’alt risc.
No és la primera vegada que el comportament de les eines d’IA genera preocupació durant una prova de seguretat. Al juliol, OpenAI va informar que dos dels seus models havien llançat un ciberatac contra la plataforma de codi obert Hugging Face per poder trobar la millor solució durant un altre test.
Els últims mesos diversos organismes públics han reclamat regulacions i plans per protegir-se de les amenaces que presenten els nous models d’IA més avançats.
La Comissió Europea va presentar el Pla d’ Acció sobre Ciberseguretat i Intel·ligència Artificial amb l’objectiu d’“enfortir la seguretat d’Europa”.
Entre altres mesures, el pla pretén implementar l’avaluació dels riscos dels models d’intel·ligència artificial abans de la seva introducció al mercat, reforçar la cooperació entre estats membres i fomentar la creació d’un programa que aplegui empreses, investigadors i organitzacions per desenvolupar la ciberseguretat europea.
Si bé s’aplicarà progressivament durant els pròxims mesos, aquesta política pretén establir mecanismes de regulació de la intel·ligència artificial a llarg termini.

Ver comentarios 3
Buen análisis, ayuda a entender el contexto de la noticia.
Se agradece el rigor y las fuentes contrastadas.
Excelente trabajo de la redacción, como siempre.