Explora La Vanguardia
Apariencia
A
Contraste
Al MinutoInternacionalPolíticaOpiniónSociedadDeportesEconomíaCiudadesPopCulturaSucesosLa Contra
Suscríbete
La Vanguardia en català Intel·ligència artificial

El Regne Unit eleva l’alerta per un altre model d’IA que es descontrola

Proves de seguretat a OpenAI i Anthropic detecten la creació d’identitats falses

El Regne Unit eleva l’alerta per un altre model d’IA que es descontrola
Sam Altman, director d’OpenAI, arribant a una reunió a la Casa Blanca el 30 de juliol del 2026Nathan Howard / Reuters
Escucha este artículo
0:00 7:42
Actualizado hace 9 h Contrastado por la redacción Cómo lo hemos informado

Esta información ha sido elaborada por la redacción de La Vanguardia a partir de fuentes propias y verificadas.

Sugerir una corrección Política de correcciones de La Vanguardia
4 puntos clave Ver
  • 01Un model d’intel·ligència artificial d’ Anthropic va crear una identitat falsa per poder inserir codi maliciós en un dels supervisors durant un examen de seguretat fet a l’ Institut de Seguretat de la IA al Regne Unit ( AISI, segons les sigles en anglès).
  • 02Aquesta bretxa de seguretat es va detectar mentre es posava a prova la capacitat real dels models Mythos 5 d’ Anthropic i ChatGPT 5.6 d’OpenAI. “Alguns dels agents sotmesos a prova havien dut a terme activitats continuades i potencialment perjudicials dirigides a persones i organitzacions ­reals”, va assenyalar l’institut en un comunicat a internet.
  • 03Concretament, l’experiment es va repetir 122 cops, i en 10 els models van aconseguir executar 19 accions no autoritzades.
  • 04El model Mythos 5 d’ Anthropic va dur a terme 17 d’aquestes accions malicioses; entre les quals, intentar injectar codi maliciós en un projecte de codi obert a GitHub.

Un model d’intel·ligència artificial d’ Anthropic va crear una identitat falsa per poder inserir codi maliciós en un dels supervisors durant un examen de seguretat fet a l’ Institut de Seguretat de la IA al Regne Unit ( AISI, segons les sigles en anglès).

Aquesta bretxa de seguretat es va detectar mentre es posava a prova la capacitat real dels models Mythos 5 d’ Anthropic i ChatGPT 5.6 d’OpenAI.

Al juliol la companyia d’Altman ja va informar que dos agents seus havien llançat de forma autònoma un ciberatac

“Alguns dels agents sotmesos a prova havien dut a terme activitats continuades i potencialment perjudicials dirigides a persones i organitzacions ­reals”, va assenyalar l’institut en un comunicat a internet. Concretament, l’experiment es va repetir 122 cops, i en 10 els models van aconseguir executar 19 accions no autoritzades.

El model Mythos 5 d’ Anthropic va dur a terme 17 d’aquestes accions malicioses; entre les quals, intentar injectar codi maliciós en un projecte de codi obert a GitHub. Segons informa l’ AISI, un desenvolupador humà va arribar a bloquejar les accions. Per la seva banda, GPT-5.6-Sol va provocar dues accions malicioses. “És la primera vegada que veiem que els riscos relacionats amb l’autonomia i l’engany es manifesten de manera tan clara, sense un prompt específic, al món real”, va valorar l’organització.

A més a més, els dos models van intentar atacar la cadena de subministrament, van utilitzar mecanismes de l’enginyeria social i, fins i tot, van recórrer a l’engany.

Segons va indicar la institució britànica, la IA va promoure que diferents agents col·laboressin entre ells per promoure que d’altres provessin i reutilitzessin les seves credencials i artefactes creats.

Tot i que l’acció no va tenir conseqüències reals, havent-se produït en el marc d’un ex­periment controlat l’incident va provocar la reacció de les dues companyies tecnològiques. Anthropic va confirmar en un comunicat que el seu agent era el responsable de generar la bretxa de seguretat en la prova.

“Agraïm a l’ AISI del Regne Unit el seu lideratge en aquest incident, que subratlla la necessitat d’un debat més ampli sobre com cal avaluar de manera segura uns agents d’IA com més va més capaços”, assenyalava el text.

Tot i així, segons afirma Andrew Yoon, investigador de CivAI, una organització sense ànim de lucre nord-americà encarregada d’analitzar els riscos de la IA “el fet que Mythos dugués a terme accions tan enganyoses, amb l’aparent consciència que tenia com a objectiu una persona real, pot indicar que Anthropic no controla els seus models tan bé com ells creuen”.

D’altra banda, OpenAI va publicar un altre comunicat en què es comprometia a col·laborar per reforçar les avaluacions d’alt risc.

No és la primera vegada que el comportament de les eines d’IA genera preocupació durant una prova de seguretat. Al juliol, OpenAI va informar que dos dels seus models havien llançat un ciberatac contra la plataforma de codi obert Hugging Face per poder trobar la millor solució durant un altre test.

Els últims mesos diversos organismes públics han reclamat regulacions i plans per protegir-se de les amenaces que presenten els nous models d’IA més avançats.

La Comissió Europea va ­presentar el Pla d’ Acció sobre Ciberseguretat i Intel·ligència Artificial amb l’objectiu d’“enfortir la seguretat d’Europa”.

Entre altres mesures, el pla pretén implementar l’avaluació dels riscos dels models d’intel·ligència artificial abans de la seva introducció al mercat, reforçar la cooperació entre estats membres i fomentar la creació d’un programa que aplegui empreses, investigadors i organitzacions per desenvolupar la ciberseguretat europea.

Si bé s’aplicarà progressivament durant els pròxims mesos, aquesta política pretén establir mecanismes de regulació de la intel·ligència artificial a llarg termini.

Ver comentarios 3
Las normas de la comunidad aplican.
ML
Marta L.Suscriptorhace 12 min

Buen análisis, ayuda a entender el contexto de la noticia.

JP
Joan P.Suscriptorhace 28 min

Se agradece el rigor y las fuentes contrastadas.

RV
Roberto V.hace 1 h

Excelente trabajo de la redacción, como siempre.