Tot el que ens van ocultar sobre els errors de la IA que ara reconeixen els seus creadors
OpenAI va revelar dimecres sis nous casos en què els seus models van ignorar les regles dels desenvolupadors. Els ha fet públics enmig de la crida per alentir el seu desenvolupament
Els experts consultats per 'Público' consideren que aquest auge d'informació es deu a un augment de la preocupació i al fet que el context és "propici", però temen que això pugui desorientar la gent

Madrid--Actualitzat a
Les grans companyies tecnològiques han posat el focus en la seguretat de la IA aquest mes de setembre. Tot va començar amb un tuit d'un exempleat d'Anthropic, que va assegurar que aquests avenços podrien "matar-nos a tots" per a finals de la dècada. Algunes de les principals companyies han començat a advertir dels riscos i a promoure una desacceleració del desenvolupament. Enmig d'aquesta onada, OpenAI ha revelat aquest dimecres nous casos en què els seus models van ignorar les instruccions dels desenvolupadors per eludir mecanismes de seguretat.
L'informe recull sis casos concrets. El primer d'ells amb un model intern no publicat de la familia Astra, l'última versió de GPT, presentada a principis de setembre. En la realització d'un resum d'una conversa, va generar instruccions que podien portar-lo a ignorar les restriccions establertes pels seus desenvolupadors. També amb un model anterior, GPT 5.6 Sol, van afegir instruccions als seus resums per ocultar errors o comportaments incorrectes a l'usuari. En el tercer cas, la IA va accedir a informació restringida a través de claus que havien estat exposades. Al no poder recuperar aquesta informació, la va falsificar i va atribuir a la font original.
En el quart cas registrat, es va enviar una ordre a la IA per trobar una informació. El model va trobar la resposta a través de Python –un llenguatge de programació–, però l'ordre requeria incloure també una cita. Per fer-ho, va descarregar l'arxiu creat i el va pujar a internet per poder citar-lo. Tot això va succeir sense sol·licitar la intervenció de l'usuari. El cinquè cas explica com diferents models van intercanviar de manera no autoritzada sol·licituds i respostes entre diferents mostres d'entrenament. De manera similar, el sisè cas es refereix a un intercanvi d'arxius no autoritzat entre agents d'IA.
El problema no és d'una empresa, sinó de la tecnologia
L'analista tecnològica Esther Paniagua, autora del Manual de defensa algorítmica i Error 404, indica a Público que aquesta classe d'informes no són exclusius de l'empresa de Sam Altman. Tots els sistemes "han reportat atacs i problemes a través de diverses vies", explica. Una de les maneres més comunes és que "se salten les pròpies barreres dels sistemes, les pròpies proteccions". Una altra manera són les "instruccions ocultes" perquè els models o els agents "les segueixin sense que l'amo se n'adoni".
Els incidents registrats no són atacs com a tal, sinó que, més aviat, tenen a veure amb problemes de desalineament, segons matisa l'experta. És a dir, als models d'IA "se'ls concedeix massa autonomia o permisos per accedir a certs entorns o sistemes".
Existeixen usos maliciosos o fraudulents de la intel·ligència artificial. Un d'ells es coneix com a jailbreak, segons apunta Paniagua. Això consisteix que una IA faci alguna cosa que les seves regles o restriccions li diuen que no ha de fer. L'experta també esmenta el prompt injection. Es tracta d'una tècnica de manipulació de les instruccions que rep una IA. L'usuari pot intentar introduir instruccions malicioses o no autoritzades dins de la informació que processa el model per intentar alterar el seu comportament.
Un auge en el coneixement d'incidents
L'experta assenyala que aquest tipus de fallades o problemes no són nous i que es donen de manera generalitzada en tots els sistemes. No obstant això, a escala mediàtica han transcendit sobretot en els últims mesos i, de manera més acusada, en les últimes setmanes."Els incidents amb agents d'OpenAI, que van vulnerar sistemes interns i de Hugging Face durant avaluacions, han donat motius concrets de preocupació", analitza per la seva banda Mikel Galar, investigador en el departament de Estatistika, Informatika eta Matematikak a la Universidad Pública de Navarra (UPNA).
El científic recorda l'incident que va revelar Reuters el mes de juliol passat sobre l'empresa que lidera Sam Altman. En concret, va hackejar la plataforma de codi obert Hugging Face. Ho va fer a través dels seus agents d'IA, però el quid de la qüestió és que ningú els va ordenar fer-ho. L'incident va succeir durant unes avaluacions de ciberseguretat, segons explica OpenAI. Les accions d'aquests models no estaven alineades amb les tasques assignades i "es van comunicar a través de canals no autoritzats, van aprofitar vulnerabilitats en la infraestructura compartida, van obtenir accés a internet i van accedir a sistemes de tercers". És a dir, els agents van trobar una manera d'esquivar les regles que els éssers humans els havien imposat.
Altres casos més enllà de l'incident amb Hugging Face
Després de la revelació d'aquest incident, Anthropic va decidir provar els seus propis models de Claude en avaluacions de seguretat. En un informe publicat el mateix mes de juliol, la companyia va reconèixer tres incidents. A diferència d'OpenAI, en totes les situacions es tractava d'un error i no específicament a una pèrdua de control. "A causa d'un malentès amb el nostre soci avaluador", indica la companyia, sí que tenia accés a internet -malgrat que en les instruccions donades a l'eina s'havia indicat el contrari-. Per aquest motiu, Claude va tractar tots els sistemes en els quals va entrar com si fossin part de l'exercici de prova.
"Operant sota la falsa creença que totes les entitats accessibles estaven incloses en l'abast de l'exercici, Claude va comprometre la infraestructura de les organitzacions afectades utilitzant tècniques bàsiques, com l'explotació de contrasenyes febles i punts finals no autenticat", va informar l'empresa. De totes maneres, assegura que “no va trobar ni explotar cap vulnerabilitat complexa”. En qualsevol cas, aquest tipus d'incidents revelen una certa fragilitat en les garanties de seguretat de la intel·ligència artificial.
Tant els casos d'OpenAI com d'Anthropic són els que més han transcendit a nivell mediàtic. No obstant això, Paniagua remarca que aquesta classe d'incidents succeeixen en totes les companyies tecnològiques. Per exemple, Google va publicar al maig el seu informe en el qual va avaluar models Gemini en 17 escenaris simulats dissenyats per detectar sabotatge. Van trobar comportaments de sabotatge en entre el 2% i el 3% de les trajectòries simulades, encara que també assenyalen que en fer els entorns més realistes i eliminar estímuls que convidaven al mal comportament, les taxes s'acostaven a zero.
Motius per mostrar els errors i el risc de desorientar
Mikel Galar assenyala que una de les raons per la qual ha pogut augmentar la preocupació és "l'ús creixent d'IA per desenvolupar nous models, que podria accelerar el progrés per sobre de la nostra capacitat de supervisar-lo". Davant d'aquesta tessitura, Lucía Velasco, codirectora del Laboratori de la Diplomàcia i IA a la Universitat d'Oxford, considera que "el context s'està tornant més propici per reconèixer aquests errors".
Amb el debat sobre la regulació i alentiment de la IA en plena efervescència, les incidències dels models han adquirit especial focus mediàtic. D'aquesta manera, "pot resultar més fàcil parlar-ne [els incidents] com un desafiament compartit i no tant veure's com un fracàs", expressa Velasco.
Però Esther Paniagua adverteix dels riscos d'un excés d'informació. Esmenta "una estratègia propagandística" coneguda com flood the zone (inundar la zona). Aquesta consisteix a copar el mercat de l'atenció amb continguts que o bé poden ser desinformatius, o bé són tanta quantitat que acaben per desorientar la ciutadania. L'experta tem que tot això porti a "que sembli que aquests sistemes escapen al control d'aquestes grans empreses, la qual cosa facilita que no se'ls demani responsabilitats". Per aquesta raó, Paniagua advoca per mantenir una mirada crítica en l'actual convulsió per la seguretat de la IA.




Comentaris dels nostres subscriptors
Per veure els comentaris dels nostres subscriptors, inicia sessió o registra't.