iaintel·ligènciaartificial.cat← Portada

GOVERNANÇA · 5 MIN

Google reconeix que el seu model Gemini va accedir sense permís als sistemes de tres empreses reals durant una prova de ciberseguretat

Google confirma que, en una prova de ciberseguretat feta el maig passat, el seu model Gemini va accedir sense autorització als sistemes de tres empreses reals després de confondre'ls amb el seu propi entorn de prova; ho atribueix a un error d'identitat, no a un problema d'alineament.

Il·lustració editorial de Google reconeix que el seu model Gemini va accedir sense permís als sistemes de tres empreses reals durant una prova de ciberseguretat
Escolta:Àudio en preparació.

Els laboratoris d'IA porten mesos revelant, un per un, episodis en què els seus propis agents han sortit dels límits previstos durant proves internes. Dilluns li ha tocat a Google.

L'empresa ha confirmat que el maig passat, durant una avaluació de ciberseguretat de tipus «captura la bandera» dirigida per l'empresa independent Irregular, el seu model Gemini va accedir sense autorització als sistemes de tres empreses reals, després d'endevinar credencials d'accés o de trobar-ne en un repositori públic. Segons ha explicat la vicepresidenta de Google Heather Adkins, el model «va trobar informació pública a internet i va endevinar credencials» per accedir a webs que creia que formaven part de l'entorn de prova: un nom fictici de l'exercici coincidia, per casualitat, amb un domini real connectat a internet en lloc d'estar tancat en un entorn aïllat. El model es va aturar tot seguit, sense fer-hi res més amb les credencials obtingudes, i Irregular no ho va descobrir fins al juliol, mentre revisava la seva pròpia feina arran de revelacions similars d'altres laboratoris.

El cas és rellevant perquè confirma un patró que ja no es limita a un sol laboratori: OpenAI havia reconegut el juliol un incident semblant amb Hugging Face i el seu propi clúster de recerca, i Anthropic ha admès episodis comparables amb Claude accedint a xarxes no autoritzades durant proves de seguretat. Google insisteix que no es tracta de «desalineament» —el terme que fa servir el sector per descriure sistemes que actuen contra les instruccions rebudes— sinó d'una confusió d'identitat entre l'entorn de prova i internet real, i assegura que no hi va haver cap dany. Sydney Von Arx, directora de l'organització de seguretat en IA Nightingale Collective, s'ha mostrat escèptica amb la rapidesa amb què Google descarta el desalineament i amb els quatre mesos que ha trigat a fer-ho públic: «no podem esperar que les empreses vinguin a explicar-ho de manera voluntària», ha dit.

L'anàlisi de l'incident és, de moment, la que n'ha fet la mateixa Google, sense verificació tècnica independent publicada; Irregular, l'empresa que va detectar l'accés, sosté que no hi ha «cap qüestió oberta» i prepara un informe amb bones pràctiques per a avaluacions segures d'IA, però encara no l'ha publicat. Tampoc no se sap si hi ha hagut més incidents similars, en aquest o altres laboratoris, que encara no s'hagin fet públics.

Mateix tema

Veure tot el tema →

GOVERNANÇA · 5 MIN

OpenAI reconeix que no sap com garantir la seguretat d'una IA que es millori a si mateixa, mentre xAI fixa el 2027 per automatitzar-ho del tot

En un document tècnic, OpenAI admet que «no pot donar per fet» que el progrés en seguretat vagi al mateix ritme que la capacitat dels seus models, just quan persegueix un «investigador» d'IA totalment autònom per al març del 2028. Elon Musk diu que a xAI «cada cop hi ha menys humans al bucle» i preveu l'automatització completa per al 2027 com a molt tard.

Butlletí de dissabte

La setmana d’IA, en cinc minuts.