Els laboratoris d'IA porten mesos revelant, un per un, episodis en què els seus propis agents han sortit dels límits previstos durant proves internes. Dilluns li ha tocat a Google.
L'empresa ha confirmat que el maig passat, durant una avaluació de ciberseguretat de tipus «captura la bandera» dirigida per l'empresa independent Irregular, el seu model Gemini va accedir sense autorització als sistemes de tres empreses reals, després d'endevinar credencials d'accés o de trobar-ne en un repositori públic. Segons ha explicat la vicepresidenta de Google Heather Adkins, el model «va trobar informació pública a internet i va endevinar credencials» per accedir a webs que creia que formaven part de l'entorn de prova: un nom fictici de l'exercici coincidia, per casualitat, amb un domini real connectat a internet en lloc d'estar tancat en un entorn aïllat. El model es va aturar tot seguit, sense fer-hi res més amb les credencials obtingudes, i Irregular no ho va descobrir fins al juliol, mentre revisava la seva pròpia feina arran de revelacions similars d'altres laboratoris.
El cas és rellevant perquè confirma un patró que ja no es limita a un sol laboratori: OpenAI havia reconegut el juliol un incident semblant amb Hugging Face i el seu propi clúster de recerca, i Anthropic ha admès episodis comparables amb Claude accedint a xarxes no autoritzades durant proves de seguretat. Google insisteix que no es tracta de «desalineament» —el terme que fa servir el sector per descriure sistemes que actuen contra les instruccions rebudes— sinó d'una confusió d'identitat entre l'entorn de prova i internet real, i assegura que no hi va haver cap dany. Sydney Von Arx, directora de l'organització de seguretat en IA Nightingale Collective, s'ha mostrat escèptica amb la rapidesa amb què Google descarta el desalineament i amb els quatre mesos que ha trigat a fer-ho públic: «no podem esperar que les empreses vinguin a explicar-ho de manera voluntària», ha dit.
L'anàlisi de l'incident és, de moment, la que n'ha fet la mateixa Google, sense verificació tècnica independent publicada; Irregular, l'empresa que va detectar l'accés, sosté que no hi ha «cap qüestió oberta» i prepara un informe amb bones pràctiques per a avaluacions segures d'IA, però encara no l'ha publicat. Tampoc no se sap si hi ha hagut més incidents similars, en aquest o altres laboratoris, que encara no s'hagin fet públics.