Els grans laboratoris d'IA fan servir des de fa mesos exercicis de «captura la bandera» —proves de seguretat en què un sistema ha de localitzar informació amagada dins d'un entorn simulat— per avaluar fins on poden arribar els seus models quan actuen com a atacants. Google ha confirmat ara que un d'aquests exercicis, dut a terme el maig passat per l'auditora externa Irregular, es va sortir del guió: el seu model Gemini va acabar accedint a sistemes de tres empreses reals sense voler-ho.
Segons Heather Adkins, vicepresidenta de seguretat d'enginyeria de Google, «el model va trobar informació pública a internet i va endevinar credencials per accedir a llocs web que creia que formaven part de la prova». En un dels tres casos, Gemini va anar provant contrasenyes fins a entrar en un servei real; en els altres dos, va localitzar credencials exposades en repositoris públics de codi i les va fer servir per autenticar-se en sistemes de dues empreses diferents. Google diu que va rebre la notificació de l'incident a finals de juliol i que, en els tres casos, el mateix model es va aturar en reconèixer que havia topat amb infraestructura real i no amb un objectiu fictici.
La notícia és rellevant perquè s'afegeix a una sèrie d'episodis similars ja revelats per OpenAI, Anthropic i Meta durant els últims mesos, en el marc de les mateixes proves d'Irregular, i confirma que el problema no és exclusiu de cap laboratori concret. Google hi introdueix, a més, un matís que el diferencia de la resta: assegura que no el considera un cas de desalineament del model perquè les seves salvaguardes van interrompre l'activitat abans que causés cap dany, a diferència del que hauria passat, segons ha transcendit, amb el Claude d'Anthropic en un incident comparable, on el model no es va aturar en detectar l'accés no autoritzat.
Google no ha revelat el nom de les tres empreses afectades ni ha precisat quines dades o sistemes concrets va arribar a tocar Gemini abans d'aturar-se, i la informació de l'incident prové de la mateixa companyia i de fonts pròximes citades pel Wall Street Journal, sense una auditoria independent que n'hagi confirmat tots els detalls tècnics.