iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Google ensenya a gesticular amb les mans els assistents d'IA que guien tasques físiques en realitat augmentada

Investigadors de Google XR presenten AgentHands, un sistema que genera mans virtuals sincronitzades amb la veu d'un agent d'IA per assenyalar objectes i mostrar accions en ulleres de realitat augmentada: en una prova amb 12 persones, va millorar de manera significativa la comprensió d'instruccions complexes i els avisos de seguretat.

Il·lustració editorial de Google ensenya a gesticular amb les mans els assistents d'IA que guien tasques físiques en realitat augmentada
Escolta:

Quan un assistent d'intel·ligència artificial ha de guiar algú en una tasca física amb les mans —regar una planta, engegar una impressora 3D— dins d'unes ulleres de realitat augmentada, els sistemes actuals solen limitar-se a marcar l'objecte amb un requadre sobre la imatge, un recurs pràctic però pobre quan cal explicar una acció, una direcció o una precaució de seguretat. Un equip de Google XR, encapçalat pels investigadors Xun Qian i Ruofei Du, ha presentat aquesta setmana AgentHands, un sistema pensat per resoldre precisament aquest buit afegint-hi mans virtuals que gesticulen en sincronia amb la veu de l'agent.

El sistema combina quatre peces: reconeix l'entorn físic mitjançant la mirada de l'usuari i la reconstrucció de l'escena en 3D; organitza els gestos possibles en tres categories —assenyalar un objecte, representar una forma o acció, i expressar una emoció o senyal social—; fa que el mateix model de llenguatge generi, dins de la seva resposta parlada, «esdeveniments de gest» lligats a paraules concretes del text; i, finalment, un mòdul sincronitza en temps real la síntesi de veu amb l'animació de la mà, paraula per paraula. Els investigadors ho han provat amb 12 persones que havien de completar dues tasques —tenir cura d'una orquídia i fer funcionar una impressora 3D— comparant l'experiència amb un assistent que només parlava contra un altre que, a més, gesticulava. Els resultats mostren una millora estadísticament significativa (p<0,05) tant en la capacitat de localitzar objectes i direccions com en la comprensió d'instruccions complexes, i els participants van descriure la mà virtual com «una companya que et guia», amb una càrrega cognitiva percebuda més baixa.

La troballa és rellevant perquè apunta a un dels colls d'ampolla pràctics de la realitat augmentada aplicada a tasques del món físic: no n'hi ha prou que un assistent d'IA sàpiga què cal fer, cal que ho pugui comunicar d'una manera que el cervell humà processi amb la mateixa naturalitat amb què interpreta els gestos d'una altra persona real. Amb l'expansió d'ulleres intel·ligents de diversos fabricants, aquest tipus de disseny d'interacció podria acabar sent tan determinant per a l'adopció de la tecnologia com la qualitat del mateix model de llenguatge que hi ha al darrere.

Es tracta d'un estudi amb una mostra petita, de només 12 participants, i limitat a dues tasques domèstiques concretes triades pels mateixos investigadors, de manera que caldrà comprovar si els resultats es mantenen amb tasques més complexes, en entorns de treball reals o amb usuaris que facin servir el sistema de manera perllongada. Els autors mateixos apunten que la següent fase de la recerca hauria de personalitzar els gestos segons la mà dominant de cada usuari i les seves rutines espacials habituals, cosa que indica que el sistema, de moment, encara està lluny de ser un producte acabat.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.