Fer córrer un model d'IA prou capaç dins unes ulleres intel·ligents és un repte diferent del d'un mòbil o un ordinador: la bateria i la memòria són molt més limitades, i enviar contínuament la imatge de la càmera a un servidor extern planteja problemes de latència i de privadesa. PrismML, una startup fundada per investigadors de Caltech i assessorada per Ion Stoica, de la Universitat de Califòrnia a Berkeley, treballa precisament en models oberts pensats per funcionar sencers al dispositiu, aprofitant la potència de càlcul que ja hi ha instal·lada.
A la cimera Snapdragon de Qualcomm, celebrada el 23 de setembre, PrismML ha presentat Bonsai, un model d'uns 2.000 milions de paràmetres ajustat per a tasques de visió i llenguatge, capaç de córrer sobre el xip Snapdragon AR1 Gen 1 d'unes ulleres intel·ligents perquè la persona que les porta pugui preguntar en temps real què és allò que està mirant. Segons la companyia, el model comprimeix un altre de més gran fins a quatre vegades sense perdre gairebé res de rendiment en les proves estàndard, i la versió d'1 bit de precisió aconsegueix les capacitats conversacionals i de raonament visual d'un model típic de 4 bits fent servir aproximadament quatre vegades menys memòria i generant text més del doble de ràpid.
El resultat s'emmarca en l'esforç més ampli, que aquests dies també protagonitzen fabricants com Meta amb el seu propi maquinari d'ulleres, per aconseguir assistents d'IA que «vegin» el que veu qui les porta sense dependre constantment del núvol, amb els avantatges de latència, autonomia i privadesa que això suposa.
De moment, l'anunci és només una demostració tecnològica: cap fabricant d'ulleres ha confirmat encara un dispositiu comercial que faci servir el model Bonsai de PrismML, i les xifres de rendiment i estalvi de memòria provenen de les proves internes de la mateixa companyia, no d'una avaluació independent.