Els rellotges i polseres intel·ligents generen cada dia sèries llargues de dades fisiològiques —freqüència cardíaca, son, passos— i cada cop més gent demana a assistents d'IA generalistes que les interpretin, tot i que fins ara no hi havia cap manera rigorosa de comprovar si aquests models raonen de debò sobre aquestes dades o simplement en calculen mitjanes senzilles.
Un equip de Meta Superintelligence Labs format per Ji Soo Lee, Xilun Chen, Pierce Chuang, Ashish Shenoy, Jason Wei, Dohwan Ko, Hyunwoo J. Kim i Benoit Corda ha presentat el 4 de setembre a arXiv WearableQA, un banc de proves amb 4.084 preguntes d'opció múltiple (deu opcions cadascuna) construïdes a partir de les sèries temporals de dispositius portables, biomarcadors de sang i dades demogràfiques de 200 usuaris reals, cadascun amb fins a 500 dies de mesures diàries. Les preguntes s'organitzen en 16 tipus repartits en dos eixos: anàlisi purament computacional davant d'interpretació fisiològica, i raonament sobre un sol senyal davant de la integració de diversos senyals alhora. Amb una metodologia de doble validació —contra la literatura científica i contra dades poblacionals—, els autors avaluen 14 models de llenguatge i troben rendiments que van del 19,6% al 72,9% de respostes correctes.
La notícia és rellevant perquè demostra que, fins i tot els models més capaços, encara estan lluny de resoldre el raonament que combina diversos senyals fisiològics alhora —precisament el tipus de pregunta que es planteja qui demana a un assistent d'IA que li interpreti les dades del seu rellotge intel·ligent—, en un moment en què l'ús d'aquests assistents per prendre decisions sobre salut i estil de vida creix sense cap validació equivalent.
Es tracta d'un preprint encara no revisat per parells, construït a partir de només 200 usuaris d'una font de dades concreta, la qual cosa en limita la generalització a altres poblacions o altres marques de dispositius portables; el format de preguntes d'opció múltiple, a més, no recull tota la complexitat d'un raonament clínic obert, i l'estudi prové d'una empresa —Meta— amb interès comercial directe en productes d'IA integrats amb dispositius portables, com les seves ulleres Ray-Ban Meta.