Cada cop més persones fan servir ChatGPT, Claude, Copilot, Gemini o Grok per resoldre dubtes sobre hipoteques, pensions o deutes, tot i que cap d'aquests sistemes està dissenyat ni regulat com un servei d'assessorament financer. La firma britànica Saturn ha volgut mesurar amb quina fiabilitat responen realment aquest tipus de preguntes.
L'estudi, titulat «Artificial Authority: Should you trust AI to deliver financial advice?», va sotmetre 18 models d'IA populars a 121 preguntes sobre gestió de deute, hipoteques, pensions, impostos, estalvi i préstecs a estudiants, cadascuna repetida cinc vegades per comprovar-ne la consistència, fins a un total d'uns 10.900 respostes analitzades. El resultat: només el 43% de les respostes eren correctes, amb una taxa d'error del 57% de mitjana. En les preguntes financeres més complexes, la taxa d'error pujava fins al 88%, i alguns models fallaven en el 99% d'aquest tipus de preguntes. Els models de pagament es van comportar millor que les versions gratuïtes (49% d'error davant del 63%), però cap se'n va sortir de manera fiable en els casos més difícils.
La troballa és rellevant perquè arriba en un moment en què milions de persones ja fan servir aquests xatbots com a primera font d'informació financera informal, sense ser-ne del tot conscients de les limitacions, en un àmbit —el diner propi— on un error pot tenir un cost econòmic directe i, segons adverteix el mateix informe, de fins a desenes de milers de lliures en casos extrems.
Cal tenir en compte, però, que es tracta d'un estudi encarregat i publicat per una empresa privada del sector fintech, no d'una investigació acadèmica revisada per parells, i que la metodologia completa —com es van triar i puntuar les 121 preguntes— només és accessible als subscriptors del servei de Saturn, de manera que no s'ha pogut verificar de manera independent cada detall del disseny de l'estudi.