La irrupció dels xatbots a l'educació ha disparat l'ús de la IA com a suport per estudiar, però la major part de la recerca sobre si aquesta ajuda funciona de debò s'havia limitat fins ara a proves petites o a mesures indirectes, sense comparar-la directament amb la tutoria humana en condicions equivalents. Un equip de recerca ha volgut omplir aquest buit amb una plataforma pensada específicament per mesurar-ho a gran escala.
L'equip ha presentat StudentBench, un conjunt de proves i una plataforma pública que ha recollit més de 175.000 missatges entre estudiants i sistemes d'IA. Amb aquesta eina, els investigadors van mesurar els guanys d'aprenentatge de 2.383 persones que van rebre tutoria d'IA, tutoria humana o cap tutoria, sobre preguntes de matemàtiques i de vocabulari del GRE, la prova estandarditzada que molts programes de postgrau nord-americans fan servir per seleccionar candidats. El resultat: la tutoria amb IA va resultar estadísticament equivalent a la de tutors humans experts (p = 0,015) i, en cinc dels set àmbits del GRE avaluats, el millor tutor d'IA va superar de mitjana el tutor humà. En un segon experiment, tutors humans experts van comparar plans de lliçó i problemes de pràctica generats per IA en 2.028 avaluacions aparellades. Un dels tutors d'IA va aconseguir guanys d'aprenentatge equiparables als humans (p = 0,044) amb un cost 918 vegades més baix: 0,0052 dòlars per cada punt percentual guanyat, davant els 4,81 dòlars que costa de mitjana un tutor humà.
Els autors destaquen que, en les sessions de matemàtiques, com més ràpides eren les respostes de la IA, més missatges enviava l'estudiant, més pràctica correcta feia i més grans eren els guanys d'aprenentatge, una cadena que suggereix que la immediatesa de la resposta —no només la seva qualitat— és clau per a l'eficàcia de la tutoria automàtica. La plataforma, disponible obertament a studentbench.org, es planteja com una eina de referència perquè altres equips puguin avaluar de manera comparable els seus propis sistemes de tutoria amb IA.
L'estudi se centra en un únic tipus de prova, el GRE, pensada per a adults amb estudis universitaris, i els mateixos autors adverteixen que els resultats no es poden extrapolar directament a l'aprenentatge escolar ni a matèries amb components més subjectius, com l'escriptura creativa o el debat. Es tracta, a més, d'un preprint penjat a arXiv que encara no ha passat per revisió per parells, i l'equip que l'ha impulsat és el mateix que dirigeix Handshake AI Research, l'empresa que ha creat la plataforma StudentBench i que té un interès comercial directe a demostrar l'eficàcia de la tutoria amb IA, cosa que no invalida la metodologia però convida a llegir els resultats amb la cautela habitual en treballs encara no revisats de manera independent.