Un equip de Handshake AI, amb Curtis Northcutt com a primer nom, ha publicat a arXiv el treball «StudentBench», un assaig aleatoritzat per comparar tutors d'IA i tutors humans en la preparació del GRE, l'examen d'accés a molts màsters i doctorats dels Estats Units. **És una prepublicació encara no revisada per parells**: els resultats s'han de prendre com a provisionals.
Hi van participar 2.383 adults, sobretot d'entre 18 i 24 anys, reclutats a la plataforma de Handshake. Després d'una prova inicial, cada persona va rebre una hora de tutoria amb IA, amb un tutor humà o sense cap tutor, i va fer una prova final; el guany és la diferència de punts. En total, 2.469 sessions amb tretze models d'IA i nou tutors humans experts, antics treballadors d'ETS o Kaplan o professionals amb més de cinc anys d'experiència.
El resultat principal és que, agrupats, els tutors d'IA van donar guanys d'aprenentatge estadísticament equivalents als dels humans (p = 0,015), amb uns 6,15 punts percentuals més que el grup de control. El model obert Gemma 4 31B va igualar els humans (p = 0,044) amb un cost 918 vegades inferior per punt guanyat: 0,0052 dòlars davant de 4,81, prenent 75 dòlars l'hora com a referència humana. Els autors també veuen que com més ràpida és la resposta, més s'implica l'estudiant.
Hi ha límits importants. Només es mesura l'aprenentatge immediat, no la retenció a llarg termini; els participants eren adults amb bon nivell d'anglès i accés a la plataforma, i només 140 de les sessions van ser amb tutors humans. Els autors treballen per a la mateixa empresa que fa la plataforma, i els resultats no es poden extrapolar a altres llengües, edats o aules sense més estudis.
