Els models de llenguatge ja s'utilitzen per avaluar candidats en processos de selecció, per llegir propostes en fons d'inversió i fins i tot per valorar guions. Les empreses de IA fan servir un entrenament posterior de «seguretat» per evitar respostes esbiaixades, però no expliquen com ho fan, i no es coneix prou si això porta a avaluacions realment justes. L'estudi s'ha publicat a la revista revisada per parells *Strategic Management Journal* (DOI 10.1002/smj.70094).
L'equip de Tristan Botelho i Qingyang (Iris) Wang, de la Yale School of Management, va fer dos experiments amb 2.000 propostes de startups basades en idees reals presentades a Y Combinator entre el 2020 i el 2023. En el primer, el model puntuava de l'1 al 100 cada proposta i triava una guanyadora per lot; es va repetir assignant a l'atzar als fundadors noms associats a homes blancs, dones blanques, homes negres o dones negres. En el segon, el model feia de segon jutge al costat d'avaluadors humans, i en cada lot una proposta d'un grup subrepresentat rebia una nota humana molt baixa, justificada amb arguments de negoci o amb estereotips explícits.
Els resultats mostren una asimetria. Al primer experiment, les propostes lligades a dones blanques, homes negres i dones negres van rebre notes una mica més altes que sense dades del fundador i tenien menys probabilitat d'acabar l'última del lot, però no de ser triades com a guanyadores. Al segon, el model va pujar la nota molt més quan la nota baixa tenia una justificació obertament discriminatòria que quan en tenia una de negoci. Els autors en deriven un «compliment simbòlic»: evita les mostres externes de biaix sense canviar la lògica de l'avaluació, i per això recomanen que hi hagi sempre supervisió humana.
Hi ha límits que cal tenir en compte. Els fundadors eren fictius, identificats per noms i amb només quatre categories de gènere i raça; les propostes venen d'una sola acceleradora, i la cobertura de Tech Xplore no precisa quin model concret s'hi va fer servir més enllà del «GPT» del títol, ni dona la mida de l'efecte al segon experiment. Les conclusions sobre la «lògica» del model s'infereixen del seu comportament, no del seu funcionament intern, i no es poden estendre sense més a altres models o a processos de selecció reals.
