iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un mètode de Cambridge i DeepMind fa que un model d'IA sàpiga si s'equivoca sense haver de repetir la resposta deu vegades

XConf estima la confiança d'un model de llenguatge a partir de com li ha anat en episodis passats semblants, en lloc de generar la mateixa resposta múltiples vegades: iguala o supera el mètode habitual amb una desena part del cost de càlcul.

Il·lustració editorial de Un mètode de Cambridge i DeepMind fa que un model d'IA sàpiga si s'equivoca sense haver de repetir la resposta deu vegades
Escolta:

Saber si un model de llenguatge s'equivoca abans de donar per bona la seva resposta és un dels problemes pràctics més citats a l'hora de posar-los en producció. El mètode habitual, l'autoconsistència per mostreig, consisteix a fer que el model respongui la mateixa pregunta deu vegades i mirar si les respostes coincideixen, un procediment que multiplica per deu el cost de càlcul de cada resposta.

Un equip de la Universitat de Cambridge i Google DeepMind, encapçalat per Caiqi Zhang, presenta XConf, un mètode que guarda un banc d'episodis passats amb el seu resultat, en recupera els més semblants a la tasca que té davant i demana al mateix model que rellegeixi aquest historial abans d'estimar la seva pròpia confiança, sense necessitat d'accedir als pesos interns del model ni de fer més d'una passada de generació. Provat en nou bancs de proves i quatre models de tres famílies diferents, que cobreixen raonament, codi, preguntes multimodals i tasques d'agent, XConf supera l'autoconsistència de deu mostres en 23 de les 24 comparacions fetes, amb un error de calibratge molt més baix i una desena part del cost de generació; en tasques d'agent, descartar només el 10% de les respostes amb menys confiança millora fins a 8,7 punts la taxa d'èxit final de les que queden.

És una peça útil perquè no exigeix accés als logits ni als pesos del model, cosa que el fa aplicable a serveis comercials que només s'ofereixen per API, precisament en les tasques de codi i d'agent on el mostreig repetit sol fallar o resultar massa car de calcular a escala.

Es tracta d'un preprint encara no revisat per parells, que depèn de disposar d'un banc d'episodis passats prou representatiu de la tasca nova per funcionar bé; els autors no detallen encara com es comportaria el mètode en dominis molt diferents dels quatre provats ni com evoluciona el seu cost quan aquest banc d'episodis creix molt.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.