iaintel·ligènciaartificial.cat← Portada

TECNOLOGIA · 4 MIN

Anthropic explica com funciona la marca d'aigua invisible amb què vol identificar els textos escrits per Claude

La companyia detalla per primer cop la tècnica -inspirada en el SynthID de Google DeepMind- amb què decanta subtilment l'elecció de paraules de Claude per deixar un patró indetectable a ull nu però reconeixible amb la seva clau, tot i que reconeix que falla en textos molt tècnics o reescrits a fons.

Il·lustració editorial de Anthropic explica com funciona la marca d'aigua invisible amb què vol identificar els textos escrits per Claude
Escolta:

Des que Anthropic va anunciar que marcaria digitalment els textos generats per Claude, alguns usuaris s'han queixat que la mesura els pot delatar a la feina o a classe si l'usen sense permís. El 14 d'agost, la companyia ha publicat els detalls tècnics de com funciona el sistema, després de mantenir-lo en gran part en secret.

Segons explica Anthropic, la tècnica s'inspira en el mètode SynthID-Text de Google DeepMind: en comptes d'afegir marques visibles, aprofita les eleccions "de baixes apostes" que Claude fa constantment mentre escriu -triar una paraula o una altra quan totes dues són igualment vàlides- per deixar-hi un patró estadístic, de manera similar a fer servir els dígits de pi en lloc de tirar un dau en una partida de Monopoly. La marca no afegeix tokens ni cost, no conté informació identificable de l'usuari ni afecta la qualitat o la creativitat del text, i només és detectable amb la clau d'Anthropic.

La rellevància de l'anunci és doble: d'una banda, respon a la pressió creixent perquè les empreses d'IA facin identificable el contingut que generen els seus models; de l'altra, arriba el mateix dia que Google anuncia el moviment contrari amb Gemini -permetre desactivar la marca visible de les seves imatges-, cosa que mostra com els grans laboratoris encara no s'han posat d'acord sobre com ha de ser aquest etiquetatge.

La mateixa Anthropic reconeix limitacions importants: el sistema funciona malament en text factual o tècnic, on hi ha poques opcions de paraules equivalents; aporta poca detecció en text molt editat o revisat per un humà; el codi en porta menys marca perquè exigeix exactitud, i les reescriptures completes poden eliminar-la del tot. La marca només indica que Claude hi ha intervingut, no pot distingir si el text és obra original del model o una edició humana profunda d'un esborrany seu.

Mateix tema

Veure tot el tema →

Butlletí de dissabte

La setmana d’IA, en cinc minuts.