iaintel·ligènciaartificial.cat← Portada

TECNOLOGIA · 4 MIN

Cloudflare comença avui a bloquejar per defecte els robots d'IA que barregen cerca i entrenament

La nova configuració, que Cloudflare va anunciar l'1 de juliol i que entra en vigor aquest 15 de setembre, bloqueja per defecte els rastrejadors «multiús» —com Googlebot— a les pàgines amb publicitat quan un client tria blocar l'entrenament d'IA, i estrena un mercat de pagament per ús pel contingut que apareix en respostes generades.

Il·lustració editorial de Cloudflare comença avui a bloquejar per defecte els robots d'IA que barregen cerca i entrenament
Escolta:

Des que els grans laborators d'IA van començar a entrenar els seus models amb contingut rastrejat de la web, els editors s'han queixat que no poden distingir un robot que els indexa per a la cerca d'un que els «devora» per entrenar un model o alimentar un agent. Cloudflare, que gestiona el trànsit de més d'una cinquena part dels dominis del món, va anunciar l'1 de juliol que hi posaria remei amb una configuració nova per defecte.

Aquell canvi entra en vigor avui, 15 de setembre. A partir d'ara, els rastrejadors «multiús» —que combinen en un sol identificador les funcions de cerca, entrenament de models i recuperació per a agents, com és el cas de Googlebot, Applebot o Bingbot— queden subjectes a la regla més restrictiva que el client hagi triat: si un lloc bloca l'entrenament, també bloca aquests robots a les pàgines que mostren publicitat. La mesura s'aplica automàticament als dominis nous que s'incorporin a Cloudflare, als llocs nous de clients existents i a tots els comptes del pla gratuït; els clients de pagament amb configuracions prèvies mantenen els seus ajustos.

Cloudflare hi afegeix en paral·lel l'evolució del seu experiment «Pay Per Crawl» cap a un model de «Pay Per Use»: els editors cobrarien quan el seu contingut aparegui efectivament en una resposta generada per IA, no simplement quan un robot el descarregui. És el moviment més ampli fins ara d'un intermediari d'infraestructura web per forçar els laboratoris d'IA a triar entre indexar per cercar o recol·lectar per entrenar, en lloc de fer totes dues coses amb el mateix rastrejador sense distinció per als editors.

La mesura només afecta la configuració per defecte —qualsevol lloc la pot desactivar en qualsevol direcció— i, en blocar rastrejadors que també fan de cercador, corre el risc de reduir la visibilitat de molts llocs a Google Search si els seus administradors no ajusten bé les opcions abans del termini. Cloudflare no ha publicat encara dades sobre quants dominis han optat per mantenir la configuració per defecte.

Mateix tema

Veure tot el tema →

Butlletí de dissabte

La setmana d’IA, en cinc minuts.