La qüestió de si l'entrenament de grans models de llenguatge amb obres protegides per drets d'autor constitueix o no un ús legítim ("fair use") és, actualment, un dels fronts judicials més actius del sector, amb més de 125 demandes obertes o resoltes recentment als tribunals nord-americans i internacionals, i amb Google ja enfrontant-se anteriorment a litigis similars per part d'autors i creadors.

Segons va informar TechCrunch el 14 de juliol, un grup d'editorials i autors —entre els quals Hachette, Cengage, Elsevier i l'escriptor Scott Turow— van presentar una demanda col·lectiva contra Google davant el Tribunal Federal del Districte Sud de Nova York, acusant la companyia d'haver entrenat el seu model Gemini amb còpies no autoritzades dels seus llibres. Segons la demanda, Google hauria eliminat o alterat deliberadament la informació de drets d'autor d'aquestes obres per "amagar... que els seus models Gemini es van entrenar amb materials robats", tant a partir de llibres digitalitzats per al projecte Google Books com d'exemplars pujats a la Google Play Store sense el consentiment dels titulars.

La notícia és rellevant perquè, a diferència d'altres demandes similars presentades a Califòrnia —on dues sentències recents ja han donat la raó a les empreses d'IA en considerar l'entrenament amb obres protegides un ús legítim—, aquesta es presenta a Nova York, davant un jutge diferent que podria interpretar la qüestió de manera diferent, i perquè implica directament Google, un dels quatre grans laboratoris que defineixen l'estat de l'art de la IA mundial.

Google no ha fet declaracions públiques detallades sobre les acusacions concretes de manipulació de metadades de copyright, i el resultat d'aquesta demanda concreta és incert, atès que la jurisprudència sobre l'ús legítim de material amb copyright per entrenar IA continua sent contradictòria segons la jurisdicció i el tribunal.