Des del 2023, autors, editorials i mitjans com The New York Times mantenen un litigi consolidat («multidistrict litigation») davant el tribunal federal del districte sud de Nova York, presidit pel jutge Sidney H. Stein, que acusa OpenAI i Microsoft d'haver entrenat els seus models amb obres amb drets d'autor sense permís, incloent-hi llibres descarregats de repositoris pirata com Library Genesis; fa pocs dies s'hi van sumar el Seattle Times i Newsday.
El 4 de setembre, Microsoft ha presentat una moció de judici sumari —un intent de tancar el cas sense arribar a judici— acompanyada d'un informe pericial que va revisar 8,2 milions de converses de Copilot i només hi va trobar 24 respostes amb almenys 30 paraules seguides coincidents amb obres reclamades pels demandants, un 0,00029% del total; en una prova adversarial amb 5,3 milions d'intents específicament dissenyats per forçar el model a reproduir passatges sencers, menys de l'1% ho va aconseguir, i per a 202 dels 212 llibres al centre de la demanda no es va trobar cap reproducció. Microsoft defensa que entrenar models de llenguatge amb aquestes obres és un ús «profundament transformador» perquè els llibres, escrits per ser llegits, hi compleixen una funció tecnològica diferent. El mateix dia, The New York Times va presentar la seva pròpia moció de judici sumari en sentit contrari.
La notícia és rellevant perquè és el primer cop que una de les grans empreses demandades aporta xifres empíriques tan detallades sobre la freqüència real amb què el seu producte reprodueix obres protegides, una dada que podria marcar el llistó probatori en altres demandes similars —contra Anthropic, o de Sony Music i Warner Chappell— i que podria decantar cap a un costat o l'altre com interpreten els tribunals nord-americans el concepte de «fair use» aplicat a l'entrenament d'IA.
Les xifres provenen d'un anàlisi encarregat per la mateixa Microsoft, encara pendent de contrast i possible rèplica per part dels demandants, que sostenen que el dany rau en l'ús mateix de les obres per entrenar el model —amb la pèrdua d'ingressos per llicències que això suposa— i no només en si el model n'arriba a reproduir fragments literals; el tribunal encara no s'hi ha pronunciat i els demandants tenen de termini fins al 5 d'octubre per respondre.