Dokumente të reja të pazbardhura zbulojnë se një drejtues i Microsoft-it e quajti grumbullimin e të dhënave nga AI-ja vjedhjen më të madhe të punës në historinë njerëzore
Informacion i ri i paredaktuar në padinë për të drejtë autori që gazeta New York Times ngriti kundër OpenAI dhe Microsoft tre vjet më parë zbulon një pranim se përgjimi i të dhënave nga inteligjenca artificiale ishte i barabartë me vjedhje dhe se produktet e inteligjencës artificiale përbëjnë një kërcënim të madh për botimet.

Sipas padisë, një drejtues i lartë i Microsoft-it i përshkroi privatisht praktikat e trajnimit të inteligjencës artificiale të kompanive si “vjedhje”, dhe vetë udhëheqja e OpenAI tha se modelet e saj të inteligjencës artificiale përbënin një “kërcënim ekzistencial” për botuesit dhe gazetarët, puna e të cilëve i trajnoi ata.

Materiali i pavulosur detajon gjithashtu se si kompanitë dyshohet se e kanë marrë dhe përdorur atë përmbajtje duke anashkaluar muret e pagave pa u zbuluar, duke ndërtuar grupe të dhënash trajnimi nëpërmjet mbledhjes masive të të dhënave dhe duke hequr qëllimisht njoftimet e të drejtave të autorit nga të dhënat e trajnimit.
Vlen të përmendet se shumica e informacionit të ri vjen nga vetë dokumenti i The Times, jo nga provat themelore, të cilat mbeten të vulosura. Citimet më poshtë paraqiten pa kontekstin e tyre origjinal.
Dosja e paredaktuar është përshkallëzimi më i fundit në padinë tre-vjeçare, në të cilën The New York Times fillimisht pretendoi se firmat shkelën ligjin e të drejtës së autorit duke trajnuar modele të inteligjencës artificiale gjeneruese në përmbajtjen e saj.
Çështja nëse firmat e inteligjencës artificiale mund të përdorin ligjërisht materiale të mbrojtura me të drejta autoriale për të trajnuar inteligjencën artificiale nuk ka një përgjigje të qartë, por gjyqtarët kanë qenë kryesisht në favor të argumenteve të kompanive të inteligjencës artificiale se trajnimi përbën “përdorim të drejtë”. Ky rregull ligjor u lejon njerëzve të përdorin punë të mbrojtura me të drejta autoriale pa leje në raste të caktuara, si parodi, raportime lajmesh ose kritika. Më herët këtë muaj, administrata Trump dha një dokument në mbrojtje të përdorimit pa licencë nga OpenAI të materialeve të mbrojtura me të drejta autoriale për të trajnuar LLM-të e saj.
Megjithatë, disa nga pranimet e reja bien ndesh me mbrojtjen e OpenAI për përdorim të drejtë, veçanërisht me kërkesën e rregullit që përdorimi të mos zëvendësojë ose dëmtojë tregun për veprën origjinale.
Për shembull, të dhënat e vetë Microsoft tregojnë se “motori i përgjigjeve” i tij Copilot shkaktoi rënie deri në 93% të normave të klikimeve për domenin e The New York Times krahasuar me kërkimin tradicional të Bing. Një prezantim i brendshëm i Microsoft i shkruar nga drejtori i Shkencave të Aplikuara të Microsoft, Brent Hecht, në janar 2024 e përshkruan rënien si një “lak fatal” që do të “dëmtonte performancën e modeleve tona dhe të të gjithë uebit në të njëjtën kohë”.
“Është shumë e pazakontë që një produkt përfundimtar të kërcënojë themelet ekonomike të furnizuesve të tij thelbësorë, por kjo është situata që kemi krijuar për biznesin tonë të LLM në lidhje me ‘zinxhirin e furnizimit me përmbajtje’”, thuhet në dokumentin e Microsoft, siç citohet në dosje.
Drejtori ekzekutiv i Microsoft, Satya Nadella, dëshmoi gjithashtu në një deklaratë më parë këtë vit se “çdo gjë që është e mbrojtur me pagesë duhet të licencohet nga kushdo që dëshiron ta përdorë atë… për tokëzim ose trajnim”, dhe e bëri të qartë se, nëse ai “do të ishte njoftuar se OpenAI kishte mbledhur dhe trajnuar mbi informacionin që ndodhej pas një muri pagese”, ai do të kishte “përdorur [të drejtën e Microsoft për të] kërkuar që OpenAI të ritrajnojë modelet e saj”.
Pranime të tjera bien ndesh me shtylla të ndryshme të testit të përdorimit të drejtë: kreu i ChatGPT në OpenAI, Nick Turley, shkroi në komunikimin e brendshëm se botuesit përballen me një “kërcënim ekzistencial” nga produkte si chatbot, të cilat janë “kryesisht zëvendësuese” dhe “do të bëhen gjithnjë e më shumë zëvendësuese ndërsa përmirësohen”.
Presidenti i OpenAI, Greg Brockman, i përshkroi modelet si “të shkëlqyera në lajme”. Nadella pranoi nën betim më parë këtë vit se biseda me chatbot-et “ka zëvendësuar… dhënien e informacionit pikërisht aty në faqen e internetit në platformën e IA-së, në vend që të duhet të shkosh te burimi themelor”.
Ky lloj gjuhe flet për mënyrën se si teknologjia mund të konkurrojë drejtpërdrejt me veprën origjinale, në vend që ta transformojë.
Një dokument i Microsoft-it thotë se ekziston një “rrezik real” që IA gjeneruese mund të “prishë ndjeshëm punësimin e vetë njerëzve që gjeneruan të dhënat mbi të cilat u trajnua modeli i themelimit”.
Shkalla e kopjimit është e habitshme. Dokumentet zbulojnë për herë të parë se vetëm të dhënat e trajnimit të mesëm të OpenAI përmbajnë më shumë se 91,692 kopje të punimeve të botuara nga NYT, Daily News dhe Qendra për Raportim Investigativ. Një të dhënë e nxjerrë nga Common Crawl përfshinte më shumë se 2 milionë dokumente vetëm nga nytimes.com.
Në një memo të brendshme të janarit 2023, Hecht e quajti atë “një vjedhje të habitshme me përmasa të papara” dhe “vjedhja më e madhe e punës në historinë e njerëzimit”.
Padia shpjegon me detaje të reja se si OpenAI dhe Microsoft arritën të blinin përmbajtjen e paditësve, duke përfshirë edhe heqjen e saj nga Indeksi Bing.
“OpenAI ia dorëzoi të gjithë të dhënat e trajnimit GPT-3 Microsoft-it, të cilat Microsoft i përdori për të vlerësuar se si të zbatojë modelet e OpenAI brenda produkteve të veta komerciale”, thuhet në dosje. “Microsoft në mënyrë të ngjashme i ofroi të dhëna trajnimi OpenAI-t përmes iniciativave të quajtura Project Taxi dhe Project Mango.”
Kompanitë dyshohet se i kanë mbledhur të dhënat e Projektit Mango në një grup të dhënash trajnimi që përmban kopje të të paktën 160,903 veprave unike nga botuesit e lajmeve.
Për të përfituar sa më shumë nga mbledhja e të dhënave, punonjësit e OpenAI dyshohet se hartuan një plan për të anashkaluar muret e pagave pa u zbuluar. Dosjet tregojnë se kur studiuesi i OpenAI, Nick Ryder, i tregoi Brockman-it për një “hack për të anashkaluar muret e pagave të New York-ut”, Brockman u përgjigj: “oh bukur”.
Punonjësit e OpenAI dyshohet se kanë ndërtuar gjithashtu grupe të dhënash trajnimi si WebText dhe WebText2 që mbështeteshin në mënyrë disproporcionale në përmbajtjen e lajmeve të mbledhura. Ata dyshohet gjithashtu se kanë tërhequr miliona artikuj nga Common Crawl, një depo e hapur dhe falas e të dhënave të zvarritjes në internet. Gjetjet përshkruajnë gjithashtu përpjekje të qëllimshme për të hequr njoftimet e të drejtave të autorit nga të dhënat e trajnimit përpara se të arrinin në model, pasi studiuesit “nuk do të donin që modeli të nxirrte” “njoftime të të drejtave të autorit” për përdoruesit.
“Provat e zbuluara këtu për herë të parë tregojnë se OpenAI dhe Microsoft e dinin se ajo që po bënin ishte e gabuar”, tha Steven Lieberman, këshilltar i New York Daily News, në një deklaratë të ndarë me TechCrunch.
