Predstava, že najmodernejšia umelá inteligencia potrebuje kamióny starých papierových kníh, pôsobí ako paradox, no v skutočnosti je to realita. Internet je však čoraz viac zaplavený automaticky vytvoreným obsahom a vývojári hľadajú text, pri ktorom majú väčšiu istotu, že ho napísal človek. Knihy vydané pred masovým rozšírením chatbotov sú preto mimoriadne cenným tréningovým materiálom. Mnohých ale nepoteší, ako je s nimi zaobchádzané.

Nejde iba o najznámejšie romány alebo odborné publikácie. Sprostredkovatelia majú vykupovať veľké množstvá starších titulov naprieč žánrami a niektorým technologickým firmám umožňujú zostať v anonymite. Objednávky môžu zahŕňať tisíce až milióny exemplárov, ktoré sa následne presunú do priemyselného procesu digitalizácie.

Knihy kvôli umelej inteligencii doslova režú a ničia

Pri takzvanom deštruktívnom skenovaní stroj odreže chrbát knihy. Uvoľnené strany potom prejdú vysokorýchlostným skenerom a systém OCR ich prevedie na strojovo čitateľný text. Výsledkom je kvalitná digitálna kópia, ku ktorej sa síce dá vžyd vrátiť, ale pôvodná kniha sa už nedá vrátiť do predchádzajúceho stavu.

Takýto postup je výrazne rýchlejší než opatrné fotografovanie jednotlivých strán zviazanej knihy. Pri miliónoch kusov rozhoduje každá sekunda aj náklad na obsluhu. Papier po naskenovaní často končí v recyklácii alebo odpade, zatiaľ čo digitálny text sa stane súčasťou neverejného tréningového súboru.

Tom’s Hardware upozorňuje na služby, ktoré zabezpečujú hromadné nákupy pre AI laboratóriá. Pre vývojárov sú knihy atraktívne pre súvislú štruktúru, bohatšiu slovnú zásobu a redakčnú kontrolu. Staršie vydania navyše znižujú riziko, že model bude trénovať na texte, ktorý už vytvoril iný model.

Súd rozlíšil kúpené knihy od pirátskych databáz

Najznámejším príkladom je spoločnosť Anthropic, ktorá vyvíja model Claude. Ars Technica na základe súdnych podkladov opísala projekt, pri ktorom firma nakupovala a deštruktívne skenovala milióny fyzických kníh. Takto vytvorená centrálna knižnica mala slúžiť na vývoj jazykových modelov.

Právna situácia však nie je taká jednoduchá, ako môže naznačovať jedna veta v titulku. Americký súd rozlišoval použitie legálne zakúpených fyzických exemplárov od pirátsky získaných digitálnych knižníc. Tréning na kúpených knihách mohol byť za posudzovaných okolností transformačným použitím, no tento záver automaticky neposväcuje nelegálne sťahovanie chránených diel.

Podobné spory sa netýkajú iba Anthropic. Na SvetApple.sk sme už informovali, že žalobe pre údajné trénovanie AI na ukradnutých knihách čelilo aj Apple. Otázka pôvodu tréningových dát preto zostáva jednou z najcitlivejších tém celého odvetvia.

Prečítajte si tiež  Vysnívané partnerstvo sa nekoná. Apple už nemá záujem o investície do OpenAI

Najväčším problémom môžu byť vzácne a vypredané tituly

Zničenie jedného poškodeného bestselleru, ktorého existujú desaťtisíce kusov, kultúrne dedičstvo pravdepodobne neohrozí. Situácia je však úplne iná pri regionálnych publikáciách, malých nákladoch, vypredaných odborných knihách alebo posledných dostupných exemplároch. Ak sa fyzická kópia zničí a digitálny sken zostane v súkromnej databáze, verejnosť z neho nič nezíska.

Riešením nemusí byť úplný zákaz digitalizácie. Dodávatelia by mohli pred rozrezaním kontrolovať vzácnosť titulu, ponúknuť zachované exempláre knižniciam a pri dielach vo verejnej doméne uložiť kvalitný sken aj do verejného archívu. Takýto proces by bol drahší, ale zabránil by nenahraditeľným stratám.

Za nás je pochopiteľné, že AI potrebuje kvalitné dáta vytvorené ľuďmi. Ničenie potenciálne vzácnych kníh bez verejnej archivácie je však zbytočne krátkozraké.

Do komentárov na Facebooku alebo Instagrame nám napíšte, či by technologické firmy mali mať povinnosť odovzdávať skeny vzácnych diel knižniciam. Tešíme sa na vaše názory.

Ak hľadáte overený iPhone so zárukou, ktorý prešiel rukami odborníkov zo SvetApple.sk, určite sa pozrite do nášho e-shopu Loopi.sk. Nájdete tu starostlivo skontrolované zariadenia za výrazne nižšie ceny než pri nových modeloch. 📱

Môže ťa zaujímať