
به گزارش ایسنا، برای شرکتهایی که مدلهای زبانی بزرگ (LLM) میسازند، کتابها چیزی جز خوراکی نیستند که باید بهصورت انبوه بلعیده شوند و پس از استخراج اطلاعاتشان، مانند استخوان ماهی دور انداخته شوند. در بسیاری از موارد، آنها ترجیح میدهند از نسخههای دیجیتالی کتابها استفاده کنند یا حتی بهتر از آن، از نسخههای دیجیتالی دزدیشده استفاده کنند. برای مثال، شرکت «متا» به استفاده از کتابهای دیجیتالی غیرقانونی متهم شده و شرکت «آنتروپیک» نیز به دلیل انجام اقدامی مشابه، مجبور شد ۱.۵ میلیارد دلار به نویسندگان غرامت بپردازد.
اما بسیاری از شرکتها، از جمله «آنتروپیک»، به جای نسخههای دیجیتالی، به سراغ کتابهای چاپی رفتهاند؛ چراکه میتوانند تعداد زیادی نسخه دستدوم را با قیمت بسیار پایین خریداری کنند.
«فیوچریسم» نوشت: بر اساس اسناد مرتبط با همان پرونده حقوقی، «آنتروپیک» از یک دستگاه برش هیدرولیکی استفاده میکرد تا صفحات کتابهایی را که از فروشندگان کتاب خریده بود، بهطور مرتب از جلد جدا کند. سپس این صفحات با تجهیزات تصویربرداری صنعتی اسکن میشدند. به بیان دیگر، این شرکت واقعا کتابهای نویسندگان را تکهتکه میکرد تا هوش مصنوعی خود را آموزش دهد.
این فرایند از یک اصل حقوقی به نام (First-Sale Doctrine) بهره میبرد که به خریدار اجازه میدهد پس از خرید یک کالا، بدون نیاز به اجازه صاحب حق نشر، هر کاری که میخواهد با نسخه خریداریشده انجام دهد.
از آنجا که شرکت «آنتروپیک» متن چاپی را به نسخه دیجیتال تبدیل میکرد، قاضی آن را استفاده منصفانه تشخیص داد.
اکنون، به گزارش «404 Media»، این شیوه آنقدر رایج شده که حتی فروشندگان باسابقه کتاب نیز به دنبال بهرهبرداری از رونق بازار هوش مصنوعی هستند.
یکی از این شرکتها که «ISBNdb» است و خود را «بزرگترین پایگاه داده کتاب جهان» معرفی میکند، اعلام کرده است: «بهترین دادههای آموزشی جهان برای هوش مصنوعی، همین حالا روی یک قفسه کتاب قرار دارند.»
این شرکت تاکید میکند که کتابهای چاپی، برخلاف بسیاری از مطالب اینترنتی امروز، هنوز به نوشتههای ضعیف تولیدشده توسط هوش مصنوعی که اکنون بخش بزرگی از فضای اینترنت و حتی برخی کتابهای جدید را فرا گرفتهاند، آلوده …


