
به گزارش ایسنا، به نقل از یورونیوز، در نگاه اول عجیب به نظر میرسد؛ چرا یک شرکت میلیونها دلار صرف خرید کتابهای چاپی کند، تنها برای اینکه چند روز بعد آنها را از هم جدا کرده، اسکن کند و دور بیندازد؟
این دقیقاً همان کاری است که اسناد دادگاهی در پرونده شرکت آمریکایی «آنتروپیک» (Anthropic)، سازنده چتبات کلاود، از آن پرده برداشتهاند. اسنادی که نشان میدهند این شرکت برای آموزش مدلهای هوش مصنوعی خود میلیونها جلد کتاب چاپی را خرید، شیرازه آنها را جدا کرد، صفحات را با اسکنرهای صنعتی دیجیتالسازی کرد و سپس نسخههای کاغذی را کنار گذاشت.
اما چرا؟
دلیل اول: کتابها هنوز بهترین منبع آموزش هوش مصنوعی هستند
مدلهای زبانی مانند کلاود، جمینای یا چت جی پی تی، برای یادگیری به حجم عظیمی از متن نیاز دارند. اما همه متنها کیفیت یکسانی ندارند.
کتابهای منتشرشده معمولاً چند مرحله ویرایش، بازبینی و کنترل کیفی را پشت سر گذاشتهاند. از همین رو، از نظر ساختار زبانی، دقت نگارشی و انسجام، کیفیت بسیار بالاتری نسبت به بخش بزرگی از محتوای اینترنت دارند. به همین دلیل، برای آموزش مدلهای هوش مصنوعی منبعی ارزشمند به شمار میروند.
دلیل دوم: اینترنت دیگر مثل گذشته قابل اعتماد نیست
یکی از چالشهای جدید صنعت هوش مصنوعی، افزایش سریع محتوای تولیدشده با خود هوش مصنوعی است.
اگر نسلهای جدید مدلها عمدتاً با متنهایی آموزش ببینند که خودِ هوش مصنوعی تولید کرده است، کیفیت خروجی آنها ممکن است به مرور کاهش یابد؛ پدیدهای که برخی پژوهشگران از آن با عنوان «فروپاشی مدل» (Model Collapse) یاد میکنند.
در چنین شرایطی، کتابهای چاپی به یکی از معدود منابع بزرگِ متنهای انسانی و باکیفیت تبدیل شدهاند.
چرا کتابها را نابود کردند؟
پاسخ کوتاه، سرعت و هزینه است.
در اسکن معمولی، کتاب باید سالم بماند و هر صفحه جداگانه تصویربرداری شود؛ فرآیندی زمانبر و پرهزینه.
اما در روش موسوم به «اسکن تخریبی»، ابتدا شیرازه کتاب بریده میشود، صفحات از هم جدا میشوند و سپس اسکنرهای صنعتی میتوانند هزاران صفحه را در مدت کوتاهی دیجیتال کنند.
به گفته …








