مجله اینترنتی شهر فارسی

شرکت‌های هوش مصنوعی برای آموزش مدل‌ها درحال نابودی میلیون‌ها کتاب چاپی هستند

شرکت‌های فعال در حوزه هوش مصنوعی که پیش از این سهم زیادی در ایجاد کمبود حافظه و فضای ذخیره‌سازی داشتند، اکنون گنجینه تاریخ ادبیات بشریت را هدف قرار داده‌اند و میلیون‌ها جلد کتاب چاپی را پس از استخراج اطلاعات کاملاً نابود می‌کنند.

براساس جزییاتی که در جریان پرونده‌های حقوقی و گزارش‌های افشاگرانه مطرح شده، شرکت‌های فناوری برای بالا بردن سرعت کار، روش اسکن تخریبی کتاب‌ها را انتخاب کرده‌اند. در این روش، شیرازه کتاب‌ها جدا شده و صفحات آنها به صورت مجزا وارد اسکنرهای صنعتی پرسرعت می‌شود تا متن آنها دیجیتالی شود. نتیجه این فرایند، نابودی فیزیکی و کامل میلیون‌ها جلد کتاب است.

«تام هاروی»، از فعالان پروژه گوگل بوکس که بعدها پروژه دیجیتال‌سازی شرکت آنتروپیک موسوم به «Project Panama» را رهبری کرد، در دادگاه تأیید کرده که این شرکت چند مجموعه اسکن اسناد مانند Datamation Information Services را به کار گرفته است. این مراکز خدمات اسکن غیرتخریبی (با اسکنرهای سقفی و V شکل) و اسکن تخریبی ارائه می‌دهند، اما شرکت‌های هوش مصنوعی به دلیل هزینه کمتر و سرعت بسیار بالاتر، روش تخریبی و نابودی کامل کتاب‌ها را ترجیح می‌دهند.

چالش شرکت‌های هوش مصنوعی با ناشران

سوابق موجود نشان می‌دهد که شرکت آنتروپیک به‌عنوان یکی از توسعه‌دهندگان مطرح این حوزه، میلیون‌ها دلار برای استخراج اطلاعات از کتاب‌های چاپی جهت ساخت مدل‌های Claude هزینه کرده و سپس این کتاب‌ها را از بین برده است. این شرکت کتاب‌ها را از مجموعه‌داری به نام Better World Books تهیه می‌کرد. هرچند حکم دادگاه اخیراً استفاده از کتاب‌ها برای آموزش هوش مصنوعی را مصداق «استفاده منصفانه» در قانون کپی‌رایت دانست، اما آنتروپیک به دلیل نگهداری آرشیوی شامل ۷ میلیون نسخه کتاب دزدی دیجیتال که حقوق پدیدآورندگان و ناشران را نقض می‌کرد، با جریمه سنگین ۱.۵ میلیارد دلاری مواجه شد.

شرکت‌های هوش مصنوعی برای آموزش مدل‌ها درحال نابودی میلیون‌ها کتاب چاپی هستند
READ  جدیدترین ابزار هوش مصنوعی دیزنی بازیگران را در عرض چند ثانیه پیر یا جوان می‌کند [تماشا کنید]

اسکن کتاب‌ها برای آموزش هوش مصنوعی
شرکت‌های هوش مصنوعی برای آموزش مدل‌ها درحال نابودی میلیون‌ها کتاب چاپی هستند

در اقدامی مشابه، ائتلافی از ناشران نیز دادخواستی علیه گوگل تنظیم و این شرکت را به استفاده غیرقانونی از میلیون‌ها جلد کتاب دارای کپی‌رایت برای توسعه مدل‌های جمینای متهم کرده‌اند.

علت اصلی تمایل غول‌های فناوری به نابودی کتاب‌های چاپی، نیاز شدید آنها به داده‌های آموزشی باکیفیت است. درحال‌حاضر انتشار گسترده محتواهای بی‌کیفیت تولیدشده توسط هوش مصنوعی که با نام «AI slop» شناخته می‌شوند، فضای اینترنت را آلوده کرده است. به همین دلیل، این شرکت‌ها با بهره‌گیری از واسطه‌ها به‌طور پنهانی اقدام به خرید عمده کتاب‌های دست‌دوم منتشرشده قبل از سال ۲۰۲۲ می‌کنند تا بدون جنجال رسانه‌ای، به متون اصیل دسترسی داشته باشند.

پایگاه داده آنلاین ISBNdb که بیش از ۱۱۱ میلیون کتاب در آن ثبت شده، بستر اصلی این خریدهای کلان است. سفارش‌های ثبت‌شده در این سامانه از ۱,۰۰۰ جلد تا حتی ۱ میلیون جلد کتاب در قالب یک معامله متغیر است. یکی از کتاب‌فروشان حرفه‌ای در گفتگو با رسانه 404 Media به افزایش بی‌سابقه فروش کتاب اشاره کرده است؛ فروش هفتگی او از حدود ۲۰ جلد به چند صد جلد رسیده که نشان‌دهنده افزایش ۵ برابری است. خریداران بدون توجه به موضوع یا نویسنده، تنها کتاب‌های دارای شماره شابک (ISBN) را حتی با قیمت‌های بسیار بالا و گران خریده‌اند.

شرکت‌های هوش مصنوعی برای آموزش مدل‌ها درحال نابودی میلیون‌ها کتاب چاپی هستند
شرکت‌های هوش مصنوعی برای آموزش مدل‌ها درحال نابودی میلیون‌ها کتاب چاپی هستند

درحالی‌که کتاب‌های چاپی گنجینه‌ای از اطلاعات را برای هوش مصنوعی فراهم می‌کنند، اما خروج آنها از چرخه گردش و نابودی فیزیکی‌شان چالش‌های اخلاقی فراوانی دارد. مشخص نیست که آیا عناوین کمیاب پیش از تخریب جداسازی می‌شوند یا خیر. از سوی دیگر، متون اسکن‌شده مستقیماً وارد پایگاه‌های داده خصوصی شرکت‌ها می‌شوند و عموم مردم به آنها دسترسی ندارند؛ وضعیتی که باعث می‌شود دستیابی به نسخه‌های پیشرفته‌تر هوش مصنوعی به قیمت سلب دسترسی نسل‌های آینده از منابع اطلاعاتی تمام شود.

شرکت‌های هوش مصنوعی برای آموزش مدل‌ها درحال نابودی میلیون‌ها کتاب چاپی هستند
READ  تصاویر منتسب به ایرپاد ۳ از طراحی مشابه با ایرپاد پرو خبر می‌دهد

پیام بگذارید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *