دنیل اوانکو از انجمن آمریکایی تحقیقات سرطان از پانگرام برای بررسی گزارشهای داوری همتا استفاده میکند، زیرا برخی پژوهشگران بدون اعلام استفاده از هوش مصنوعی از مدلهای زبانی بزرگ کمک میگیرند. در یکی از موارد، یک داور پس از اینکه پانگرام استفاده او از هوش مصنوعی را شناسایی کرد، اعتراف کرد که به دلیل کمبود وقت از یک مدل زبانی بزرگ استفاده کرده است.
شرکت سازنده پانگرام، ادعا میکند این ابزار میتواند محتوای تولید شده توسط هوش مصنوعی را با دقت ۹۹.۹۸ درصد شناسایی کند. این ابزار اکنون توسط پژوهشگران و سازمانهای علمی استفاده میشود. طبق یک مطالعه، حدود یک مقاله از هر هشت مقاله زیست پزشکی در سال گذشته شامل مقداری متن تولید شده توسط هوش مصنوعی بوده است. کنفرانس NeurIPS نیز اعلام کرده که پس از غربالگری با پانگرام، ۱۸ درصد از ارسالهای خود را رد کرده است. جیپیتی زیرو نیز دقت ۹۹ درصدی را اعلام کرده و توسط چندین کنفرانس و دانشگاه مورد استفاده قرار گرفته است.
نسلهای قدیمیتر ابزارهای تشخیص هوش مصنوعی عمدتا بر ویژگیهای آماری متن، مانند پریپلکسیتی، تکیه میکردند. این روشها اغلب متن انسانی را به اشتباه هوش مصنوعی تشخیص میدادند و به همین دلیل برخی دانشگاهها استفاده از چنین ابزارهایی را محدود یا ممنوع کردند.
روش جدید پانگرام بر پایه یادگیری ماشین است. سازندگان آن میلیونها متن انسانی را جمعآوری کردند و از مدلهای زبانی خواستند نسخههایی مشابه با همان عنوان، طول و لحن تولید کنند. سپس مدلهای یادگیری ماشین برای تشخیص تفاوت میان متن انسانی و نسخه هوش مصنوعی آموزش داده شدند. این روش توانست نرخ مثبت کاذب بسیار پایینی داشته باشد.
مطالعات مستقل نیز عملکرد این ابزارها را تایید کردهاند. Epoch AI در آزمایشی روی ۴۹۵ متن انسانی هیچ مثبت کاذبی برای پانگرام پیدا نکرد. مقاله فنی پانگرام نیز نرخ مثبت کاذب ۰.۰۰۴۱ درصد را برای متون انگلیسی گزارش کرده است. جیپیتی زیرو نیز در برخی آزمایشها هیچ مثبت کاذبی نداشت.
با این حال، کاهش مثبت کاذب با افزایش منفی کاذب همراه است؛ یعنی برخی متنهای تولید شده توسط هوش مصنوعی ممکن است انسانی تشخیص داده شوند. پانگرام و جیپیتی زیرو تقریبا تمام متنهای تولید شده با دستورهای ساده را شناسایی میکنند، اما زمانی که هوش مصنوعی از سبک نویسندهای خاص تقلید میکند، حدود ۸ درصد متنها ممکن است انسانی تشخیص داده شوند.
ابزارهای انسانیساز نیز تشخیص را دشوارتر میکنند. این ابزارها متن تولید شده توسط هوش مصنوعی را بازنویسی میکنند تا نشانههای آن کمتر شود. با این حال، شرکتهای سازنده آشکارسازها میگویند بسیاری از آزمایشهای قدیمی با نسخههای قبلی مدلهای زبانی انجام شدهاند و ابزارهای تشخیص نیز دائما به روزرسانی میشوند. جیپیتی زیرو در یک سال ۲۳ به روزرسانی منتشر کرده و پانگرام نیز در ماه ژوئیه پانگرام ۴ را عرضه کرده است.
پانگرام ۴ متن را به بخشهای بسیار کوچکتری تقسیم میکند و میتواند قسمتهایی به اندازه ۳۰ تا ۴۰ کلمه را بررسی کند. این شرکت میگوید نسخه جدید بهتر میتواند میان ویرایش سبک با هوش مصنوعی و استفاده سنگین از آن تفاوت بگذارد. با این حال، عملکرد آن در متنهای بسیار کوتاه، کمتر از ۵۰ کلمه، کاهش مییابد.
یکی از دشوارترین مسائل، تشخیص متنهای ترکیبی انسان و هوش مصنوعی است. بسیاری از نویسندگان از هوش مصنوعی فقط برای اصلاح زبان، روانتر کردن جملات، ترجمه، سازماندهی یادداشتها یا ویرایش استفاده میکنند. این نوع استفاده با تولید کامل متن توسط هوش مصنوعی تفاوت دارد، اما آشکارسازها همیشه قادر به تشخیص دقیق این تفاوت نیستند.
مقاله او که ایدهها و پیشنویس اولیه آن کاملا توسط انسان ایجاد شده بود، اما با کمک هوش مصنوعی ویرایش شده بود، ابتدا توسط پانگرام ۱۰۰ درصد هوش مصنوعی تشخیص داده شد و پس از انتشار پانگرام ۴ نیز امتیاز آن ۹۶ درصد باقی ماند. با وجود این، ویراستاران مقاله تایید کردند که متن کاملا توسط هوش مصنوعی نوشته نشده است.
پانگرام توضیح میدهد که امتیاز ۱۰۰ درصد هوش مصنوعی به معنای آن نیست که تمام کلمات متن توسط هوش مصنوعی تولید شدهاند. این ابزار متن را به بخشهایی تقسیم میکند و بر اساس نسبت بخشهایی که احتمالا هوش مصنوعی تشخیص داده شدهاند، امتیاز کلی ارائه میدهد.
در آزمایشهای نیچر نیز برخی مقالههایی که با گزارشگری و مصاحبه انسانی تهیه شده بودند، توسط پانگرام بهعنوان ۱۰۰ درصد هوش مصنوعی شناسایی شدند. در نسخه جدید، برخی از این موارد به متن ترکیبی انسان و هوش مصنوعی تغییر کردند، اما بعضی گزارشها همچنان ۱۰۰ درصد هوش مصنوعی تشخیص داده شدند.
مشکل دیگر، امکان ایجاد نوسان در امتیاز است. تغییرات کوچک در یک متن ترکیبی میتواند امتیاز پانگرام را به میزان زیادی تغییر دهد. همچنین در یک آزمایش، متنهای دانشجویی انسانی که با هوش مصنوعی به طور اساسی تغییر داده شده بودند، در ۴۱ درصد موارد همچنان کاملا انسانی تشخیص داده شدند.
نگرانی دیگر به نویسندگانی مربوط میشود که انگلیسی زبان اول آنها نیست. اوانکو میگوید گزارشهای داوری که از زبانهای دیگر به انگلیسی ترجمه شدهاند، گاهی توسط ابزار بهعنوان کاملا تولید شده توسط هوش مصنوعی شناسایی میشوند. با استفاده از پانگرام ۴، حدود یک پنجم این موارد امتیاز هوش مصنوعی پایینتری پیدا کردهاند.
در کنار ابزارهای پیشرفته، سرویسهای ضعیفتری مانند تکستگارد (TextGuard) نیز وجود دارند که گاهی متون قدیمی و کاملا انسانی را به اشتباه هوش مصنوعی تشخیص میدهند. نیچر در آزمایشهای خود دریافت پانگرام و جیپیتی زیرو متنهای قدیمی را به درستی انسانی تشخیص میدهند، در حالی که TextGuard در یک مورد پایاننامه سال ۲۰۱۴ را ۶۲ درصد هوش مصنوعی اعلام کرده بود.
با افزایش استفاده از هوش مصنوعی در پژوهش و نوشتن، ناشران بیشتری به سراغ این ابزارها میروند.
در نهایت، محدودیت اصلی این ابزارها این است که حتی اگر بتوانند دخالت هوش مصنوعی را شناسایی کنند، نمیتوانند ثابت کنند هوش مصنوعی دقیقا چگونه استفاده شده یا آیا آن استفاده از نظر اخلاقی قابل قبول بوده است یا خیر. به همین دلیل کارشناسان تاکید میکنند امتیاز آشکارساز نباید به عنوان نتیجه نهایی در نظر گرفته شود و باید صرفا نقطه شروعی برای بررسی بیشتر باشد.
با گسترش آشکارسازها و احتمال استفاده از واترمارک در مدلهایی مانند کلود، نویسندگان و دانشمندان ممکن است ناچار شوند نحوه استفاده خود از هوش مصنوعی را شفافتر اعلام و فرایند تولید آثار خود را مستند کنند. مسئله اصلی همچنان این است که چه نوع استفادهای از هوش مصنوعی از نظر اخلاقی قابل قبول است.







































































































