شرکت آنتروپیک در تازهترین پژوهش خود گام دیگری به سمت ایده «هوش مصنوعی خودبهبوددهنده» برداشت. همشهری آنلاین، فرخنده رفائی: هوش مصنوعی در حال نزدیک شدن به مرحلهای است که میتواند بخشی از فرایند توسعه و بهبود مدلهای هوش مصنوعی را خودش بر عهده بگیرد؛ آنتروپیک در تازهترین آزمایش خود نمونهای اولیه از این رویکرد را بررسی کرده است.
به گزارش دیجیتال ترندزدز، در این آزمایش، آنتروپیک از Claude Sonnet ۵ خواست نسخه اولیه و قدرتمندتر Claude Opus ۴.۸ را بهبود دهد. Sonnet طی حدود ۶۰ ساعت بیش از ۵۰ ایده مختلف را آزمایش کرد و در نهایت روشی برای آموزش مدل طراحی کرد که از حدود ۲۴۰۰ نمونه استفاده میکرد.
نتیجه آزمایش نشان داد نسخه اولیه Opus توانست در ۱۰ مسئله رفتاری که آنتروپیک بررسی میکرد، به عملکرد نسخه نهایی Opus ۴.۸ نزدیکتر شود. این مسائل شامل رفتارهایی مانند فریب دادن، موافقت بیش از حد با کاربر، دور زدن محدودیتهای ایمنی یا همان jailbreak و نقض حریم خصوصی بود. برخی از روشهایی که Claude پیدا کرد، روی مدلهایی بزرگتر از مدلهای اولیه مورد آزمایش نیز مؤثر بودند.
نکته مهم این است که Sonnet صرفا یک پیشنهاد برای بهبود مدل ارائه نکرد، بلکه بخشی از وظایفی را انجام داد که معمولا بر عهده پژوهشگران هوش مصنوعی است؛ از مطالعه پژوهشهای قبلی و ارائه ایدههای جدید گرفته تا تولید داده آموزشی، آزمایش نتایج و تکرار فرایند در صورت شکست … …













