به گزارش سیتنا، انویدیا روز جمعه پژوهش جدیدی منتشر کرد که نشان میدهد در انجام وظایف پیچیده و طولانیمدت توسط عاملهای هوش مصنوعی، چارچوب نرمافزاری اطراف مدل میتواند اهمیت بسیار بیشتری از خود مدل داشته باشد.
این چارچوب که در ادبیات فنی به آن Harness گفته میشود، مجموعهای از ابزارها، سیستم مدیریت حافظه و قوانین مورد استفاده در کنار مدل هوش مصنوعی است و به یک مدل خام اجازه میدهد بهصورت مستقل عمل کند.
خلاصه یافته انویدیا این است که پژوهشگران تنها با استفاده از یک چارچوب اختصاصی که برای مدیریت بهتر حافظه تنظیم شده و یک مؤلفه «ناظر» دارد، توانستند مدل Claude Opus 5 را در آزمون استدلال تعاملی ARC-AGI-3 به امتیاز کامل ۱۰۰ درصد برسانند.
ARC-AGI-3 مجموعهای از بازیهای دوبعدی بدون دستورالعمل مشخص است که مدل باید خودش نحوه بازی کردن و پیروز شدن را کشف کند؛ آزمونی که از قضا نتایج ضعیف مدلهای شرکت OpenAI در آن، توجه زیادی را به خود جلب کرده بود. …












