این تغییر، معیار ارزیابی را از امتیاز خام بنچمارک به توانایی تکمیل یک مأموریت واقعی تغییر داده است. وبگاه «MindsHub» نیز با اتکا به شاخص «Intelligence Index v4.3» مؤسسه تحقیقاتی «Artificial Analysis» تأکید میکند که هزینه هر مأموریت، میزان استدلال، تعداد فراخوانی ابزار و قابلیت کار با انواع ورودیها میتواند نتیجه انتخاب را تغییر دهد. در عمل، سؤال اصلی برای کاربران و سازمانها این است که کدام مدل با کمترین مداخله انسانی، یک خروجی قابل پذیرش را از ابتدا تا انتها تحویل میدهد.
مدل «GPT-6 Astra»؛ گذار از ارائه پاسخ به اجرای کار
مدل «GPT-6 Astra» مهمترین نماینده این تحول بزرگ محسوب میشود. این مدل با پنجره زمینه ۱.۰۵ میلیون توکن و حداکثر خروجی ۱۲۸ هزار توکن برای دشوارترین مأموریتهای استدلالی، پژوهشی، برنامهنویسی و کار با رایانه عرضه شده است. مزیت اصلی این مدل زمانی آشکار میشود که یک کار از چند محیط عبور میکند. مدل میتواند در زنجیرهای واحد با کد، مرورگر، پژوهش و فایلهای حرفهای تعامل کند و وظیفه پیچیده را با راهنمایی انسانی کمتر پیش ببرد. در شاخص مورد استفاده «MindsHub» نیز مدل «GPT-6 Astra» امتیاز ۵۳ را کسب کرده و همراه «Claude Fable 5.1» در بالاترین سطح مقایسه قرار گرفته است. …



































































































































































