
شرکت OpenAI با معرفی مدل صوتی جدید GPT-Live تجربه مکالمه صوتی در ChatGPT را وارد مرحله تازهای کرده است؛ مدلی که با معماری دوطرفه کامل میتواند همزمان به صحبت کاربر گوش دهد و پاسخ خود را ارائه کند و با واکنشهای کوتاه و طبیعی مانند هوم و آره تلاش میکند گفتوگو با هوش مصنوعی را بیش از گذشته به مکالمه انسانی شبیه کند.
به گزارش گروه ترجمه خبرگراری برنا به نقل از انگجت، دستیارهای هوش مصنوعی در سالهای اخیر با سرعت زیادی توسعه یافتهاند و در کنار افزایش قابلیتها، دقت و سرعت پاسخگویی آنها نیز بهبود پیدا کرده است. با این حال یکی از مسیرهایی که میتواند استفاده روزمره از این ابزارها را سادهتر کند جایگزین کردن تایپ با گفتوگوی صوتی است.
نسخه اولیه حالت صوتی ChatGPT که در سال ۲۰۲۳ معرفی شد، برای برقراری مکالمه از سه سامانه جداگانه استفاده میکرد. در این فرآیند صدای کاربر ابتدا به متن تبدیل میشد سپس یک مدل زبانی پاسخ را تولید میکرد و در نهایت یک سامانه تبدیل متن به گفتار، پاسخ تولیدشده را به صورت صوتی برای کاربر میخواند.
پس از آن OpenAI حالت Advanced Voice را ارائه کرد که با استفاده از یک مدل چندوجهی واحد تجربه مکالمه را به شکل محسوسی بهبود داد. اکنون GPT-Live به عنوان مدل جدید مکالمه صوتی ChatGPT معرفی شده و قرار است طبیعیتر، سریعتر و روانتر از نسلهای قبلی با کاربران تعامل کند. معماری جدید برای گفتوگویی روانتر
یکی از مهمترین تفاوتهای GPT-Live با نسلهای قبلی، استفاده از معماری موسوم به Full-Duplex یا دوطرفه کامل است. این معماری به مدل اجازه میدهد در زمان صحبت کردن کاربر همچنان به صدای او گوش دهد و در تعامل صوتی وقفه کمتری ایجاد شود.
در مدلهای قبلی یکی از مشکلات رایج این بود که ChatGPT گاهی یک مکث کوتاه کاربر را بهعنوان پایان صحبت تلقی میکرد و پیش از آنکه فرد جمله خود را کامل کند شروع به پاسخ دادن میکرد. این مسئله میتوانست گفتوگو را مصنوعی و تا حدی آزاردهنده کند.
GPT-Live تلاش میکند این مشکل را برطرف کند. این مدل در جریان صحبت کاربر ممکن است واکنشهای صوتی کوتاهی مانند «هوم» یا «آره» نشان دهد، واکنشهایی که در مکالمات انسانی نیز برای نشان دادن توجه و همراهی با گوینده استفاده میشوند.
از سوی دیگر GPT-Live …











