GPT-Live-1؛ وقتی صحبت با هوش مصنوعی مثل حرف زدن با یک انسان واقعی می‌شود

GPT-Live-1؛ وقتی صحبت با هوش مصنوعی مثل حرف زدن با یک انسان واقعی می‌شود

اوپن‌ای‌آی از مدل GPT-Live-1 رونمایی کرد؛ مدلی با معماری تمام‌دوطرفه که حرف کاربر را قطع نمی‌کند، هنگام مکث سکوت می‌کند و مکالمه‌ای طبیعی مانند انسان ارائه می‌دهد.

اندازه متن

شرکت OpenAI روز چهارشنبه ۸ ژوئیه (۱۷ تیر) از مدل جدید GPT-Live-1 و نسخه سبک‌تر آن GPT-Live-1 mini رونمایی کرد. این مدل‌ها که جایگزین Advanced Voice Mode در چت‌جی‌پی‌تی می‌شوند، با معماری جدید خود، مکالمات صوتی با هوش مصنوعی را به سطحی کاملاً جدید برده‌اند .


تفاوت بزرگ؛ از "بی‌سیمِ قدیمی" تا "مکالمه واقعی"

مهم‌ترین تغییری که GPT-Live-1 ایجاد کرده، استفاده از معماری تمام‌دوطرفه (Full-Duplex) است. در مدل‌های قبلی، هوش مصنوعی مانند یک بی‌سیم عمل می‌کرد؛ باید منتظر می‌ماند تا کاربر صحبتش را تمام کند تا بتواند پاسخ دهد. این روش اغلب به دلیل تشخیص اشتباه سکوت‌ها، باعث می‌شد که مدل در زمان‌های نامناسب، حرف کاربر را قطع کند .


اما مدل جدید می‌تواند همزمان گوش دهد و صحبت کند . این قابلیت به آن اجازه می‌دهد تا در حین صحبت کاربر، با گفتن عباراتی مانند "هممم" یا "آره" نشان دهد که در حال گوش دادن است، یا اگر کاربر برای فکر کردن مکث کند، سکوت کند و منتظر بماند تا او دوباره شروع به صحبت کند . این ویژگی باعث می‌شود مکالمه روان‌تر و طبیعی‌تر از همیشه پیش برود .

GPT-Live-1؛ وقتی صحبت با هوش مصنوعی مثل حرف زدن با یک انسان واقعی می‌شود

هوش بیشتر در پس‌زمینه

علاوه بر بهبود در مکالمه، GPT-Live-1 از نظر هوش نیز ارتقاء یافته است. این مدل برای پاسخ به سوالات پیچیده‌تر، جستجوی وب، یا انجام کارهای سنگین‌تر، به‌صورت خودکار وظیفه را به مدل‌های جدیدتر مانند GPT-5.5 واگذار می‌کند . نکته جالب این است که در حین انجام این پردازش‌های سنگین در پس‌زمینه، مدل همچنان به مکالمه با کاربر ادامه می‌دهد و اجازه نمی‌دهد سکوت طولانی‌ای در گفتگو ایجاد شود .


قابلیت‌های جدید و دسترسی

این به‌روزرسانی قابلیت‌های جدیدی را به همراه دارد:


- ترجمه همزمان (Simultaneous Translation): مدل جدید می‌تواند صحبت‌های کاربر را به‌صورت لحظه‌ای ترجمه کند، بدون اینکه نیازی به توقف گوینده باشد .

- پاسخ‌های تصویری: در حین مکالمه، چت‌جی‌پی‌تی می‌تواند کارت‌های بصری حاوی اطلاعاتی مثل وضعیت آب‌وهوا، قیمت سهام یا نتایج ورزشی را نمایش دهد .


مدل GPT-Live-1 به‌عنوان پیش‌فرض برای کاربران پولی (Go, Plus, Pro) و نسخه GPT-Live-1 mini برای کاربران رایگان در دسترس قرار گرفته است . همچنین OpenAI اعلام کرده که به‌زودی این مدل‌ها را از طریق API نیز در اختیار توسعه‌دهندگان قرار خواهد داد .


با این رونمایی، OpenAI گام بزرگی در جهت تحقق چشم‌انداز خود یعنی تبدیل صدا به یک رابط اصلی برای تعامل با رایانه‌ها برداشته است و کاربران اکنون می‌توانند تجربه‌ای نزدیک‌تر به صحبت با یک انسان را داشته باشند .

برای مطالعه مقالات بیشتر به سایت خانه متاورس ایران سر بزنید.

دنبال اخبار بیشتر باشید…

نویسنده فرانک فاطمی
درباره نویسنده فرانک فاطمی