دوران مکالمات خشک و تأخیری با هوش مصنوعی به پایان رسیده است؛ اکنون با معرفی مدل جدید GPT-Live، مرز میان گفتگو با انسان و ماشین در حال کمرنگ شدن است. شرکت OpenAI با عبور از معماریهای سنتی و بهرهگیری از ساختار پیشرفته Full-Duplex، تجربهای را رقم زده که در آن ChatGPT نه تنها به شما گوش میدهد، بلکه با درک جریان واقعی گفتار، واکنشهای انسانی نظیر مکثها، تأییدهای کوتاه (مانند «آره» یا «ممم») و حتی درک توقفهای میانی را تجربه میکند.
معماری Full-Duplex؛ پایان کابوس قطع شدن کلام
بزرگترین تحول در مدل جدید، تغییر از سامانه سهمرحلهای (تبدیل صدا به متن، پردازش متن و سپس تبدیل متن به صدا) به یک مدل چندوجهی واحد است. در مدلهای قدیمی، کوچکترین مکث در صحبت کاربر باعث میشد سیستم تصور کند جمله تمام شده و شروع به پاسخدهی کند؛ اما معماری Full-Duplex به GPT-Live اجازه میدهد همزمان هم به ورودی صوتی کاربر گوش دهد و هم خروجی صوتی خود را مدیریت کند. این ویژگی باعث شده تا کاربر دیگر نگران قطع شدن ناگهانی جملات خود نباشد و بتواند با اطمینان کامل، مکالمات طولانی و پیچیده را پیش ببرد.
سطوح هوشمندسازی؛ از سرعت بالا تا استدلال عمیق
یکی از ویژگیهای متمایزکننده GPT-Live، امکان شخصیسازی سطح پردازش بر اساس نیاز کاربر است. این مدل سه سطح مختلف را در اختیار کاربران (نسخههای پولی) قرار میدهد:
حالت Instant: اولویت با سرعت پاسخگویی است که برای گفتگوهای روزمره و سوالات سریع ایدهآل است.
حالت Medium و High: تمرکز بر افزایش دقت و عمق استدلال است. در این حالت، هوش مصنوعی زمان بیشتری (حدود ۱ تا ۲ ثانیه) برای تحلیل موضوع صرف میکند تا پاسخهای دقیقتری ارائه دهد.
نکته هوشمندانه اینجاست که حتی در حالتهای سریع، اگر موضوع به دقت بالایی نیاز داشته باشد، GPT-Live میتواند در پسزمینه وظایف سنگین را به مدلهای قدرتمندتری نظیر GPT-5.5 بسپارد، بدون اینکه رشته مکالمه صوتی قطع شود.
دسترسی و قابلیتهای کاربردی در اپلیکیشن ChatGPT
مدل GPT-Live اکنون به عنوان جایگزین پیشفرض مدل Advanced Voice، در اپلیکیشنهای iOS و اندروید و همچنین مرورگرهای وب در دسترس است. در حالی که کاربران نسخههای Pro، Plus و Go به مدل قدرتمند GPT-Live-1 دسترسی دارند، کاربران نسخه رایگان میتوانند از نسخه سبکتر GPT-Live-1 mini بهرهمند شوند.
از قابلیتهای کاربردی دیگر میتوان به موارد زیر اشاره کرد:
فعال بودن در پسزمینه: امکان ادامه مکالمه حتی هنگام قفل بودن گوشی یا کار با اپلیکیشنهای دیگر.
ترجمه همزمان: با کشیدن صفحه به سمت پایین، کاربر میتواند متن کامل مکالمه صوتی را مشاهده و از آن برای یادگیری زبان یا ترجمه استفاده کند.
تعامل بصری: اگر پاسخ به یک سوال نیاز به تصویر داشته باشد، سیستم به صورت خودکار یک ویجت تعاملی در کنار پاسخ صوتی ایجاد میکند.
