OpenAI تكشف عن GPT‑Live: ثورة في المحادثات مع الذكاء الاصطناعي
تطلق OpenAI نموذج GPT‑Live الجديد كليًا، مصمم لإحداث تحول جذري في تجربة المستخدم من خلال محادثات طبيعية وسلسة مع الذكاء الاصطناعي، مدعومة ببنية قادرة على الاستماع والتحدث في آن واحد.
OpenAI تبتكر GPT‑Live: استعادة الحس البشري للمحادثات مع الذكاء الاصطناعي
في خطوة تهدف إلى طمس الخطوط الفاصلة بين الإنسان والآلة في التفاعلات الرقمية، أعلنت OpenAI عن إطلاق GPT‑Live، وهو جيل جديد من نماذج الصوت المصممة لجعل المحادثات مع الذكاء الاصطناعي أقرب ما تكون إلى الحوارات البشرية الأصيلة.
### بنية اتصال ثنائية الاتجاه: الاستماع والتحدث في آن واحد
يكمن سر تجربة GPT‑Live التحويلية في بنيته ثنائية الاتجاه (full-duplex). هذه البنية تسمح للنموذج بالاستماع إلى المستخدم والتحدث في الوقت نفسه، مما يعكس السلوك الطبيعي للمحادثات البشرية.
خلال المحادثات، يستطيع GPT‑Live إظهار انتباهه بعبارات مثل "ممم" أو "نعم"، ويمكنه الانخراط في تبادل سريع للأفكار، أو البقاء صامتًا عندما يحتاج المستخدم إلى لحظة للتفكير. والنتيجة هي تجربة صوتية سهلة بشكل منعش.
### ذكاء مدعوم بأحدث نماذج OpenAI
لا يقتصر GPT‑Live على المحادثة السلسة فحسب، بل هو أيضًا أذكى نموذج صوتي طورته OpenAI حتى الآن. في المهام التي تتطلب البحث عبر الويب، أو التفكير المعمق، أو العمليات المعقدة، يقوم النموذج بتفويض المهمة إلى أحدث نماذجها الرائدة (frontier models) في الخلفية، ثم يعيد النتائج إلى المحادثة عند اكتمالها.
خلال فترة معالجة هذه المهام المعقدة، يستطيع GPT‑Live الاستمرار في الحديث مع المستخدم والحفاظ على تدفق المحادثة. عند الإطلاق، سيعتمد GPT‑Live على نموذج GPT‑5.5 في الخلفية، وسيتم تحديثه باستمرار مع إصدار نماذج رائدة جديدة.
### دمج GPT‑Live في ChatGPT
ستدعم هذه التطورات تجربة ChatGPT Voice الجديدة، مما يجعلها أكثر ذكاءً وطبيعية في الاستخدام. تعتقد OpenAI أن هذا البحث سيفتح الباب مستقبلاً لاستخدام الصوت في أعمال أكثر تعقيدًا، وطويلة الأمد، وذات طابع وكيل (agentic).
ولقد بدأت OpenAI اليوم بطرح نسختين من GPT‑Live - GPT‑Live-1 و GPT‑Live-1 mini - لمستخدمي ChatGPT عالمياً. وتخطط الشركة لإتاحتها قريباً عبر واجهة برمجة التطبيقات (API)، ويمكن للمطورين والشركات التسجيل للمتابعة عبر النموذج المخصص.
نحو عصر جديد من التفاعل بين الإنسان والذكاء الاصطناعي
تتمثل رؤية OpenAI في تمكين تفاعل بشري-آلي طبيعي حقًا، حيث يصبح التعاون مع الذكاء الاصطناعي مرنًا وسريع الاستجابة مثل العمل مع شخص آخر، بينما تتم المعالجة العميقة للمهام المعقدة بسلاسة في الخلفية.
### مقارنة بالنهج السابقة
لقد قربتنا الأجيال السابقة من أنظمة الصوت بالذكاء الاصطناعي من هذه الرؤية، لكنها كانت تأتي مع مقايضات مهمة.
#### أنظمة الصوت المتسلسلة (Cascaded voice systems)
اعتمدت هذه الأنظمة على سلسلة من النماذج المتتابعة لمعالجة كل دور في المحادثة، مما كان يؤدي إلى بطء الاستجابات وفقدان بعض المعلومات بين النماذج.
#### نماذج الصوت القائمة على الأدوار (Turn-based voice models)
قامت هذه النماذج بمعالجة وتوليد الصوت ضمن نموذج واحد، مما قلل من زمن الاستجابة وجعل المحادثات أكثر سلاسة، لكنها ظلت تعمل عبر أدوار منفصلة، حيث كان يجب على النموذج انتظار توقف المستخدم عن الكلام قبل الرد، مما ينتج عنه تبادل جامد.
### نهج OpenAI الجديد: GPT‑Live
يعالج GPT‑Live هذه القيود من خلال تغييرين معماريين رئيسيين:
#### 1. تفاعل مستمر
تم بناء GPT‑Live لتحقيق تفاعل مستمر باستخدام بنية ثنائية الاتجاه. بدلاً من معالجة سلسلة من الرسائل المنفصلة، يقوم GPT‑Live بمعالجة المدخلات بشكل مستمر أثناء توليد المخرجات. هذا يسمح للنموذج باتخاذ قرارات تفاعلية عدة مرات في الثانية: سواء كان سيتحدث، أو سيواصل الاستماع، أو يتوقف مؤقتًا، أو يستدعي أداة.
#### 2. التفويض للعمل الأعمق
تم فصل GPT‑Live، الذي يتعامل مع التفاعل المستمر، عن مهام العمل الأعمق. عندما يتطلب سؤال ما بحثًا أو تفكيرًا أو قدرات وكيلية، يمكن لـ GPT‑Live تفويض المهمة إلى نموذج آخر مثل GPT‑5.5. هذا يسمح له بالحفاظ على استمرارية المحادثة، حتى أثناء معالجته لمهام متعددة في الخلفية.
### تقييمات أداء متقدمة
تم تطوير تقييمات بشرية جديدة لقياس مدى جاذبية المحادثة وسلاساتها. وفي المقارنات المباشرة، تم تفضيل GPT‑Live-1 و GPT‑Live-1 mini بشكل كبير على وضع الصوت المتقدم (Advanced Voice Mode) في محادثات مطابقة مدتها 5-10 دقائق.
- **GPQA**: يتفوق GPT‑Live-1 بشكل كبير على وضع الصوت المتقدم في اختبار GPQA، الذي يقيم التفكير العلمي على مستوى الخبراء.
- **BrowseComp**: يُظهر GPT‑Live-1 مكاسب قوية على وضع الصوت المتقدم في اختبار BrowseComp، الذي يقيم البحث عن المعلومات عبر الويب.
- **τ³-Voice Telecom**: يتفوق GPT‑Live-1 على وضع الصوت المتقدم في اختبارات دعم العملاء عبر الهاتف.
تجربة ChatGPT Voice جديدة
تتحدث OpenAI عن وصول تجربة محسنة لمستخدمي ChatGPT، مدعومة بـ GPT‑Live، تتميز بمحادثات أكثر طبيعية، وإجابات أذكى، واستماع أفضل، واستجابات مرئية.
### محادثات أكثر طبيعية
يمكن الآن للمستخدمين مقاطعة ChatGPT لطرح سؤال، أو التوقف مؤقتًا لجمع الأفكار، أو حتى طلب إبطاء الرد. كما أنه يعترف بشكل طبيعي بما تقوله بعبارات مثل "ممم" أو "مفهوم"، مما يدل على متابعته.
### إجابات أذكى
يمكن لـ ChatGPT Voice الآن الاعتماد على أحدث نماذج OpenAI، مما يوفر إجابات أذكى عند الحاجة. ويمكن للمستخدمين اختيار مستوى التفكير المطلوب: فوري للاستجابات السريعة، أو متوسط وعالي عندما يرغبون في قضاء ChatGPT المزيد من الوقت في التفكير.
### استماع أفضل
إذا توقف المستخدم لحظة للتفكير، ينتظر ChatGPT Voice الآن بدلاً من المقاطعة، ويستطيع البقاء صامتًا إذا طُلب منه ذلك. كما أنه أفضل في التركيز على صوت المستخدم بدلًا من تشتيته بالضوضاء المحيطة.
### استجابات مرئية
يمكن لـ ChatGPT الآن عرض بطاقات مرئية غنية للموضوعات مثل الطقس، والأسهم، والرياضة، وغيرها أثناء المحادثة، مما يجعل بعض الإجابات أكثر فائدة.
تصميم آمن للمحادثات الصوتية
تم تصميم GPT‑Live ليكون آمناً افتراضياً، حيث يبني على التطورات الآمنة لنماذج OpenAI الأحدث، مع إضافة تدريب أمان مخصص عبر مجالات المخاطر الرئيسية وضوابط جديدة مصممة خصيصاً للصوت.
### اختبارات أمان موسعة
لتحسين عكس كيفية استخدام الأشخاص للصوت في بيئات واقعية، قامت OpenAI بتوسيع اختباراتها لتشمل تقييمات صوتية جديدة، بالإضافة إلى تقييمات اصطناعية تركز بشكل مكثف على مجالات الأمان الرئيسية.
---

