الاثنين، 3 أغسطس 2026

الذكاء الاصطناعي

OpenAI تطلق نماذج الصوت GPT-Live-1 الخاصة بـ ChatGPT

أطلقت OpenAI نموذجي GPT-Live-1 وGPT-Live-1 mini، وهما نموذجان جديدان للمحادثة ثنائية الاتجاه بالكامل (full-duplex) يحلان محل وضع الصوت المتقدم (Advanced Voice Mode) الخاص بـ ChatGPT افتراضياً.

OpenAI launches GPT-Live-1 voice models for ChatGPT
صورة: OpenAI

أطلقت OpenAI اليوم نموذجين جديدين للمحادثة، هما GPT-Live-1 وGPT-Live-1 mini، مشيرة إلى أنهما يبدوان أكثر طبيعية ويتحكمان في تبادل الأدوار في الحديث بشكل أفضل من ذي قبل. وكلا النموذجين يعمل بتقنية الاتصال ثنائي الاتجاه بالكامل (full-duplex) — مما يعني أنهما يستطيعان التحدث والاستماع في الوقت نفسه — وهو ما يتيح للمستخدمين المقاطعة بشكل طبيعي في منتصف المحادثة، ويمكّن ميزات مثل الترجمة المباشرة. وتستبدل OpenAI وضع الصوت المتقدم (Advanced Voice Mode) الحالي الخاص بـ ChatGPT بنموذج GPT-Live-1 mini افتراضياً.

ويقوم وضع الصوت الجديد بتوجيه الاستفسارات إلى نماذج النصوص الأكثر تقدماً من OpenAI، مثل GPT-5.5، لإجراء عمليات البحث، أو الاستدلال، أو تفعيل القدرات الوكيلية (agentic capabilities) — وهي القدرة على تنفيذ مهام معقدة ومستقلة وطويلة المدى — مع استمرار المحادثة دون انقطاع. كما أنه مصمم للجلسات الأطول: حيث قال Atty Eleti، مدير المنتج لـ ChatGPT Voice، إنه أجرى محادثات استمرت ما بين 30 إلى 40 دقيقة باستخدام هذه الميزة أثناء المشي. ونظراً لأن هذا الوضع يعتمد على نماذج GPT الأحدث، فإنه يمكنه تقديم بعض الإجابات مرئياً، مما يضع OpenAI في المسار نفسه مع الشركات الناشئة مثل Monogram، التي جمعت 40 مليون دولار في جولة تمويل أولية (seed funding) من DST وLux Capital لبناء مساعدين أكثر تفاعلية واستجابة بصرية. وكما قال Eleti: “بمرور الوقت، نعتقد أن هذا سيفتح المجال أيضاً لاستخدام الصوت كواجهة رئيسية للحوسبة، ولإدارة الأعمال الوكيلية (agentic work) طويلة المدى والأكثر تعقيداً بشكل متزايد. إن نوعية حالات الاستخدام المذهلة التي نرى الناس ينجزونها باستخدام Codex وChatGPT، تجعلنا نعتقد أن الصوت يمكن أن يكون واجهة المستقبل لجميع أنواع الأعمال”.

وترى OpenAI أن الصوت سيصبح واجهة رئيسية للحوسبة، استناداً إلى قاعدة مستخدمين تضم أكثر من 150 مليون شخص يتحدثون بالفعل إلى ChatGPT عبر ميزتي الصوت والإملاء (Voice and Dictation) الخاصتين به. وقد أشارت تقارير إلى أن OpenAI قد تطلق سماعات أذن مزودة بقدرات الذكاء الاصطناعي هذا العام، على الرغم من أن الشركة لم تقدم أي تفاصيل بشأن أي خطط للأجهزة. ويتحرك المنافسون في الاتجاه نفسه: حيث قامت كل من Apple وAmazon بتحديث مساعديهما ليكونا أكثر قدرة على إجراء المحادثات، كما أطلقت Sesame — وهي شركة ناشئة لمساعدي الذكاء الاصطناعي أسسها الشريك المؤسس لشركة Oculus وهو Brendan Iribe بالتعاون مع Ankit Kumar — مساعدين يعتمدون على المحادثة الطبيعية أثناء إنجاز المهام في الخلفية.

وقالت OpenAI إن وضع الصوت الجديد مُحسَّن لمعظم اللغات المحكية، على الرغم من أنها لم تحدد أياً منها. وتتضمن النماذج ضمانات حماية مدمجة لتقديم استجابات مناسبة لأعمار المراهقين، وتوفير الموارد إذا تطرق الحديث إلى مواضيع مثل إيذاء النفس. ومع ذلك، لا تزال هناك حدود واضحة: ففي عرض توضيحي للترجمة المباشرة باللغة الهندية (Hindi)، تحدث المساعد بلكنة أمريكية (American) ثقيلة، واستخدم صياغات بدت غير طبيعية ومدرسية.

لماذا يهم

تضع OpenAI تقنية الصوت ثنائي الاتجاه بالكامل (full-duplex) كواجهة رئيسية مستقبلية للحوسبة المعقدة والمهام الوكيلية (agentic tasks)، متجاوزة المساعدين الصوتيين البسطاء نحو إنتاجية طويلة المدى دون الحاجة لاستخدام اليدين.