الذكاء الاصطناعي
OpenAI توسّع واجهة برمجة تطبيقات Realtime بميزات الاستدلال والترجمة
حدّثت OpenAI واجهة برمجة تطبيقات Realtime بميزات جديدة للذكاء الصوتي، بما في ذلك الاستدلال من فئة GPT-5 والترجمة الفورية، على الرغم من أن الشركة تشير إلى أن هذه الأدوات قد تُستخدم بشكل خاطئ.
أعلنت OpenAI يوم الخميس أن واجهة برمجة التطبيقات الخاصة بها ستتضمن الآن مجموعة من ميزات الذكاء الصوتي الجديدة. صُمم هذا الإطلاق لمساعدة المطورين على بناء تطبيقات قادرة على التحدث ونسخ النصوص وترجمة المحادثات مع المستخدمين في الوقت الفعلي. ويهدف هذا التوسع إلى مساعدة المطورين في قطاعات متعددة، بما في ذلك خدمة العملاء، والتعليم، والإعلام، والفعاليات، ومنصات صناع المحتوى.
يقدم التحديث، الذي يندرج ضمن واجهة برمجة تطبيقات Realtime الخاصة بـ OpenAI، ثلاث قدرات متميزة للتعامل مع طلبات المستخدمين المعقدة:
- GPT-Realtime-2: نموذج صوتي مصمم لإنشاء محاكاة صوتية واقعية قادرة على التحاور مع المستخدمين. وعلى عكس سابقه، تم بناء هذا النموذج بقدرات استدلال من فئة GPT-5، وهي فئة أداء أعلى مصممة للتعامل مع طلبات المستخدمين الأكثر تعقيداً.
- GPT-Realtime-Translate: خدمة ترجمة محادثات مصممة لتوفير ترجمة فورية. تدعم هذه الميزة أكثر من 70 لغة إدخال يمكن للنموذج فهمها، و13 لغة إخراج ينقلها النموذج إلى المتحدث.
- GPT-Realtime-Whisper: قدرة على تحويل الكلام إلى نص بشكل مباشر، مما يمنح المستخدمين نسخاً نصياً حياً يتم التقاطه أثناء حدوث التفاعلات.
ووفقاً لـ OpenAI، فإن النماذج التي تم إطلاقها حديثاً مصممة لنقل الصوت في الوقت الفعلي من أنظمة “الاستدعاء والاستجابة” البسيطة إلى واجهات صوتية نشطة قادرة على الاستماع والاستدلال والترجمة والنسخ واتخاذ إجراءات أثناء المحادثة.
وفي حين توفر هذه الأدوات فائدة للمؤسسات التي تتطلع إلى توسيع نطاق خدمة العملاء والتعليم والإعلام والفعاليات ومنصات صناع المحتوى، تقر الشركة بأن الميزات الجديدة قد تُستخدم بشكل خاطئ. ولمعالجة هذه المخاطر، قامت OpenAI ببناء حواجز حماية لمنع إساءة استخدام ميزاتها الجديدة لإنشاء رسائل غير مرغوب فيها، أو عمليات احتيال، أو أشكال أخرى من الإساءة عبر الإنترنت. وقد قامت الشركة بتضمين مشغلات محددة في النظام بحيث “يمكن إيقاف المحادثات إذا تم اكتشاف أنها تنتهك إرشادات المحتوى الضار الخاصة بنا”، وفقاً لما ذكرته OpenAI.
لماذا يهم
تنقل هذه النماذج الصوت في الوقت الفعلي من أنظمة “الاستدعاء والاستجابة” البسيطة إلى واجهات صوتية نشطة قادرة على الاستدلال واتخاذ الإجراءات، مما يوفر فائدة كبيرة للمطورين في مجالات خدمة العملاء والتعليم والإعلام.