الذكاء الاصطناعي
معيار Mercor يُظهر معاناة نماذج الذكاء الاصطناعي في المهام المهنية
يكشف معيار APEX-Agents الجديد من شركة Mercor أن معظم نماذج الذكاء الاصطناعي تعاني في أداء المهام المكتبية المعقدة ومتعددة المجالات، حيث حقق النموذج الأعلى أداءً دقة بنسبة 24٪.
بعد مرور ما يقرب من عامين على توقّع Satya Nadella، الرئيس التنفيذي لشركة Microsoft، بأن الذكاء الاصطناعي سيحل محل العمل المعرفي، يكشف معيار جديد يُدعى APEX-Agents، طوّرته شركة بيانات التدريب Mercor، أن معظم نماذج الذكاء الاصطناعي تعاني في أداء العمل المكتبي — الذي يُعرَّف بأنه خدمات مهنية مثل القانون والمصارف والمحاسبة. ووفقاً للبحث، تحصل كل مختبرات الذكاء الاصطناعي على درجة رسوب في هذا المعيار، حيث تكافح النماذج لإكمال مهام معقدة تحاكي بيئات العمل المهنية الفعلية.
صُمم هذا المعيار ليعكس الخدمات المهنية في العالم الحقيقي من خلال اختبار قدرة الأنظمة على التعامل مع بيئات متعددة المجالات. وأشار Brendan Foody، الرئيس التنفيذي لشركة Mercor، إلى أن النماذج تعاني من تتبع المعلومات عبر مجالات متعددة، وهو مطلب أساسي للعمل المهني البشري. وأوضح Foody أن الوظائف البشرية لا تنطوي على قيام فرد واحد بتوفير كل السياق في مكان واحد، بل تتطلب العمل عبر أدوات متنوعة مثل Slack وGoogle Drive.
تستمد سيناريوهات المعيار أمثلتها من مهنيين حقيقيين. على سبيل المثال، تسأل إحدى المهام القانونية عما إذا كان بإمكان شركة ما اعتبار تصدير السجلات التي تحتوي على بيانات شخصية إلى بائع تحليلات في الولايات المتحدة خلال أول 48 دقيقة من انقطاع الإنتاج في الاتحاد الأوروبي متوافقاً مع المادة 49 من قوانين الخصوصية في الاتحاد الأوروبي. وتتطلب الإجابة على مثل هذه الأسئلة تقييماً عميقاً لسياسات الشركة واللوائح الإقليمية.
عند اختبار هذه المهام، أظهرت النماذج معدلات نجاح منخفضة. حقق Gemini 3 Flash أعلى درجة بدقة 24٪ في المحاولة الواحدة — والتي تُعرَّف بأنها أداء النموذج في محاولة واحدة. وتبعه GPT-5.2 عن كثب بدقة 23٪، بينما سجل كل من Opus 4.5 وGemini 3 Pro وGPT-5 ما يقرب من 18٪. يتناقض هذا التقييم مع معيار GDPval الخاص بشركة OpenAI. فبينما يقيس GDPval المعرفة العامة عبر مجموعة واسعة من المهن، يركز معيار APEX-Agents على المهام المستمرة ضمن مجموعة ضيقة من الخدمات المهنية عالية القيمة.
على الرغم من الدرجات الأولية المنخفضة، يتوقع Foody تحسناً سريعاً. وقال Foody: “في الوقت الحالي، من الإنصاف القول إن الأمر يشبه متدرباً يصيب في ربع الحالات، لكن في العام الماضي كان المتدرب يصيب في 5 أو 10٪ من الحالات. هذا النوع من التحسن عاماً بعد عام يمكن أن يكون له تأثير سريع للغاية”.
لماذا يهم
يوفر معيار APEX-Agents طريقة جديدة لقياس كيفية أداء نماذج الذكاء الاصطناعي في المهام المعقدة ومتعددة المجالات النموذجية للخدمات المهنية، مما يكشف أن النماذج الحالية تكافح لتلبية معايير المهنيين البشر.