الاثنين، 3 أغسطس 2026

الذكاء الاصطناعي

Google تطلق Gemini Omni لمحاكاة الواقع باستخدام الذكاء الاصطناعي متعدد الوسائط

أطلقت Google نموذج Gemini Omni، وهو عائلة جديدة من النماذج متعددة الوسائط القادرة على إنشاء مقاطع فيديو من مدخلات متنوعة، بدءاً بطرح Gemini Omni Flash اليوم.

Google launches Gemini Omni to simulate reality with multimodal AI
صورة: Google

أطلقت Google نموذج Gemini Omni، وهو عائلة جديدة من النماذج متعددة الوسائط المصممة لإنشاء محتوى من أي مدخلات. ويتم طرح النموذج الأول في هذه العائلة، وهو Gemini Omni Flash، اليوم عبر تطبيق Gemini وYouTube Shorts واستوديو الإبداع المدعوم بالذكاء الاصطناعي Flow. يمثل هذا الإطلاق تحولاً استراتيجياً للشركة، التي أعلنت عن Gemini لأول مرة قبل ثلاث سنوات. وأوضح Sundar Pichai، الرئيس التنفيذي لشركة Google، أنه عند الإعلان عن Gemini لأول مرة، كان الهدف هو بناء نموذج متعدد الوسائط بطبيعته تم تدريبه على النصوص والأكواد والصوت والصور والفيديو لمنحه فهماً أعمق للعالم. وأشار Pichai إلى أنه مع “نماذج العالم” (world models)، ينتقل الذكاء الاصطناعي من التنبؤ بالنصوص إلى محاكاة الواقع، ويمثل Gemini Omni الخطوة التالية في هذا الاتجاه.

نموذج Gemini Omni Flash قادر على تقديم 10 ثوانٍ من الفيديو. ووصفت Nicole Brichtova، مديرة إدارة المنتجات في Google DeepMind، هذا القيد بأنه خيار استراتيجي لتعزيز إمكانية وصول المستهلكين إليه بدلاً من كونه قيداً تقنياً، مشيرة إلى أن الشركة أرادت إيصال الأداة إلى أيدي المزيد من المستخدمين. وتضع Google نموذج Omni Flash في المقام الأول كأداة للمستهلكين. ووصف Gabe Barth-Maron، وهو مهندس أبحاث في DeepMind، المخرجات بقوله: “إنها تشبه الميمات الشخصية”. وأوضحت Brichtova أن هذا الإصدار يمثل الخطوة التالية في الجمع بين ذكاء Gemini وقدرات العرض لنماذج الوسائط الخاصة بالشركة، مما يميز Omni عن نموذج الفيديو الحالي من Google، Veo.

وتعتزم Google توفير Omni عبر واجهة برمجة التطبيقات (API) في الأسابيع المقبلة. وتتيح هذه التقنية للمستخدمين إنشاء مقاطع فيديو باستخدام صورهم الرمزية الرقمية (avatars). ومع ذلك، ولمنع التزييف العميق (deepfakes)، سيتعين على المستخدمين الخضوع لعملية إعداد مخصصة للمنتج. تتطلب هذه العملية من المستخدمين تسجيل أنفسهم ونطق سلسلة من الأرقام قبل تخزين الصورة الرمزية. بالإضافة إلى ذلك، ستتضمن جميع مقاطع الفيديو التي يتم إنشاؤها باستخدام Omni علامة SynthID المائية الرقمية للتحقق مما إذا كانت قد أُنشئت عبر منتجات Gemini. يأتي هذا الإطلاق في الوقت الذي يقوم فيه منافسون مثل Luma AI ببناء أدوات وكيلة (agentic tools) مماثلة. وخلال إحاطة إعلامية يوم الاثنين، شرح مسؤولو Google الرؤية الاستراتيجية وراء هذا الإطلاق، مؤكدين على الانتقال من التنبؤ البسيط بالنصوص إلى محاكاة الواقع.

لماذا يهم

يمثل إصدار Google لنموذج Gemini Omni خطوة ملموسة نحو هدف الشركة المتمثل في بناء نموذج لغوي كبير متعدد الوسائط يمكنه الاستنتاج عبر النصوص والصور والصوت والفيديو لمحاكاة الواقع.