نموذج Gemini Omni للفيديو هو نموذج ذكاء اصطناعي تولّيدي أطلقته Google DeepMind مصمم لإنشاء محتوى الفيديو من وصفات نصية. يجمع نموذج Gemini Omni للفيديو بين قدرات فهم اللغة في Gemini مع أنظمة توليد الوسائط، مما يمكّن المستخدمين من إنتاج تسلسلات فيديو واقعية بسرد منطقي وبيئات متسقة فيزيائياً.
يُظهر نموذج Gemini Omni للفيديو فهماً محسّناً للفيزياء جنباً إلى جنب مع معرفة Gemini الموجودة بالتاريخ والبيولوجيا والثقافة. ينتج النظام مقاطع فيديو حيث تُحدث الإجراءات عواقب منطقية، والبيئات تستجيب للأحداث، والسرد يتطور بتماسك داخلي. يمكن للمستخدمين تعديل لقطات الفيديو الموجودة بوصف التغييرات المطلوبة من خلال طلبات لغة طبيعية.
القدرات الأساسية لنموذج Gemini Omni للفيديو
يدعم النموذج ميزات اتساق الشخصيات التي تحافظ على شخصية معرّفة عبر مشاهد متعددة وأماكن وإجراءات وظروف إضاءة. يمكن تطبيق الأسلوب والحركة والمؤثرات البصرية إما بالإشارة إلى أمثلة الإدخال أو من خلال أوصاف نصية مباشرة. وظائف تحويل البيئة تسمح للمستخدمين بتعديل الخلفيات وإدخال كائنات جديدة أو إنشاء سيناريوهات جديدة تماماً داخل محتوى الفيديو الموجود.
يمثل Gemini Omni Flash أول نموذج في عائلة Omni. النظام متاح حالياً من خلال تطبيق Gemini وتطبيق Flow من Google و YouTube Shorts. قالت Google DeepMind إن الوصول عبر API سيبدأ في الأسابيع القادمة، مما يوسع التوفّر للمطورين والتطبيقات الجهات الخارجية.
ميزات تحرير الفيديو وإعادة التخيل
تسمح ميزة رئيسية للمستخدمين بإعادة تخيل الإجراءات داخل مقاطع الفيديو التي سجلوها. بدلاً من إعادة تصوير اللقطات، يصف المستخدمون التغييرات المطلوبة ويطبق النموذج التعديلات مع الحفاظ على الجودة البصرية والتماسك. تعالج هذه القدرة سير العمل العملي لمنتجي المحتوى الذين يحتاجون إلى التكرار على تكوينات الفيديو بدون إعادة إنتاج كاملة.
التوفّر الحالي والمخطط
يمكن الوصول إلى Gemini Omni Flash فوراً من خلال قنوات متعددة. يوفر تطبيق Gemini وصولاً مباشراً إلى قدرات النموذج، بينما يسمح التكامل مع YouTube Shorts لمنتجي المحتوى بتوليد محتوى الفيديو داخل المنصة. يقدم Flow by Google وظائف إضافية للمستخدمين الذين يسعون إلى سير عمل وسائط توليدية شاملة. في الأسابيع التالية للإعلان، ستوسع الشركة الوصول من خلال واجهات برمجية، مما يمكّن التكامل مع التطبيقات والخدمات الخارجية.
الآثار على إنتاج الفيديو
يضع إطلاق نموذج Gemini Omni للفيديو توليد الفيديو بالذكاء الاصطناعي كأداة عملية لإنشاء المحتوى. تعالج قدرة النموذج على الحفاظ على اتساق الشخصيات وتوليد مشاهد معقولة فيزيائياً القيود التقنية التي حدّت من الأنظمة السابقة للفيديو التوليدية. يشير التوفّر من خلال منصات موجهة للمستهلك مثل YouTube Shorts إلى أن التكنولوجيا تنتقل من التطبيقات التجريبية نحو الاستخدام السائد في إنتاج المحتوى الرقمي.
المصدر: X (@GoogleDeepMind)




