ما هو Gemini Agentic Video؟ دليل عملي لمستخدمي Android

2026-09-02
Gemini Agentic فهم الفيديو يغير كيف يعمل معالجة الفيديو بالـ AI. إليك ما يعنيه Gemini 3.7 Flash لمستخدمي Android والمطورين.
أطلق Google DeepMind ميزة Agentic فهم الفيديو في 1 سبتمبر 2026، وهي تغير الطريقة التي تعالج بها نماذج الذكاء الاصطناعي الفيديو. بدلاً من فحص كل إطار بتردد ثابت، أصبح Gemini يبحث ويفحص ويتفقد شرائح محددة من الفيديو ديناميكياً بناءً على ما تبحث عنه. فكر في الفرق بين قراءة كل صفحة في كتاب من الغلاف إلى الغلاف مقابل القفز مباشرة إلى الفصول التي تجيب على سؤالك.
إذا كنت تستخدم تطبيق Gemini على Android، فهذا مهم لأن الميزة قادمة إلى طرازات Flash و Flash-Lite خلال أسابيع. وهي متاحة بالفعل عبر API Gemini في Google AI Studio و Gemini Enterprise Agent Platform. إليك ما تفعله وكيف تعمل ولماذا تغير قواعد اللعبة في معالجة الفيديو بالـ AI.
ما الذي يفعله Gemini Agentic video فعلاً
يعالج معالجة الفيديو بالـ AI التقليدي لقطات الفيديو بتردد إطارات ثابت. تتم معالجة كل ثانية بنفس الطريقة، سواء كانت تحتوي على معلومات حرجة أو لا شيء مفيد على الإطلاق. يعكس Gemini Agentic فيديو هذا النهج. يقرر النموذج أي الشرائح يفحصها، باحثاً ديناميكياً عبر الإطارات المرئية ومسارات الصوت والنصوص المكتوبة للعثور على ما يهم.
هذا ليس تحسيناً بسيطاً. إنه تغيير جوهري في كيفية تفاعل النموذج مع بيانات الفيديو. فهم الفيديو من Google DeepMind الآن يعني أن الذكاء الاصطناعي يتصرف أكثر كباحث يتصفح التسجيلات بحثاً عن لحظات ذات صلة بدلاً من كاميرا مراقبة تسجل كل شيء دون تمييز.
تغطي القدرات مساحة واسعة. استرجاع اللحظات بأجزاء من الثانية يتيح لك العثور على إطار محدد في فيديو طويل. البحث التفصيلي في المقاطع الطويلة يعني أن Gemini قادر على تحديد تفصيل عابر مدفون في ساعات من التسجيل. اكتشاف الشذوذ يحدد الأحداث غير المعتادة تلقائياً. عد الأفعال والأشياء يحول الفيديو إلى بيانات منظمة يمكنك الاستعلام عنها.
كيف يجري Gemini 3.7 Flash عملية تحليل الفيديو
Gemini 3.7 Flash أحد ثلاثة نماذج تدعم Agentic فهم الفيديو، إلى جانب Gemini 3.6 Flash و Gemini 3.5 Flash-Lite. عندما ترسل فيديو عبر API Gemini مع ضبط المعالجة على "Agentic"، يفحص النموذج أولاً البنية العامة للفيديو. يحدد الشرائح الرئيسية بناءً على طلبك. ثم يكبّر تلك الشرائح، مقيّماً الإطارات المرئية إلى جانب نص الصوت وأي نص متاح.
النتيجة: يجد إجابات أسرع ويستهلك توكنات أقل في العملية. يقل استهلاك التوكنات بنسبة تصل إلى 88% مقارنة بالمعالجة الثابتة. تنخفض التكاليف بنسبة تصل إلى 66%. تتحسن الدقة بنسبة تصل إلى 7%. هذه الأرقام مأخوذة من اختبارات Google DeepMind نفسها مع شركاء الوصول المبكر، لذا تعامل معها كأفضل السيناريوهات وليست نتائج مضمونة. الاتجاه واضح على كل حال. المعالجة الوكيلة أكثر كفاءة من فحص الإطارات الثابت، وبفارق كبير.
المعالجة الثابتة مقابل Agentic فهم الفيديو
لفهم لماذا هذا مهم، تذكر كيف كان يعمل تحليل الفيديو من Gemini سابقاً. كان النموذج يأخذ عينات من الإطارات، مثلاً إطار واحد في الثانية. فيديو مدته 10 دقائق يعني 600 إطار للمعالجة بغض النظر عن المحتوى. معظم تلك الإطارات ربما لم تكن تحتوي على أي شيء مثير.
يغير تحليل الفيديو من Gemini بالمعالجة الوكيلة الحساب بالكامل. قد يقرر النموذج أنه يحتاج فقط إلى النظر في 50 إطاراً من نفس الفيديو مدته 10 دقائق. يتخطى الأجزاء المملة. يركز على الشرائح حيث يذكر نص الصوت شيئاً ذا صلة، أو حيث يتغير المحتوى المرئي بشكل ملحوظ.
يعمل هذا النهج بشكل جيد بشكل خاص للاستعلامات الموجهة. إذا سألت "متى يلتقط الشخص الكوب الأحمر"، لا يحتاج النموذج إلى فحص كل إطار. يبحث في النص عن "الكوب الأحمر"، يحدد الطابع الزمني، ويفحص نافذة ضيقة من الإطارات حول تلك اللحظة. سريع ورخيص.
لمهام الفهم العام مثل تلخيص فيديو كامل، تنطبق المعالجة الوكيلة أيضاً ولكن بتغطية أوسع. يضبط النموذج عمق البحث بناءً على ما تطلبه. طلب التلخيص يحصل على مسح أوسع. استعلام لحظة محددة يحصل على فحص دقيق.
أمثلة عملية لـ معالجة الفيديو بالـ AI
تنقسم التطبيقات إلى فئات تهم المستخدمين العاديين والمطورين على حد سواء.
البحث في المحتوى هو الخيار الأكثر وضوحاً. سجلت اجتماعاً مدته 45 دقيقة وتحتاج إلى اللحظة التي ذكر فيها شخص ما "تخفيضات الميزانية". فهم الفيديو الوكيل من Gemini يمكنه العثور على تلك اللحظة بأجزاء من الثانية دون الحاجة للتنقل عبر التسجيل بالكامل. هذا وحده يوفر ساعات من المراجعة اليدوية.
مراقبة الجودة واكتشاف الشذوذ حالة عملية أخرى. تستخدم خطوط الإنتاج كاميرات لمراقبة التصنيع. معالجة الفيديو بالـ AI يمكنه تحديد الإطار الدقيق الذي يظهر فيه عيب، عدّ كم عنصراً مرّ، والإبلاغ عن الشذوذ دون معالجة 24 ساعة من التسجيلات بالدقة الكاملة.
إمكانية الوصول تحصل على دفعة حقيقية أيضاً. المحتوى المرئي الذي لم يُنسخ أو يُوصف قط يمكن تحليله بواسطة Gemini، الذي يفحص كل من المسارات المرئية والصوتية لإنتاج أوصاف وعلامات زمنية ونص قابل للبحث. هذا تحسن مهم للمستخدمين الذين يعتمدون على قارئات الشاشة.
تكامل YouTube قادم. يقول Google إن فهم الفيديو الوكيل سيشغل ميزة "Ask YouTube" في الأشهر المقبلة. ستتمكن من طرح أسئلة عن فيديو والحصول على إجابات بناءً على ما يحدث فعلاً فيه، وليس فقط العنوان أو الوصف.
ماذا يعني فهم الفيديو من Google DeepMind لمستخدمي التطبيق
تطبيق Gemini على Android سيحصل على هذه الميزة لطرازات Flash و Flash-Lite قريباً. إذا كنت تستخدم Gemini للمهام اليومية، فلن تحتاج إلى ضبط أي شيء. يتعامل التطبيق مع وضع المعالجة تلقائياً بناءً على ما تطلبه منه.
بالنسبة للمطورين، مسار API بسيط. اضبط معامل المعالجة على "Agentic" في تكوينك عند إرسال فيديو عبر API Gemini. لا نقطة نهاية خاصة، لا مصادقة منفصلة. تغيير معامل واحد. كان Google يمكنه بسهولة فرض رسوم إضافية على هذا. لم يفعل.
الأثر العملي لمستخدمي التطبيق هو أنه يمكنك تحميل فيديوهات أطول إلى Gemini والحصول على إجابات دون انتظار طويل أو دفع الكثير. فيديو مدته ساعتان كان مكلفاً لمعالجته يصبح عملياً. تخفيض التوكنات بنسبة 88% يعني مزيداً من التحليل لكل دولار، وتحسن الدقة بنسبة 7% يعني أنه يمكنك الوثوق بالنتائج قليلاً أكثر.
تكاليف API Gemini وكفاءة التوكنات
نموذج التسعير مباشر. تدفع مقابل التوكنات التي تستخدمها، وتقلل المعالجة الوكيرة استهلاك التوكنات بشكل حاد. فيديو كان سيكلف 5 دولارات لمعالجته بالاستخراج الثابت للإطارات قد يكلف 1.70 دولار أو أقل بالمعالجة الوكيرة، بناءً على تخفيض التكاليف بنسبة 66% الذي أبلغ عنه Google.
الوصول متاح عبر ثلاث قنوات. Google AI Studio هو نقطة البداية للمطورين الذين يختبرون ويبنون النماذج الأولية. Gemini Enterprise Agent Platform يتعامل مع النشر الإنتاجي. وتطبيق Gemini يجلب الميزة للمستخدمين العاديين على Android، مع الطرح على مراحل.
قيود المعالجة الوكيرة للفيديو
تخفيض التوكنات بنسبة 88% وتوفير التكاليف بنسبة 66% هما أرقام Google من اختبارات مع شركاء الوصول المبكر. الأداء الفعلي سيختلف بناءً على نوع الفيديو ومدى تعقيد الطلب واختيار النموذج. الفيديو ذو المحتوى الكثيف سريع التغير قد يتطلب إطارات أكثر من مقطع ثابت لشخص يتكلم.
المعالجة الوكيرة أيضاً تضيف بعض عدم التوقع. مع المعالجة الثابتة، تعرف بالضبط كم إطاراً يفحصه النموذج. مع المعالجة الوكيرة، يقرر النموذج، مما يعني أن تشغيلين على نفس الفيديو قد ينتجان نتائج مختلفة قليلاً. لمعظم حالات الاستخدام هذا لن يهم. ولكن إذا كنت تحتاج إلى تحليل قابل للتكرار إطاراً بإطار، فقد لا تزال المعالجة الثابتة خياراً أفضل.
الميزة جديدة أيضاً. أطلقها Google في 1 سبتمبر 2026، وتُطرح على مراحل. إذا لم يكن لديك وصول بعد عبر تطبيق Gemini، قد تحتاج إلى انتظار الطرح الأوسع لطرازات Flash و Flash-Lite. من ناحية الأمان و الخصوصية، تتبع المعالجة الوكيرة نفس سياسات بيانات Gemini دون تخزين محتوى الفيديو أطول مما يلزم للتحليل.
Gemini Agentic فهم الفيديو أحد تلك التحديثات التي تبدو تقنية لكن لها عواقب حقيقية لكل من يعمل مع الفيديو على Android. القدرة على البحث والتحليل واستخراج المعلومات من فيديو دون معالجة كل إطار تعني نتائج أسرع وتكاليف أقل ودقة أفضل. المطورون الذين يبنون ميزات فيديو يحصلون على API أكثر كفاءة. المستخدمون العاديون يحصلون على أداة أذكى للعثور على لحظات في تسجيلات طويلة. Gemini 3.7 Flash والنماذج المرافقة له الآن تعالج الفيديو بطريقة تختلف فعلاً عما كان موجوداً قبل ذلك. حمل تطبيق Gemini من APKPure، ارفع فيديو، واطرح سؤالاً محدداً. المعالجة الوكيرة تتكفل بالباقي.
- كيفية تنزيل Google Earth APK بأحدث إصدار لأندرويد
- كيفية تنزيل Zangi Private Messenger APK بأحدث إصدار لأندرويد في 2025
- كيفية تنزيل Grok APK بأحدث إصدار لأندرويد في 2026