Gemini Embedding 2.. خطوة جديدة من جوجل لتطوير الذكاء الاصطناعي متعدد الوسائط
جيميني إمبيدينج 2
أطلقت شركة جوجل أول نموذج تضمين متعدد الوسائط بالكامل، أطلقت عليه اسم "جيميني إمبيدينج 2"، وهو نموذج ذكاء اصطناعي يدمج النصوص والصور والصوت والفيديوهات في فضاء تضمين موحد، وهذا يعني أنه يستخدم بنية لفهم المفاهيم سواءً كانت مكتوبة أو منطوقة أو معروضة في صورة أو فيديو.
أول نموذج تضمين متعدد الوسائط من جوجل متوفر الآن
شرحت عملاقة التكنولوجيا بالتفصيل نموذج الذكاء الاصطناعي الجديد، حيث يُعد هذا النموذج خليفةً لنموذج تضمين النصوص فقط الذي أُطلق العام الماضي، وهو قادر على استخلاص المعنى الدلالي لأكثر من 100 لغة، كما يتوفر Gemini Embedding 2 حاليًا في معاينة عامة عبر واجهة برمجة تطبيقات Gemini (API) ومنصة Vertex AI، وذلك وفقا لموقع gadgets360 التقني.

تحتوي نماذج الذكاء الاصطناعي عادةً على خزائن ملفات رقمية مختلفة لتخزين النصوص والصور والفيديوهات والملفات الصوتية، عندما يطلب المستخدم معلومات بتنسيق معين، يبدأ النموذج بالبحث في تلك الخزانة تحديدًا، عادةً، يتعامل نموذج التعلم الآلي مع كلمة "قطة" في مستند نصي وكلمة "قطة" في فيديو على أنهما شيئان مختلفان تمامًا، ما يزيد الأمر تعقيدًا، أن طريقة الحصول على المعلومات تختلف باختلاف كل تنسيق.
يحل نظام Gemini Embedding 2 هذه المشكلة من خلال إنشاء بنية جديدة تستخدم وحدة تخزين واحدة فقط لجميع أنواع المعلومات، وهذا يمكنه من معالجة المستندات التي تحتوي على نصوص وصور في آنٍ واحد، تمامًا كما يفعل البشر، وتؤكد جوجل أن هذا النظام الجديد يبسط "المسارات المعقدة ويحسن مجموعة واسعة من مهام المعالجة المتعددة الوسائط"، ومن بين هذه المهام: التوليد المُعزز بالاسترجاع (RAG)، والبحث الدلالي، وتحليل المشاعر، وتجميع البيانات.
قدرات نموذج Gemini Embedding 2
أما بالنسبة لقدرات نموذج الذكاء الاصطناعي، فهو يمتلك نافذة سياق نصي تصل إلى 8192 رمزًا إدخاليًا، كما يمكنه معالجة ما يصل إلى ست صور لكل طلب بصيغتي PNG وJPEG، ويدعم إدخال فيديو يصل إلى 120 ثانية بصيغتي MP4 وMOV، بالإضافة إلى ذلك، يمكنه معالجة البيانات الصوتية وتعيينها مباشرةً دون الحاجة إلى نسخ نصية، علاوة على ذلك، يمكنه أيضًا تضمين ملفات PDF يصل طولها إلى ست صفحات.
كما يستطيع النموذج فهم المدخلات المتداخلة، مما يسمح للمستخدمين بإرسال بيانات متعددة الوسائط (مثل النصوص والصور) في الطلب نفسه، وتؤكد جوجل أن هذه الميزة تمكن النموذج من فهم البيانات المعقدة والواقعية بدقة أكبر.
اقرأ أيضًا:
الأكثر قراءة
-
بعد 18 عامًا.. أسرار جريمة هبة العقاد ونادين جمال التي هزت مصر وانتهت بإعدام عيساوي
-
بالتعاون مع "جوجل".. القبض على موظف بعد رصد حساب يتضمن تعديه على صغار (خاص)
-
بعد زيادة الشرائح.. الكهرباء تكشف موعد تطبيقها على العدادات الكودية (خاص)
-
قبل ما تسافر.. هذه الرسوم الجديدة ستدفعها عند مغادرة مصر
-
الأهلي يوجه ضربة قوية لـ بيراميدز ويخطف 5 من لاعبيه مجانًا
-
زيادة 20% في سعر رغيف العيش.. المخابز تكشف الأسباب
-
بعد زيادة أسعار الكهرباء.. كيف تبقى ثابتًا على الشريحة الأولى؟
-
من أجل "الصدر الحنين".. كوافيرة تتخلص من زوجها بمساعدة عشيقها عامل النظافة بالفيوم
أخبار ذات صلة
كتاب تحت الشبهة.. دار نشر تجمّد صفقة بـ2.4 مليون دولار بسبب AI
01 أغسطس 2026 05:08 م
مصر تفوز برئاسة فريقي حوكمة الذكاء الاصطناعي والحوسبة الكمية باللجنة العربية
31 يوليو 2026 08:08 م
الطلبات المسبقة لـ "Galaxy Z Fold 8" تسجل مستويات تاريخية
30 يوليو 2026 10:32 م
"تعلمت درسا".. سياسي كندي يعترف بخطأ استخدام الـAI في خطاب تشريعي
30 يوليو 2026 10:26 م
لتأهيل الكفاءات الشابة.. شراكة بين "MCS" و"Wadhwani" في الأمن السيبراني
30 يوليو 2026 07:53 م
كاسبرسكي: 8.3 مليون هجوم إلكتروني استهدف مصر خلال 6 أشهر
29 يوليو 2026 02:23 م
علماء يطورون طائرة مسيرة تختفي أمام العين.. هل تغير مستقبل الحرب؟
29 يوليو 2026 01:39 م
لطلاب الجامعات.. فتح التسجيل بالمرحلة الثانية من أكاديمية الأمن السيبراني
29 يوليو 2026 12:38 م
أكثر الكلمات انتشاراً