أعلنت شركة جوجل عن إطلاق نموذج EmbeddingGemma 2، وهو نموذج تضمين متعدد الوسائط مفتوح المصدر مصمم للعمل مباشرة على الأجهزة الذكية. يدمج النموذج بين النصوص والصور والصوت والفيديو في فضاء تضمين موحد، ما يعزز قدرات البحث المتعدد الوسائط على الأجهزة المحلية.
يحتوي النموذج على 740 مليون معامل ويعتمد على معمارية Gemma 4، مع إمكانية تخصيص المشفرات البصرية والصوتية. على سبيل المثال، يستخدم النموذج على هاتف Google Pixel 11 Pro حوالي 191 ميغابايت من ذاكرة الوصول العشوائي للإصدار النصي فقط، و567 ميغابايت للإصدار الكامل متعدد الوسائط مع الضغط الكمي.
يمتاز EmbeddingGemma 2 بنافذة سياق تبلغ 8,000 رمز، أي أربعة أضعاف النسخة السابقة، ما يسمح بمعالجة ما يصل إلى 5.5 دقيقة من الصوت أو 29 صورة أو 58 إطار فيديو على الأجهزة المحلية. كما حقق النموذج تحسناً ملحوظاً في دقة التضمين مقارنة بالإصدار السابق.
يعتمد النموذج تقنية Matryoshka Representation Learning التي تتيح تقليص أبعاد متجهات الإخراج من 768 إلى 128 بُعداً، مما يوفر تخفيضاً يصل إلى 6 أضعاف في حجم قواعد البيانات المتجهية المحلية. النموذج متاح حالياً للتنزيل على منصات Hugging Face وKaggle، مع دعم لنشره عبر عدة أطر عمل وتقنيات.
تخطط جوجل لإتاحة النموذج قريباً على منصة Gemini Enterprise Agent Model Garden، مما يعزز من إمكانية استخدامه في تطبيقات المؤسسات المختلفة.




