`
جوجل تطلق EmbeddingGemma 2.. نموذج مفتوح متعدد الوسائط يعمل محليًا على الأجهزة

جوجل تطلق EmbeddingGemma 2.. نموذج مفتوح متعدد الوسائط يعمل محليًا على الأجهزة


 أعلنت Google عن EmbeddingGemma 2، وهو نموذج ذكاء اصطناعي مفتوح وخفيف الوزن صُمم لمعالجة عمليات البحث والاسترجاع الدلالي مباشرة على الأجهزة، مع دعم النصوص والشيفرات البرمجية والصور والفيديو والصوت داخل فضاء تمثيل موحد. blog.google

ويحتوي النموذج على 740 مليون معلمة، ويعتمد على معمارية Gemma 4، وأطلقته جوجل بموجب ترخيص Apache 2.0. ويمكن استخدام 270 مليون معلمة فقط في مهام النص، ثم إضافة مشفر للرؤية يضم 170 مليون معلمة ومشفر للصوت يضم 300 مليون معلمة عند الحاجة إلى معالجة متعددة الوسائط. blog.google

ومن أبرز نقاط النموذج قدرته على العمل محليًا بدل إرسال البيانات باستمرار إلى الخوادم السحابية. وتقول جوجل إنه بعد تطبيق تقنيات التكميم يحتاج على Pixel 11 Pro إلى نحو 191 ميجابايت من الذاكرة النشطة لأوزان النص فقط، ونحو 567 ميجابايت للنموذج متعدد الوسائط كاملًا. كما يدعم نافذة سياق تبلغ 8 آلاف رمز، أي أربعة أضعاف الجيل السابق. blog.google

وتسمح نافذة السياق للنموذج بمعالجة ما يصل إلى نحو 5.5 دقائق من الصوت، أو 29 صورة، أو 58 إطار فيديو، أو مزيج بينها على الجهاز. كما يمكن تقليص متجهات التضمين من 768 بُعدًا إلى 512 أو 256 أو 128 بُعدًا، وهو ما تقول جوجل إنه قد يخفض مساحة التخزين المطلوبة لقواعد البيانات المتجهية والذاكرة بما يصل إلى ستة أضعاف. blog.google

عمليًا، يمكن للمطورين استخدام EmbeddingGemma 2 لإنشاء تطبيق يبحث في الصور أو التسجيلات والفيديوهات باستخدام أوصاف نصية أو صوتية، أو لبناء أنظمة RAG تعمل محليًا. ويعني تنفيذ هذه العمليات على الجهاز إمكانية تقليل زمن الاستجابة وتعزيز الخصوصية، إضافة إلى إتاحة بعض وظائف البحث دون اتصال دائم بالإنترنت.

اسم المصدر: Google / Google DeepMind

المصدر الرسمي: Google — EmbeddingGemma 2: an open, lightweight multimodal embedding model

تعليقات

إرسال تعليق