الرئيسية/الحلول/الذكاء الاصطناعي متعدد الوسائط
بيانات للذكاء الاصطناعي متعدد الوسائط
نص وصورة وفيديو مجتمعة — توصيف، محاذاة بين الوسائط، ووصف مبني على السياق لنماذج الجيل القادم متعددة الوسائط.
تضاعف المهام متعددة الوسائط الفجوة الإقليمية: نموذج التوصيف يحتاج أن تكون الصورة أصيلة إقليميًا وأن يكون التوصيف مكتوبًا بعربية أو لهجة طبيعية، لا ترجمة لاحقة. ننفذ هذه المشاريع كوحدة واحدة مع مجموعة مساهمين مسؤولة عن السياق البصري واللغة معًا، بحيث يتّسق العنصران.
ما يشمله هذا الحل
- توصيف الصور والفيديو بالعربية واللهجات الإقليمية
- بيانات محاذاة بين الوسائط (أزواج نص-صورة، نص-فيديو)
- الإجابة على أسئلة بصرية مبنية على السياق الإقليمي