الذكاء الاصطناعي متعدد الوسائط هو نظام يتعامل مع أكثر من نوع واحد من المعلومات، مثل النصوص والصور والصوت والفيديو. وقد يستقبل نوعًا من البيانات ويُنتج نوعًا آخر؛ فمثلًا يمكنه وصف صورة بكلمات.

ماذا تعني كلمة «وسائط»؟

الوسيط هو شكل المعلومات التي يتعامل معها النظام. النص وسيط، والصورة وسيط آخر، وكذلك الصوت والفيديو. لا يعني «متعدد الوسائط» أن كل نموذج يدعم جميع هذه الأنواع؛ ينبغي التحقق من الأنواع التي يقبلها ويُخرجها كل نموذج بعينه.

كيف يعمل؟

تُحوَّل المدخلات إلى تمثيلات يستطيع النظام معالجتها، ثم يربط ما بينها للإجابة أو إنشاء محتوى. تختلف البنية التقنية من نموذج إلى آخر؛ فقد تُدمج أنواع البيانات داخل نموذج واحد أو ضمن نظام ينسق عدة مكونات.

مثال بسيط

ترسل صورة لرسم بياني وتسأل: «ما الاتجاه العام؟». إذا كان النموذج يقبل الصور والنصوص، يمكنه فحص الرسم والإجابة نصيًا. ومثال آخر: محادثة صوتية يفسّر فيها النظام الكلام ويجيب بصوت. توفر هذه الإمكانات يعتمد على المنتج والإصدار.

هل هو نفسه الذكاء الاصطناعي التوليدي؟

لا. «متعدد الوسائط» يصف أنواع البيانات التي يستطيع النظام التعامل معها، بينما «توليدي» يصف قدرته على إنشاء محتوى جديد. قد يجمع النظام بين الصفتين.

ما حدوده؟

قد يسيء قراءة صورة أو تجاهل جزء من صوت، وقد يقدم تفسيرًا واثقًا لكنه خاطئ. كما أن رفع الصور والملفات يثير اعتبارات خصوصية وحقوق استخدام؛ راجع سياسة الخدمة وتحقق من النتائج المهمة بنفسك.

الخلاصة

الفكرة هي الجمع بين النص والصورة والصوت أو غيرها داخل مهمة واحدة. المهم عمليًا هو معرفة المدخلات والمخرجات التي يدعمها النظام فعلًا، لا الاكتفاء بوصفه «متعدد الوسائط».

المصادر: Google Cloud: Multimodal AI وGoogle AI: Image understanding.