Multimodal AI چیست ؟
بعضی مدلهای هوش مصنوعی فقط با متن کار میکنند، اما Multimodal AI یا هوش مصنوعی چندوجهی میتواند بیش از یک نوع داده مانند متن، تصویر، صدا یا ویدئو را دریافت یا تولید کند.
مثلاً ممکن است یک عکس از نمودار برای مدل بفرستید و درباره آن سؤال کنید، یا فایل صوتی بدهید و متن آن را بگیرید. در یک سیستم چندوجهی، مدل یا مجموعه مدلها میتوانند بین چند نوع اطلاعات ارتباط برقرار کنند.
کلمه «Modal» در اینجا به نوع یا شکل داده اشاره دارد. متن یک modality است، تصویر نوعی دیگر و صدا هم نوع دیگری. وقتی سیستم چند مورد از اینها را کنار هم استفاده میکند، اصطلاح Multimodal رایج میشود.
این قابلیت برای دستیارهای هوشمند، تحلیل اسناد تصویری، ترجمه صوتی، تولید تصویر و تجربههای تعاملی اهمیت زیادی دارد. در آینده متاورس و رابطهای واقعیت ترکیبی هم ترکیب صدا، تصویر، محیط و حرکت میتواند نقش مهمی داشته باشد.
با این حال چندوجهیبودن به معنی بیخطابودن نیست. مدل ممکن است متن کوچک داخل تصویر را اشتباه بخواند، جزئیات صوت را از دست بدهد یا از یک تصویر برداشت نادرست داشته باشد. هر نوع ورودی محدودیتهای خودش را دارد.
