عصر متاورس

Multimodal AI چیست ؟

بعضی مدل‌های هوش مصنوعی فقط با متن کار می‌کنند، اما Multimodal AI یا هوش مصنوعی چندوجهی می‌تواند بیش از یک نوع داده مانند متن، تصویر، صدا یا ویدئو را دریافت یا تولید کند.

مثلاً ممکن است یک عکس از نمودار برای مدل بفرستید و درباره آن سؤال کنید، یا فایل صوتی بدهید و متن آن را بگیرید. در یک سیستم چندوجهی، مدل یا مجموعه مدل‌ها می‌توانند بین چند نوع اطلاعات ارتباط برقرار کنند.

کلمه «Modal» در اینجا به نوع یا شکل داده اشاره دارد. متن یک modality است، تصویر نوعی دیگر و صدا هم نوع دیگری. وقتی سیستم چند مورد از این‌ها را کنار هم استفاده می‌کند، اصطلاح Multimodal رایج می‌شود.

این قابلیت برای دستیارهای هوشمند، تحلیل اسناد تصویری، ترجمه صوتی، تولید تصویر و تجربه‌های تعاملی اهمیت زیادی دارد. در آینده متاورس و رابط‌های واقعیت ترکیبی هم ترکیب صدا، تصویر، محیط و حرکت می‌تواند نقش مهمی داشته باشد.

با این حال چندوجهی‌بودن به معنی بی‌خطابودن نیست. مدل ممکن است متن کوچک داخل تصویر را اشتباه بخواند، جزئیات صوت را از دست بدهد یا از یک تصویر برداشت نادرست داشته باشد. هر نوع ورودی محدودیت‌های خودش را دارد.

کلمات مرتبط




کلمات مرتبط

MACD (مکدی / میانگین متحرک همگرایی واگرایی)
Machine Learning (یادگیری ماشین)
Mainnet (شبکه اصلی)
Maker (میکر)