Transformer چیست ؟
بخش بزرگی از مدلهای زبانی مدرن بر معماریای به نام Transformer ساخته شدهاند. Transformer نوعی معماری شبکه عصبی است که برای کار با دنبالههایی مثل متن طراحی شده و از مکانیزمی به نام Attention استفاده میکند.
برای فهم خیلی ساده، وقتی یک جمله را میخوانیم همه کلمات اهمیت یکسانی برای فهم کلمه بعدی ندارند. Attention به مدل کمک میکند هنگام پردازش، ارتباط میان بخشهای مختلف ورودی را وزندهی کند و روی قسمتهای مرتبطتر تمرکز بیشتری داشته باشد.
مقاله معروف «Attention Is All You Need» در سال ۲۰۱۷ معماری Transformer را معرفی کرد. این معماری بعداً پایه بسیاری از مدلهای زبانی بزرگ و سیستمهای مولد شد.
Transformer یک مدل خاص مثل ChatGPT نیست؛ یک معماری است. میتوان مدلهای مختلفی با اندازه، داده آموزشی و هدفهای متفاوت بر اساس ایدههای Transformer ساخت.
همچنین لازم نیست کاربر عادی برای استفاده از AI جزئیات ریاضی Attention را بداند. نکته اصلی این است که Transformer یکی از فناوریهای مهمی است که امکان پردازش ارتباط میان بخشهای متن و آموزش مدلهای بسیار بزرگ را فراهم کرده است.
