مدل زبانی نوین اپل: تولید متنهای طولانی با سرعت ۱۲۸ برابر مدلهای سنتی
اپل مدل زبانی پیشرفتهای را معرفی کرده که با بهرهگیری از معماری نوین، قادر است متون طولانی و پیچیده را با سرعت شگفتانگیز و دقت بالا تولید نماید. بر اساس گزارشهای منتشره، تیم پژوهش اپل مدل مبتنی بر دیفューژن (Diffusion) را عرضه کرده که میتواند متن را تا ۱۲۸ برابر سریعتر از مدلهای همساز تولید کند.
تفاوت معماری خودواکنشی و دیفьюژن در تولید متن
مدلهای زبانی بزرگ نظیر چتجیپیتی از نوع خودواکنشی (Autoregressive) هستند؛ این مدلها متن را به صورت توکنبهتوکن و ترتیبی میسازند و هر توکن را با در نظر گرفتن ورودی کاربر و تمام توکنهای قبلی تولید میکنند.
🔗 بیشتر بخوانید: عکس ترکیبی تلسکوپ هابل با رصدخانه پارانال_دانستنی
در مقابل، مدلهای دیفьюژن چندین توکن را به طور همزمان شکل میدهند و در چندین مرحله اصلاح، پاسخ نهایی را به دست میآورند. یکی از پیشرفتهترین گونههای این رویکرد، فلومچینگ (Flow-matching) است که مراحل اصلاح چندگانه را حذف کرده و تلاش میکند نتیجه نهایی را در یک مرحله واحد محاسبه نماید.
مقاله اخیر اپل با عنوان «FS-DFM: تولید متن طولانی سریع و دقیق با مدلهای زبان دیفьюژن چندمرحلهای»، مدل نوینی تحت عنوان Few-Step Discrete Flow-Matching (FS-DFM) را معرفی میکند. این مدل میتواند متون طولانی را تنها با هشت مرحله اصلاح با سرعت بسیار بالا تولید کند، در حالی که مدلهای دیفьюژن معمولی بیش از هزار مرحله را برای رسیدن به کیفیت مشابه ضرورت داشتند.
🔗 بیشتر بخوانید: احتمالا باید بین کاربر و هوش مصنوعی حق رازداری وجود داشته باشد_دانستنی
برای دستیابی به این کارایی، محققان از سه استراتژی اصلی بهره بردهاند: ابتدا مدل را طوری آموزش دادهاند که چندین مرحله اصلاح متن را مدیریت نماید، سپس یک مدل «معلم» برای انجام بهروزرسانیهای دقیقتر و گستردهتر در هر مرحله به کار گرفتهاند، و در نهایت نحوه اجرای هر مرحله را بهینه کردهاند تا مدل بتواند با طی مراحل کمتر و آرامش بیشتر به نتیجه برسد.

در مقایسه با مدلهای بزرگ همساز، FS-DFM در معیارهای «آنتروپی» و «سردرگمی» عملکرد قابل توجهی داشته است. معیار سردرگمی (Perplexity) کیفیت متن را سنجیده میکند؛ هرچه مقدار آن پایینتر باشد، متن طبیعیتر و دقیقتر است. آنتروپی میزان اطمینان مدل در انتخاب هر واژه را نشان میدهد؛ مقدار پایین متن را تکراری یا قابل پیشبینی میسازد و مقدار زیاد منجر به متن نامنسجم یا تصادفی میشود.
مدل FS-DFM با پارامترهای ۱.۷، ۱.۳ و ۰.۱۷ میلیارد، در مقایسه با مدلهای Dream و LLaDA با ۷ و ۸ میلیارد پارامتر، در معیار سردرگمی عددی پایینتر و در آنتروپی نتیجهای پایدارتر به دست آورده است.
با توجه به عملکرد برجسته و افضلیت بر مدلهای همساز، محققان اعلام کردهاند که قصد دارند کد و چکپوینتهای مدل را منتشر سازند تا امکان بازتولید و پژوهشهای گستردهتر فراهم آید. مطالعه کامل مقاله در arXiv شامل مثالهای عملیاتی و نمودارهایی است که مراحل اصلاح هر توکن و نحوه تغییرات آن را تشریح میکند.
