مدل زبانی نوین اپل تولید متن سریع ۱۲۸ برابرتکنولوژی 

مدل زبانی نوین اپل: تولید متن‌های طولانی با سرعت ۱۲۸ برابر مدل‌های سنتی

اپل مدل زبانی پیشرفته‌ای را معرفی کرده که با بهره‌گیری از معماری نوین، قادر است متون طولانی و پیچیده را با سرعت شگفت‌انگیز و دقت بالا تولید نماید. بر اساس گزارش‌های منتشره، تیم پژوهش اپل مدل مبتنی بر دیفューژن (Diffusion) را عرضه کرده که می‌تواند متن را تا ۱۲۸ برابر سریع‌تر از مدل‌های هم‌ساز تولید کند.

تفاوت معماری خودواکنشی و دیفьюژن در تولید متن

مدل‌های زبانی بزرگ نظیر چت‌جی‌پی‌تی از نوع خودواکنشی (Autoregressive) هستند؛ این مدل‌ها متن را به صورت توکن‌به‌توکن و ترتیبی می‌سازند و هر توکن را با در نظر گرفتن ورودی کاربر و تمام توکن‌های قبلی تولید می‌کنند.

در مقابل، مدل‌های دیفьюژن چندین توکن را به طور همزمان شکل می‌دهند و در چندین مرحله اصلاح، پاسخ نهایی را به دست می‌آورند. یکی از پیشرفته‌ترین گونه‌های این رویکرد، فلو‌مچینگ (Flow-matching) است که مراحل اصلاح چندگانه را حذف کرده و تلاش می‌کند نتیجه نهایی را در یک مرحله واحد محاسبه نماید.

مدل زبانی نوین اپل: تولید متن‌های طولانی با سرعت ۱۲۸ برابر مدل‌های سنتی 3

مقاله اخیر اپل با عنوان «FS-DFM: تولید متن طولانی سریع و دقیق با مدل‌های زبان دیفьюژن چندمرحله‌ای»، مدل نوینی تحت عنوان Few-Step Discrete Flow-Matching (FS-DFM) را معرفی می‌کند. این مدل می‌تواند متون طولانی را تنها با هشت مرحله اصلاح با سرعت بسیار بالا تولید کند، در حالی که مدل‌های دیفьюژن معمولی بیش از هزار مرحله را برای رسیدن به کیفیت مشابه ضرورت داشتند.

برای دستیابی به این کارایی، محققان از سه استراتژی اصلی بهره برده‌اند: ابتدا مدل را طوری آموزش داده‌اند که چندین مرحله اصلاح متن را مدیریت نماید، سپس یک مدل «معلم» برای انجام به‌روزرسانی‌های دقیق‌تر و گسترده‌تر در هر مرحله به کار گرفته‌اند، و در نهایت نحوه اجرای هر مرحله را بهینه کرده‌اند تا مدل بتواند با طی مراحل کمتر و آرامش بیشتر به نتیجه برسد.

معرفی مدل زبان سریع اپل

در مقایسه با مدل‌های بزرگ هم‌ساز، FS-DFM در معیارهای «آنتروپی» و «سردرگمی» عملکرد قابل توجهی داشته است. معیار سردرگمی (Perplexity) کیفیت متن را سنجیده می‌کند؛ هرچه مقدار آن پایین‌تر باشد، متن طبیعی‌تر و دقیق‌تر است. آنتروپی میزان اطمینان مدل در انتخاب هر واژه را نشان می‌دهد؛ مقدار پایین متن را تکراری یا قابل پیش‌بینی می‌سازد و مقدار زیاد منجر به متن نامنسجم یا تصادفی می‌شود.

مدل FS-DFM با پارامترهای ۱.۷، ۱.۳ و ۰.۱۷ میلیارد، در مقایسه با مدل‌های Dream و LLaDA با ۷ و ۸ میلیارد پارامتر، در معیار سردرگمی عددی پایین‌تر و در آنتروپی نتیجه‌ای پایدارتر به دست آورده است.

با توجه به عملکرد برجسته و افضلیت بر مدل‌های هم‌ساز، محققان اعلام کرده‌اند که قصد دارند کد و چک‌پوینت‌های مدل را منتشر سازند تا امکان بازتولید و پژوهش‌های گسترده‌تر فراهم آید. مطالعه کامل مقاله در arXiv شامل مثال‌های عملیاتی و نمودارهایی است که مراحل اصلاح هر توکن و نحوه تغییرات آن را تشریح می‌کند.

پست های مرتبط