مدل زبانی جدید اپل با استفاده از معماری پیشرفته، قادر است متون طویل و پیچیده را با سرعتی بسیار بالا و دقت قابل توجهی تولید کند. این مدل که بر پایه تکنولوژی Diffusion طراحی شده است، میتواند متونها را تا 128 برابر سریعتر از مدلهای مشابه تولید کند.
سرعت بسیار زیاد مدل زبانی جدید اپل
برخلاف مدلهای زبانی بزرگی مانند ChatGPT که از نوع Autoregressive هستند و متن را به صورت توکن به توکن تولید میکنند، مدلهای Diffusion چندین توکن را همزمان تولید کرده و در چند مرحله اصلاح میکنند تا به نتیجه نهایی برسند. مدل Flow-matching که یکی از انواع پیشرفته مدلهای Diffusion است، فرآیند اصلاح چندگانه را حذف کرده و سعی دارد نتیجه نهایی را در یک مرحله به دست آورد.
مطالعه جدید اپل با عنوان «FS-DFM: Fast and Accurate Long Text Generation with Few-Step Diffusion Language Models» یک مدل جدید به نام Few-Step Discrete Flow-Matching (FS-DFM) معرفی میکند. این مدل قادر است متون طویل را تنها با هشت مرحله اصلاح و با سرعتی بسیار بالا تولید کند، در حالی که مدلهای Diffusion معمولی بیش از هزار مرحله نیاز دارند تا به کیفیت مشابهی دست یابند.
پیشنهاد مطالعه: دولت آلمان 741 میلیون دلار از بیتکوینهای خود را فروخت_دیدانگار
برای دستیابی به این سرعت، محققان از سه مرحله استفاده کردهاند: ابتدا، مدل آموزش میبیند که چندین مرحله اصلاح متن را مدیریت کند، سپس یک مدل «معلم» برای انجام بهروزرسانیهای دقیق و بزرگتر در هر مرحله به کار گرفته میشود و در نهایت، نحوه اجرای هر مرحله بهینه میشود تا مدل بتواند با طی مراحل کمتر و آرامش بیشتر به نتیجه برسد.
در مقایسه با مدلهای بزرگ مشابه، FS-DFM در معیارهای «آنتروپی» و «سردرگمی» عملکرد قابل توجهی داشته است. سردرگمی کیفیت متن را اندازه میگیرد؛ هر چه پایینتر باشد، متن طبیعیتر و دقیقتر است. آنتروپی نیز میزان اطمینان مدل در انتخاب هر کلمه را مشخص میکند؛ مقدار پایینتر به این معنی است که متن تکراری یا قابل پیشبینی است و مقدار بیشتر نشان میدهد که متن نامنسجم یا تصادفی است.
پیشنهاد مطالعه: هواوی رسماً اعلام کرد؛ 100 میلیون دستگاه از HarmonyOS 4 استفاده میکنند
مدل FS-DFM با پارامترهای 1.7، 1.3 و 0.17 میلیارد، در مقایسه با مدلهای Dream و LLaDA با 7 و 8 میلیارد پارامتر، در معیار سردرگمی عددی پایینتر و در آنتروپی نتیجهای پایدارتر به دست آورده است.
با توجه به عملکرد عالی و افت مدلهای مشابه، محققان اظهار کردهاند که قصد دارند کد و چکپوینتهای مدل را منتشر کنند تا امکان بازتولید و تحقیقات بیشتر فراهم شود. مطالعه کامل مقاله در arXiv شامل مثالهای عملکردی و نمودارهایی است که مراحل اصلاح هر توکن و نحوه تغییرات آن را مشخص میکند.


