پیشرفتهای جدید در یادگیری ماشین: از مقیاسپذیری تا استدلال
پیشرفتهای جدید در یادگیری ماشین چطور پارادایمهای بنیادین را جابهجا کردهاند؟ کالبدشکافی فنی از Transformer و SSM تا MoE، RLHF و استدلال در زمان استنتاج — در سطح مهندسی تولید سیستمهای مقیاسپذیر.
سه سال پیش، اگر میخواستیم یک مدل زبانی بزرگ را روی یک کاربرد صنعتی مستقر کنیم، با دو محدودیت بنیادین مواجه بودیم: هزینهٔ محاسباتی استنتاج، و ناتوانی مدل در استدلال چندمرحلهای قابلاتکا. امروز، هر دو محدودیت در حال فروپاشی است — نه بهدلیل یک جهش علمی ناگهانی، بلکه بهدلیل همگرایی چندین خط تحقیقاتی موازی: معماریهای کارآمد، یادگیری با بازخورد انسان، استدلال در زمان استنتاج، و پارامترهای فشرده. این مقاله، تلاش میکند این تحول را در سطح مهندسی بررسی کند — از طریق کالبدشکافی معماریها، بررسی معادلات و کارایی، و بحث دربارهٔ مرزهای فعلی دانش. هدف، نه مرور سطحی مقالات پرطرفدار، بلکه تحلیل عمیق مسائلی است که در تیمهای تحقیقاتی بزرگ (Google DeepMind, Meta FAIR, OpenAI, Anthropic) بهطور جدی روی آنها کار میشود.
نقطهٔ شروع: چرا سالهای اخیر، متفاوتاند؟
پیشرفتهای یادگیری ماشین (Machine Learning) در پنج سال گذشته، نه خطی، بلکه بهشکل پیوسته و انباشتی رخ داده. اگر بخواهم یک تصویر دقیق از این تغییر ارائه دهم، سه محور اصلی آن را میبینم:
محور اول: معماری. از Transformer استاندارد به سمت معماریهای کارآمدتر، ترکیبی، و تخصصی. این تحول، همزمان در سه جبهه اتفاق میافتد: کاهش مرتبهٔ محاسباتی Attention از O(n²) به چیزی نزدیک به O(n)، معرفی State Space Models بهعنوان جایگزین یا مکمل، و استفاده از Sparsity در قالب Mixture of Experts (MoE).
محور دوم: پارادایم آموزش. از «پیشآموزش خالص، سپس Fine-Tune سرتاسری» به سمت زنجیرهای چندمرحلهای: Self-Supervised Pretraining، Supervised Fine-Tuning، RLHF، DPO، RLAIF، و سرانجام، استدلال در زمان استنتاج. هر لایه از این زنجیره، قابلیتهای جدیدی به مدل اضافه میکند.
محور سوم: فشردهسازی و استقرار. از مدلهای بزرگتر به سمت مدلهایی که «هوش کمحجم» را تولید میکنند: Parameter-Efficient Fine-Tuning، Quantization پس از آموزش، Distillation، Speculative Decoding، و اخیراً، مدلهای استدلالی که با استنتاج طولانیتر، دقت بالاتری میسازند.
تجربهٔ من در پروژههای تولیدی این حوزه، یک نکتهٔ بنیادین را نشان میدهد: تیمهایی که این سه محور را بهطور همزمان دنبال میکنند، از تیمهایی که فقط روی یکی تمرکز دارند، فاصلهٔ قابل توجهی میگیرند. مثلاً استفاده از MoE بدون درک چالشهای Routing، بهسرعت به فروپاشی Expert میانجامد. استفاده از RLHF بدون Process Reward Model مناسب، مدل را به سمت پاسخهای ظاهراً درست اما نادرست هدایت میکند.
پیش از ورود به بحث فنی، لازم است بگویم که این مقاله، فرض میکند خواننده با مبانی یادگیری ماشین آشناست. اگر تازه در این حوزه هستید، توصیه میکنم پیش از ادامه، مراجع یادگیری ماشین چیست و چگونه کار میکند و یادگیری عمیق چه تفاوتی با یادگیری ماشین دارد را بخوانید. همچنین برای درک تصویر کلی این خانواده از مدلها، مرور هوش مصنوعی مولد چیست و چگونه کار میکند پیشزمینهٔ خوبی میسازد.
پیشرفتهای جدید یادگیری ماشین، نه در یک جهت، بلکه در همگرایی سه محور اتفاق میافتند: معماری، پارادایم آموزش، و فشردهسازی. تیمهایی که یکی را نادیده میگیرند، در یکی از سه جبهه عقب میمانند.
فصل اول: انقلاب معماری — از Attention تا SSM
معماری Transformer، از سال ۲۰۱۷ تا امروز، ستون فقرات مدلهای یادگیری ماشین بوده. اما این معماری، یک ضعف ساختاری بنیادین دارد: مکانیزم Self-Attention از نظر مرتبهٔ محاسباتی، O(n²) است که در آن n طول دنباله است. این یعنی با دو برابر شدن طول متن، هزینهٔ محاسبات چهار برابر میشود. در طول چهار سال گذشته، سه خانوادهٔ معماری برای حل این مسئله توسعه یافته: Attention کارآمد، State Space Models، و Sparse Architectures.
تکامل Attention: از نرخ مربعی تا زیرمرتبهٔ خطی
یکی از نقاط کانونی تحقیقات در سالهای اخیر، کاهش هزینهٔ مکانیزم Attention بوده. مسیر این تکامل را میتوان در چند نقطهٔ عطف دید:
Flash Attention
در سال ۲۰۲۲، تری دائو و همکارانش در استنفورد، تکنیکی معرفی کردند بهنام Flash Attention که مسئله را از منظر «محاسبهٔ عددی بهینه» حل میکرد. ایدهٔ اصلی: بهجای محاسبهٔ کل ماتریس Attention در حافظهٔ GPU و سپس Softmax، محاسبه به بلوکهای کوچک تقسیم میشود و در حافظهٔ SRAM (که به پردازنده بسیار نزدیکتر است) انجام میشود. نتیجه: مصرف حافظه از O(n²) به O(n) کاهش مییابد و سرعت ۲ تا ۴ برابر افزایش پیدا میکند. Flash Attention 2 و Flash Attention 3، نسخههای بهمراتب بهینهتر این تکنیک هستند.
نکتهٔ کلیدی که کمتر گفته میشود: Flash Attention، پیچیدگی الگوریتمی را تغییر نمیدهد؛ همان O(n²) میماند. اما با بهینهسازی ساختار داده و ترتیب محاسبه، از حافظهٔ سلسلهمراتبی GPU استفادهٔ بهینه میکند. این یعنی برای طولهای بسیار طولانی (مثلاً بالای ۳۲K توکن)، Flash Attention بهتنهایی کافی نیست.
Multi-Query Attention و Grouped-Query Attention
در سال ۲۰۱۹، Shazeer پیشنهاد Multi-Query Attention را داد: بهجای اینکه هر Head Query، Key و Value مستقل خودش را داشته باشد، همهٔ Head های Query، از یک مجموعهٔ مشترک Key و Value استفاده کنند. این تغییر ساده، مصرف حافظهٔ Key-Value Cache را بهشدت کاهش میدهد — که در استنتاج خودرگرسیو (Autoregressive) بحرانی است. Grouped-Query Attention (GQA) نسخهٔ میانی است که در آن، Head ها به گروههایی تقسیم میشوند و هر گروه Key و Value مشترک دارد. GQA امروز استاندارد اکثر مدلهای بزرگ (Llama 3، Mistral، Gemma) است.
Sliding Window Attention و Longformer
یکی از رویکردهای مقابله با O(n²) این است که هر توکن، فقط به توکنهای نزدیک خودش Attention داشته باشد — با یک پنجرهٔ لغزان (Sliding Window). این ایده در Longformer و BigBird مطرح شد و در Mistral و Gemma به کار رفته. مشکل این رویکرد: از دست رفتن ارتباطهای دوردست. راهحلهای ترکیبی، مثل استفاده از Global Tokens یا لایهبندی (مثلاً یک لایه با پنجرهٔ محلی، لایهٔ بعدی با پنجرهٔ گستردهتر) تا حدی این مشکل را حل میکند.
Linear Attention
خانوادهای از مکانیزمها که با تغییر ترتیب محاسبه و استفاده از تکنیکهای کرنل، Attention را به O(n) کاهش میدهند. Performer، Linear Transformer، و Linformer از این دستهاند. مزیت نظری: مقیاسپذیری خطی برای طولهای بسیار طولانی. عیب عملی: از دست دادن دقت در مقایسه با Attention استاندارد، بهویژه در وظایف استدلالی. در عمل، Linear Attention جای Attention استاندارد را نگرفته، ولی در ترکیب با SSM یا در وظایف خاص، مفید است.
State Space Models: از S4 تا Mamba و Mamba-2
شاید مهمترین نوآوری معماری سالهای اخیر، بازگشت مفهوم State Space از تئوری کنترل به یادگیری عمیق باشد. ایدهٔ State Space Model (SSM) در تئوری سیستمهای خطی ریشه دارد: هر سیستم دینامیک، با یک بردار حالت (State) و معادلات انتقال حالت توصیف میشود.
S4: Stone Soup
در سال ۲۰۲۱، آلبرت گو و همکارانش در استنفورد، معماری S4 را معرفی کردند. S4، یک SSM پیوسته است که با یک تکنیک بهنام «Discretization» به حالت گسسته تبدیل میشود. سه ویژگی کلیدی S4:
- پارامترسازی HiPPO: یک ماتریس انتقال حالت خاص که تئوری آن تضمین میکند سیستم، حافظهٔ طولانیمدت داشته باشد.
- کانولوشن کرنل: S4 میتواند بهصورت یک کانولوشن نمایش داده شود، که اجازه میدهد آموزش بهطور موازی روی طول دنباله انجام شود.
- پیچیدگی O(n log n): با استفاده از FFT، پیچیدگی محاسباتی به زیر-مرتبهٔ مربعی کاهش مییابد.
S4 در وظایف دنبالههای طولانی (مثل audio و genomic) نتایج چشمگیری گرفت. اما دو محدودیت داشت: مکانیزم حالت ثابت بود (نه داده-محور)، و در وظایف زبانی، عملکردی در حد Transformer نداشت.
Mamba: SSM انتخابی
در سال ۲۰۲۳، آلبرت گو و تری دائو مقالهٔ Mamba را منتشر کردند. ایدهٔ اصلی: بهجای اینکه ماتریسهای SSM ثابت باشند، داده-محور (Input-Dependent) باشند. یعنی در هر گام، بر اساس ورودی فعلی، ماتریسهای A, B, C محاسبه میشوند. این رویکرد، به Mamba اجازه میدهد مانند Attention رفتار کند: تصمیم بگیرد چه اطلاعاتی را نگه دارد و چه اطلاعاتی را فراموش کند.
مشکل: با داده-محور شدن، S4 نمیتواند از کانولوشن موازی استفاده کند. راهحل Mamba: استفاده از یک الگوریتم Selective Scan که در GPU بهطور کارآمد موازیسازی میشود. نتیجه: Mamba هم کیفیت Transformer را میگیرد و هم پیچیدگی خطی دارد. روی وظایف زبانی، Mamba عملکردی در حد Transformer نشان داد، ولی با هزینهٔ استنتاج چند برابر کمتر در دنبالههای بلند.
Mamba-2: ارتباط با Attention
در سال ۲۰۲۴، همان تیم مقالهٔ Mamba-2 را منتشر کرد که نشان میداد SSM و Attention، دو روی یک سکهاند. با استفاده از مفهوم «Structured State Space Duality»، میتوان SSM و Attention را بهشکل یکپارچه دید. Mamba-2 با این چارچوب، عملکرد بهتری از Mamba گرفت و امکان آموزش موازی کارآمدتری را فراهم کرد.
نقش Mamba در عمل
تجربهٔ من در پروژههای واقعی: Mamba در وظایف دنبالههای بسیار طولانی (مثلاً پردازش ژنومی، تحلیل audio طولانی) موفق است. اما در وظایف استدلالی پیچیده با طول متن متوسط، تفاوت معناداری با Transformer دیده نمیشود. امروز، اکثر مدلهای تولیدی از معماری ترکیبی استفاده میکنند: بخشی از لایهها Attention، بخشی SSM. این الگو که «Hybrid SSM-Transformer» نامیده میشود، در مدلهایی مثل Jamba و Zamba (از AI21) دیده میشود.
Mixture of Experts: مقیاسپذیری بدون هزینهٔ متناسب
اگر بخواهم یک ایدهٔ معماری را که بیشترین تأثیر را در سالهای اخیر داشته معرفی کنم، آن Mixture of Experts (MoE) است. ایدهٔ اصلی: بهجای یک شبکهٔ Feed-Forward بزرگ که برای همهٔ توکنها فعال میشود، چندین «Expert» کوچک داشته باشیم و در هر گام، فقط تعداد محدودی از آنها فعال شوند.
معماری پایهٔ MoE
در یک لایهٔ MoE کلاسیک:
y = Σ_{i∈Top-K} G(x)_i · E_i(x)
که در آن E_i(x) خروجی Expert i است و G(x)_i وزن اختصاصدادهشده به آن Expert توسط Router است. در Top-K، معمولاً K=۱ یا ۲. یعنی در هر گام، فقط ۱ یا ۲ Expert از بین (مثلاً) ۸ تا ۶۴ Expert فعال میشوند.
مزیت محاسباتی: اگر مدل ۱۰۰ میلیارد پارامتر داشته باشد ولی در هر گام فقط ۱۰ میلیارد فعال باشند، هزینهٔ استنتاج مانند یک مدل ۱۰ میلیاردی است — با کیفیتی نزدیک به مدل ۱۰۰ میلیاردی.
MoE در مقیاس
اولین مدلهای بزرگ MoE (Mixtral 8x7B، Switch Transformer) نشان دادند که این معماری مقیاسپذیر است. DeepSeek-V3 با معماری MoE، با ۶۷۱ میلیارد پارامتر کل و ۳۷ میلیارد پارامتر فعال در هر توکن، به کیفیتی نزدیک به مدلهای Dense بزرگتر رسید. Llama 4 Scout و Maverick نیز از MoE استفاده میکنند.
مسئلهٔ Routing: چالش بنیادین MoE
MoE ظاهراً ساده بهنظر میرسد، ولی چالشهای عمیقی دارد:
چالش اول: فروپاشی Expert
Router تمایل دارد همیشه به تعداد محدودی از Expert ها وزن بدهد. نتیجه: اکثر Expert ها هرگز آموزش نمیبینند و مدل عملاً معادل یک شبکهٔ کوچک میشود. راهحل: استفاده از Load Balancing Loss که به Router فشار میآورد ترافیک را بین Expert ها متعادل کند. اما این Loss، خودش چالشهای جدیدی میسازد — میتواند به نفع توزیع یکنواخت، کیفیت Routing را قربانی کند.
چالش دوم: عدم تعادل محاسباتی
در MoE، بار محاسباتی در هر گام متغیر است. اگر در یک Batch، اکثر توکنها به یک Expert بروند، آن Expert گلوگاه میشود و بقیه بیکار میمانند. راهحلهای موجود: Capacity Factor (تعیین حداکثر توکن برای هر Expert)، Token Dropping (حذف توکنهای اضافی)، و Expert Choice Routing (بهجای اینکه توکن Expert انتخاب کند، Expert توکن انتخاب کند).
چالش سوم: ارتباط بین Expert ها
در سیستمهای توزیعشده، Expert ها روی GPU های مختلفی هستند. Router باید تصمیم بگیرد کدام توکن به کدام GPU برود. این «All-to-All Communication» یکی از بزرگترین گلوگاههای کارایی MoE است. راهحلهای پیشرفته مثل DeepSpeed-MoE و Tutel از تکنیکهای Grouped GEMM و Hierarchical All-to-All استفاده میکنند.
چالش چهارم: Fine-Tuning MoE
Fine-Tuning یک مدل MoE، دشوارتر از Dense است. اگر فقط روی یک دامنه آموزش ببینید، ممکن است Router را به سمت استفادهٔ صرف از یک Expert هدایت کنید و بقیه را بیاستفاده بگذارید. راهحلهای فعلی: Freeze کردن Router، استفاده از LoRA روی Expert های خاص، و آموزش تنها بخشی از Expert ها.
MoE، یک معاملهٔ دقیق است: در ازای مقیاسپذیری بالاتر، پیچیدگی مهندسی چند برابر میشود. تیمهایی که آمادهٔ مدیریت این پیچیدگی نیستند، در MoE شکست میخورند — نه بهدلیل ضعف معماری، بلکه بهدلیل نبود زیرساخت.
معماریهای ترکیبی: Attention + SSM + MoE
معماریهای امروزی، بهندرت «خالص» هستند. اکثر مدلهای پیشرو، ترکیبی از چندین ایدهٔ معماریاند:
- Jamba (AI21): ترکیبی از Transformer + Mamba + MoE. نسبت لایهها ۱ به ۷ (یک Transformer، هفت Mamba) بهعلاوه MoE در بخشهایی از لایهها.
- Zamba: استفاده از یک لایهٔ Attention مشترک در ابتدا، سپس لایههای Mamba در ادامه.
- RecurrentGemma (Google): ترکیبی از Attention محلی و مکانیزمهای بازگشتی.
- StripedHyena: ترکیب Attention و معماریهای کانولوشنی طولانی (مثل Hyena).
الگوی مشترک: استفاده از Attention در لایههای ابتدایی یا لایههای کلیدی (برای کیفیت)، و SSM یا مکانیزمهای کارآمدتر در لایههای میانی (برای کارایی). این طراحی، به تعادل بین کیفیت و کارایی میرسد.
یک نکتهٔ مهندسی: در معماریهای ترکیبی، ترتیب لایهها حیاتی است. تجربهٔ من نشان میدهد اگر Attention در ابتدا باشد و SSM در ادامه، عملکرد بهتری از حالت عکس دارد. دلیل احتمالی: Attention برای کشف روابط اولیه مناسبتر است، ولی SSM برای حفظ اطلاعات در طول دنباله طولانی بهتر عمل میکند.
فصل دوم: قوانین مقیاس و مدلهای بنیادین
قوانین مقیاس (Scaling Laws)، یکی از مفاهیم محوری در این حوزه است. این قوانین، رابطهٔ بین اندازهٔ مدل، حجم داده، و کیفیت خروجی را توصیف میکنند.
Chinchilla و بازتعریف بهینهٔ مقیاس
در سال ۲۰۲۰، Kaplan و همکارانش در OpenAI مقالهای منتشر کردند که نشان میداد در مقیاس ثابت محاسبات، بزرگتر کردن مدل، بهرهوری بیشتری از اضافهکردن داده دارد. این یافته، به ساخت مدلهای بسیار بزرگ با دادههای محدود منجر شد (مثل GPT-3 با ۱۷۵ میلیارد پارامتر و ۳۰۰ میلیارد توکن).
در سال ۲۰۲۲، DeepMind در مقالهٔ Chinchilla این یافته را بازتعریف کرد. آنها نشان دادند که Kaplan در محاسبهٔ نسبت بهینه اشتباه کرده و در واقع، برای مقیاس محاسباتی ثابت، باید اندازهٔ مدل و حجم داده بهطور همزمان افزایش یابند. نسبت بهینه: برای هر پارامتر، حدود ۲۰ توکن داده.
نتیجهٔ عملی این بازتعریف: مدلهای نسل بعد، کوچکتر ولی با دادهٔ بیشتر آموزش دیدند. مثلاً Llama 3 8B، با ۱۵ تریلیون توکن داده آموزش دیده — یعنی حدود ۱۸۰۰ توکن بهازای هر پارامتر، که چند برابر نسبت Chinchilla است. این نشان میدهد در عمل، «Over-Training» روی داده، به مدلهای کارآمدتر منجر میشود، حتی اگر از نظر محاسباتی بهینه نباشد.
در سال ۲۰۲۴، مقالهای از DeepMind این را دقیقتر تحلیل کرد و نشان داد که فرمول بهینه، وابسته به «هدف استنتاج» است. اگر هدف، Minimize کردن هزینهٔ استنتاج باشد، باید داده را در نسبتهای بسیار بالاتری آموزش داد.
تواناییهای ظهوریافته و بحث دربارهٔ وجودشان
یکی از مباحث جذاب این حوزه، مفهوم «تواناییهای ظهوریافته» (Emergent Abilities) است. ایدهٔ اولیه: با افزایش اندازهٔ مدل، تواناییهای کیفی جدیدی ظاهر میشوند که در مدلهای کوچکتر وجود ندارند. مثلاً در مدلهای زیر ۱۰ میلیارد پارامتر، انجام جمع ساده ممکن نیست؛ در مدلهای ۱۰۰ میلیاردی، مدل میتواند ریاضیات پایه انجام دهد.
اما در سال ۲۰۲۳، Schaeffer و همکارانش در مقالهای بحثبرانگیز نشان دادند که این «ظهور»، در بخشهایی، نتیجهٔ انتخاب معیارهای ارزیابی است. اگر بهجای معیارهای باینری (درست/غلط)، از معیارهای پیوسته (مثل Cross-Entropy) استفاده کنیم، بهبود عملکرد پیوسته به نظر میرسد، نه ظهور ناگهانی.
این بحث، هنوز حل نشده. تجربهٔ من میگوید در برخی حوزهها (مثل استدلال چندمرحلهای)، ظهور واقعی وجود دارد. در حوزههای دیگر، صرفاً توهم معیار است.
فصل سوم: پارادایمهای پیشآموزش
پارادایم پیشآموزش، از یک مرحلهٔ ساده به زنجیرهای پیچیده تبدیل شده. مسیر این تحول:
Self-Supervised Learning: پیشرفتهای معاصر
Self-Supervised Learning (SSL)، به رویکردی گفته میشود که در آن مدل، بدون برچسب، از ساختار داده یاد میگیرد. دو خانوادهٔ اصلی:
خانوادهٔ پیشبینی Masked
در این رویکرد، بخشی از ورودی حذف میشود و مدل باید آن را پیشبینی کند. BERT (Masked Language Modeling)، MAE (Masked Autoencoder)، و SpanBERT از این دستهاند. در مدلهای جدید، این رویکرد با تکنیکهای پیشرفتهتر مثل Span Masking و Whole Word Masking ترکیب شده.
خانوادهٔ تقابلی
در این رویکرد، مدل یاد میگیرد نمایشهایی بسازد که نمونههای مرتبط، به هم نزدیک و نمونههای بیربط، دور باشند. SimCLR، MoCo، BYOL، و SimSiam از این دستهاند. خانوادهٔ تقابلی، پایهٔ CLIP است که در بخشهای بعدی به آن میپردازیم.
پیشرفتهای جدید در SSL، بهسمت کاهش وابستگی به Augmentation و افزایش کارایی رفته. مثلاً Self-Distillation with No Labels (DINO) نشان داد میتوان بدون Augmentation سنگین، به نمایشهای معنایی قوی رسید.
RLHF، DPO و نسل جدید Alignment
RLHF (Reinforcement Learning from Human Feedback)، رویکردی است که در آن، یک مدل پاداش (Reward Model) با بازخورد انسانی آموزش میبیند، سپس مدل زبانی با RL روی این پاداش بهینه میشود. این رویکرد، در ChatGPT بهکار رفت و نقطهٔ چرخش این حوزه شد.
چالشهای RLHF در مقیاس:
- هزینهٔ آموزش Reward Model: نیاز به دادههای مقایسهای انسانی، که هم گران است و هم سوگیری دارد.
- Reward Hacking: مدل یاد میگیرد امتیاز Reward Model را بالا ببرد، بدون اینکه واقعاً بهتر شود.
- ناپایداری PPO: آموزش با Proximal Policy Optimization (PPO)، دشوار و پرنوسان است.
در سال ۲۰۲۳، DPO (Direct Preference Optimization) از استنفورد معرفی شد که این چرخه را سادهتر میکند. در DPO، بهجای آموزش Reward Model و RL جداگانه، مدل مستقیماً روی دادههای مقایسهای بهینه میشود. نتیجه: سادگی پیادهسازی، پایداری بیشتر، و هزینهٔ کمتر.
پیشرفتهای بعدی شامل IPO، KTO، ORPO، و SimPO هستند. هر کدام، تغییرات کوچکی در تابع هدف DPO برای حل محدودیتهای خاص آن اعمال میکنند.
Constitutional AI و RLAIF
Constitutional AI (CAI) که توسط Anthropic معرفی شد، رویکردی است که در آن، بهجای تکیهٔ کامل بر بازخورد انسانی، از یک «قانون اساسی» متنی استفاده میشود. مدل، بر اساس این قوانین، پاسخهای خود را نقد و اصلاح میکند. مزیت: کاهش هزینهٔ بازخورد انسانی و امکان تعریف شفاف قواعد اخلاقی.
RLAIF (Reinforcement Learning from AI Feedback)، نسخهٔ بعدی این رویکرد است که در آن، بهجای انسان، یک مدل زبانی دیگر (معمولاً قویتر) بازخورد میدهد. این رویکرد، مقیاسپذیری بالاتری دارد ولی چالشهای جدیدی مثل همسویی مدلها با یکدیگر بههمراه میآورد.
فصل چهارم: استدلال و زمان تست
شاید بزرگترین تغییر پارادایم سال ۲۰۲۴، مفهوم «استدلال در زمان استنتاج» (Test-Time Reasoning) باشد. ایدهٔ اصلی: مدل، بهجای تولید پاسخ مستقیم، چند مرحله استدلال انجام میدهد و از این استدلال اضافی، به پاسخ دقیقتری میرسد.
Chain of Thought و پیامدهای معماری
Chain of Thought (CoT) یا «زنجیرهٔ تفکر»، یک تکنیک ساده است: بهجای پرسیدن مستقیم از مدل، از آن بخواهید مرحلهبهمرحله استدلال کند. مثلاً بهجای «۵ × ۲۳ چند است؟»، بپرسید «۵ × ۲۳ را مرحلهبهمرحله محاسبه کن». در مدلهای بزرگ، این تکنیک میتواند دقت را از ۲۰٪ به ۹۰٪ برساند.
نکتهٔ عمیق: CoT نشان میدهد که مدلهای Transformer، تواناییهای نهفته دارند که با استنتاج ساده آشکار نمیشوند. یعنی «هوش» مدل، بیش از آنکه در یک پاسخ واحد باشد، در ظرفیت انجام استدلال چندمرحلهای است. این یافته، به توسعهٔ Self-Consistency (نمونهگیری چندگانه و رأیگیری)، Tree of Thoughts (کاوش درخت استدلال)، و Graph of Thoughts (کاوش گراف) منجر شد.
Test-Time Compute: پارادایم جدید
در سال ۲۰۲۴، OpenAI با مدل o1 نشان داد که میتوان با افزایش محاسبه در زمان استنتاج (Test-Time Compute)، کیفیت مدل را بهطور معنادار افزایش داد. این یعنی بهجای صرف بودجهٔ محاسباتی بیشتر روی آموزش (که به دیوار مقیاس برخورده)، همان مدل را با استدلال بیشتر در زمان اجرا قویتر کنیم.
تکنیکهای کلیدی:
- Best-of-N: N پاسخ تولید میکنیم و بهترین را با Reward Model انتخاب میکنیم.
- Beam Search در فضای استدلال: بهجای انتخاب یک مسیر، چند مسیر موازی را کاوش میکنیم.
- Self-Refinement: مدل، پاسخ اول را نقد و اصلاح میکند.
- Long-form Reasoning: مدل، با تولید توکنهای بسیار زیاد (دهها هزار)، به پاسخ میرسد.
این پارادایم، بحثهای عمیقی دربارهٔ مقیاسپذیری و کارایی ایجاد کرده. اگر کیفیت، تابعی از Test-Time Compute باشد، ممکن است مدلهای کوچکتر با استنتاج طولانی، از مدلهای بزرگتر با استنتاج کوتاه بهتر عمل کنند. این پدیده، توسط DeepMind در مقالهٔ «Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters» تحلیل شده.
Process Reward Models
Process Reward Model (PRM)، یک Reward Model است که بهجای ارزیابی کل پاسخ، هر گام از استدلال را ارزیابی میکند. مزیت: در استدلال چندمرحلهای، اگر مدل در گام پنجم اشتباه کند، PRM این را تشخیص میدهد — در حالی که Outcome Reward Model فقط نتیجهٔ نهایی را میبیند.
آموزش PRM، نیاز به دادههای برچسبدار در سطح گام دارد. این دادهها معمولاً بهطور دستی یا با رویکردهای نیمهخودکار ساخته میشوند. OpenAI در آموزش مدل o1 از PRM بهطور گسترده استفاده کرده.
درخت جستوجوی مونتکارلو در LLM
Monte Carlo Tree Search (MCTS)، الگوریتمی است که در AlphaGo استفاده شد. در LLM، ایده این است که درخت استدلال را بهطور نمونهگیریشده کاوش کنیم و مسیرهای امیدبخشتر را بیشتر بررسی کنیم. این رویکرد، بهویژه در وظایف ریاضی و برنامهنویسی نتایج خوبی داده.
چالش اصلی: هزینهٔ محاسباتی. MCTS نیاز به ارزیابی هزاران مسیر دارد. راهحلهای فعلی، استفاده از مدلهای Value کوچک برای هرس درخت و محدودسازی عمق کاوش است.
فصل پنجم: تطبیق کارآمد پارامترها
Parameter-Efficient Fine-Tuning (PEFT)، خانوادهای از تکنیکها است که هدفشان تطبیق مدلهای بزرگ با وظایف جدید بدون آموزش همهٔ پارامترها است.
LoRA، QLoRA و کارایی حافظه
LoRA (Low-Rank Adaptation)، که در سال ۲۰۲۱ توسط Hu و همکارانش در Microsoft معرفی شد، انقلابی در Fine-Tuning ایجاد کرد. ایده: بهجای بهروزرسانی همهٔ وزنهای W، یک ماتریس بهروزرسانی با رتبهٔ پایین اضافه کنیم:
W' = W + BA
که در آن B و A ماتریسهایی با ابعاد بسیار کوچکتر از W هستند. اگر W ابعاد (d, k) داشته باشد، B با ابعاد (d, r) و A با ابعاد (r, k) که r << min(d, k). مزیت: تعداد پارامترهای قابلآموزش از d×k به (d+k)×r کاهش مییابد — که معمولاً یک تا دو مرتبهٔ بزرگی کمتر است.
QLoRA (Quantized LoRA)، توسعهٔ LoRA است که در آن، مدل پایه به ۴ بیت کوانتیزه میشود و فقط آداپتورهای LoRA در دقت بالا آموزش میبینند. این تکنیک، Fine-Tuning مدل ۷۰ میلیاردی را روی یک GPU با ۴۸ گیگابایت حافظه ممکن میکند.
Model Merging: TIES، DARE، Model Soup
Model Merging، یک تکنیک نسبتاً جدید است که در آن، چند مدل Fine-Tuned را با هم ترکیب میکنیم تا یک مدل ترکیبی با تواناییهای متنوع بسازیم — بدون آموزش اضافی.
Model Soup
سادهترین رویکرد: میانگینگیری از وزنهای چند مدل Fine-Tuned. جالب اینکه این کار، معمولاً عملکرد بهتری از هر مدل تک میدهد.
TIES (Trim, Elect, Sign)
رویکرد پیشرفتهتر که سه مرحله دارد: Trim (حذف وزنهای کماهمیت)، Elect (انتخاب علامت وزن)، و Sign (ادغام با علامت انتخابی). TIES در رفع تعارض بین مدلها مؤثر است.
DARE (Drop And REscale)
رویکردی که بخش بزرگی از دلتاهای وزن را حذف میکند و بقیه را مجدداً مقیاسبندی میکند. نتایج نشان میدهد که میتوان ۹۰٪ از دلتاها را حذف کرد و همچنان عملکرد خوبی داشت.
Model Merging، بهویژه برای تیمهایی که میخواهند تواناییهای مختلف را در یک مدل جمع کنند، بسیار مفید است. در تجربهٔ من، این تکنیک در پروژههایی که چند کاربرد تخصصی داشتند، تا ۷۰٪ کاهش در هزینهٔ آموزش بهدنبال داشت.
فصل ششم: مدلهای چندوجهی
مدلهای چندوجهی (Multimodal Models)، مدلهایی هستند که میتوانند چند نوع داده (متن، تصویر، صدا، ویدئو) را همزمان پردازش کنند.
CLIP و یادگیری تقابلی چندوجهی
CLIP (Contrastive Language-Image Pre-training)، که در سال ۲۰۲۱ توسط OpenAI معرفی شد، نقطهٔ چرخش این حوزه بود. ایدهٔ اصلی: آموزش همزمان یک Text Encoder و یک Image Encoder، بهطوریکه نمایش متن و تصویر مربوطه در فضای نهفته نزدیک باشند. CLIP روی ۴۰۰ میلیون جفت متن-تصویر آموزش دید و قابلیت انتقال (Transfer Learning) قابل توجهی در وظایف بینایی نشان داد.
معماری CLIP، پایهٔ اکثر مدلهای چندوجهی مدرن است. تفاوتهای اصلی در Text Encoder (که معمولاً Transformer است)، Image Encoder (که میتواند CNN یا ViT باشد)، و روشهای تقابل (Contrastive) است.
معماریهای Vision-Language مدرن
سه خانوادهٔ اصلی در معماریهای Vision-Language Model (VLM):
- خانوادهٔ Cross-Attention: مشابه Flamingo، که از مکانیزم Cross-Attention برای اتصال بخش بینایی و بخش زبانی استفاده میکند.
- خانوادهٔ Projection-based: مشابه LLaVA، که یک Projection Layer ساده (مثلاً MLP) بین بخش بینایی و بخش زبانی قرار میدهد.
- خانوادهٔ Unified: مشابه Gemini و GPT-4V، که همهٔ مودالیتیها را از ابتدا در یک معماری یکپارچه میآموزد.
تفاوتهای عملی این خانوادهها در آموزش، کارایی، و کیفیت انتقال است. LLaVA-style، سادهتر و سریعتر آموزش میبیند، ولی در وظایف پیچیده ممکن است از Unified ضعیفتر باشد.
مدلهای چندوجهی یکپارچه
مدلهای Unified Multimodal، مانند Gemini 2.5 و GPT-4o، از ابتدا برای پردازش چند مودالیتی طراحی شدهاند. این معماریها معمولاً از یک رمزگذار مشترک استفاده میکنند که همهٔ انواع داده را به یک فضای نهفته مشترک تبدیل میکند.
مزیت: قابلیت پردازش cross-modal بهتر. مثلاً مدل میتواند از تصویر به کد، از کد به تصویر، یا از متن به ویدئو برود. عیب: پیچیدگی آموزش و نیاز به دادهٔ عظیم.
فصل هفتم: Retrieval-Augmented Generation
Retrieval-Augmented Generation (RAG)، رویکردی است که در آن، مدل زبانی قبل از تولید پاسخ، اطلاعات مربوطه را از یک پایگاه داده بیرونی بازیابی میکند. این رویکرد، دو مشکل بنیادین LLM را حل میکند: توهمزایی (Hallucination) و فقدان دانش تازه.
Retrieval نهفته و معماریهای برداری
مدرنترین روشهای RAG، از Retrieval نهفته (Dense Retrieval) استفاده میکنند: متنها و پرسشها به بردارهای نهفته تبدیل میشوند و شباهت آنها با Cosine Similarity محاسبه میشود. مدلهایی مثل DPR (Dense Passage Retrieval) و E5 (from Microsoft) در این حوزه پیشرو هستند.
تکنیکهای کلیدی در Dense Retrieval:
- Hard Negative Mining: انتخاب نمونههای منفی که از نظر معنایی نزدیک به پرسش هستند ولی پاسخ صحیح نیستند.
- In-batch Negatives: استفاده از نمونههای دیگر در همان Batch بهعنوان نمونههای منفی.
- Cross-Encoder Re-ranking: پس از بازیابی اولیه با Bi-Encoder، از Cross-Encoder برای رتبهبندی دقیقتر استفاده میشود.
GraphRAG و ساختاردهی دانش
GraphRAG، توسعهٔ RAG است که در آن، دانش بهجای متن خام، بهصورت گراف ساختاردهی میشود. مزیت: امکان پرسشهای چندمرحلهای که نیاز به ترکیب اطلاعات از چند منبع دارند. Microsoft در سال ۲۰۲۴ GraphRAG را بهطور عمومی معرفی کرد.
فصل هشتم: بهینهسازی آموزش
آموزش مدلهای بزرگ، چالشهای مهندسی پیچیدهای دارد. بهینهسازی، در سه سطح اتفاق میافتد: الگوریتم بهینهسازی، توزیعشده بودن، و مدیریت حافظه.
AdamW، Lion، Sophia و Muon
AdamW، بهینهساز استاندارد سالهای اخیر، بر پایهٔ Adam با یک تغییر کلیدی است: Weight Decay بهطور مستقل از Gradient محاسبه میشود. این تغییر، عملکرد را در مدلهای بزرگ بهبود میدهد.
در سال ۲۰۲۳، Google بهینهساز Lion را معرفی کرد که با استفاده از علامت Gradient (بهجای مقدار کامل)، مصرف حافظه را کاهش میدهد. Lion در مدلهای تصویری و multimodal نتایج خوبی داده.
Sophia (از Microsoft) از تخمین Hessian برای Adaptive Learning Rate استفاده میکند. Muon (از Keller Jordan) از تکنیک Newton-Schulz برای تصویر کردن Gradient به ماتریس متعامد استفاده میکند و در آموزش مدلهای کوچک نتایج چشمگیری میدهد.
آموزش توزیعشده: ZeRO، FSDP، Tensor Parallel
آموزش مدلهای بزرگ روی صدها یا هزاران GPU، نیاز به تکنیکهای توزیعشده دارد:
Data Parallelism
هر GPU نسخهٔ کامل مدل را دارد و روی بخشی از Batch آموزش میبیند. ساده ولی محدود به اندازهٔ مدل (باید در حافظهٔ یک GPU جای بگیرد).
ZeRO (Zero Redundancy Optimizer)
از Microsoft DeepSpeed. در ZeRO Stage 1، ۲، و ۳، بهتدریج پارامترهای Optimizer State، Gradient، و پارامترهای مدل بین GPU ها تقسیم میشوند. ZeRO-3 اجازه میدهد مدلهای چند صد میلیارد پارامتری روی خوشههای معمولی آموزش ببینند.
FSDP (Fully Sharded Data Parallel)
نسخهٔ PyTorch از ZeRO-3. با API سادهتر و پشتیبانی از Mixed Precision.
Tensor Parallelism
یک لایهٔ خاص (مثلاً یک Attention Block) بین چند GPU تقسیم میشود. مناسب برای مدلهایی که یک لایهٔ واحد بزرگتر از حافظهٔ یک GPU است.
Pipeline Parallelism
لایههای مختلف مدل بین GPU های مختلف تقسیم میشوند. هر GPU یک بخش از مدل را دارد و داده در Pipeline جریان مییابد.
Gradient Checkpointing و مدیریت حافظه
Gradient Checkpointing، تکنیکی است که مصرف حافظه را با محاسبهٔ مجدد کاهش میدهد. در Forward Pass عادی، همهٔ فعالسازیها ذخیره میشوند تا در Backward استفاده شوند. در Gradient Checkpointing، فقط بخشی از فعالسازیها ذخیره میشوند و بقیه در Backward محاسبهٔ مجدد میشوند. این تکنیک، مصرف حافظه را تا ۷۰٪ کاهش میدهد — با قیمت ۳۰٪ افزایش زمان آموزش.
فصل نهم: کوانتیزهسازی و فشردهسازی
کوانتیزهسازی (Quantization)، فرآیند کاهش دقت نمایش اعداد از FP32/FP16 به دقتهای پایینتر (INT8، INT4، و حتی INT2) است. مزیت: کاهش چشمگیر در حافظه و افزایش سرعت استنتاج.
GPTQ، AWQ، GGUF و معماریهای نوین
GPTQ
یک روش Post-Training Quantization که وزنهای مدل را یکییکی کوانتیزه میکند و خطا را با بهروزرسانی وزنهای باقیمانده جبران میکند. GPTQ به ۴ بیت کاهش دقت میدهد بدون افت محسوس کیفیت.
AWQ (Activation-aware Weight Quantization)
رویکردی که بر اساس اهمیت فعالسازیها، وزنهای مهمتر را با دقت بالاتر نگه میدارد. AWQ در مدلهای کوچک تا متوسط عملکرد خوبی دارد.
GGUF
یک فرمت ذخیرهسازی که در llama.cpp استفاده میشود و از کوانتیزهسازی با دقتهای مختلف (از ۲ بیت تا ۸ بیت) پشتیبانی میکند. GGUF بهویژه برای اجرای مدلها روی CPU و لپتاپها محبوب است.
Knowledge Distillation
در Knowledge Distillation، یک مدل کوچک (Student) تلاش میکند رفتار یک مدل بزرگ (Teacher) را یاد بگیرد. دو نوع distillation:
- Response-based: Student یاد میگیرد خروجی نهایی Teacher را بازتولید کند.
- Feature-based: Student یاد میگیرد نمایشهای داخلی Teacher را بازتولید کند.
DistilBERT، TinyBERT، و MobileBERT نمونههای موفق distillation در حوزهٔ زبانی هستند. در حوزهٔ LLM، مدلهای کوچک مثل Phi (از Microsoft) با distillation از GPT-4 آموزش دیدهاند.
Pruning ساختاری و غیرساختاری
Pruning، حذف بخشی از پارامترهای مدل است:
- Unstructured Pruning: حذف پارامترهای تکی. حفظ کیفیت بیشتر ولی نیاز به پشتیبانی سختافزاری.
- Structured Pruning: حذف کامل نورونها، فیلترها، یا سرها. کارایی بالاتر ولی با افت کیفیت بیشتر.
- Sparse Attention Patterns: حذف بخشی از Attention Matrix. در Longformer و BigBird استفاده میشود.
در LLM، Pruning معمولاً با Retraining ترکیب میشود تا افت کیفیت جبران شود. SparseGPT و Wanda از رویکردهای برجسته در این حوزه هستند.
Speculative Decoding و Medusa
Speculative Decoding، تکنیکی است که سرعت استنتاج را با استفاده از یک مدل کوچک (Draft Model) برای پیشنهاد توکنهای بعدی، و یک مدل بزرگ برای تأیید پیشنهادها، افزایش میدهد. اگر مدل کوچک ۷۰٪ توکنها را درست پیشنهاد دهد، سرعت کل بهطور قابل توجهی بالا میرود.
Medusa، نسخهٔ توسعهیافتهٔ این ایده است که بهجای مدل Draft جداگانه، چند Head اضافه در مدل اصلی قرار میدهد که هر Head پیشبینی چند توکن آینده را میکند. این رویکرد، پیادهسازی را سادهتر و سرعت را بالاتر میبرد.
فصل دهم: Diffusion و جریانهای مولد
Diffusion Models، یکی از بزرگترین پیشرفتهای سالهای اخیر در حوزهٔ تولید تصویر و ویدئو. مبانی این حوزه را در پیشرفتهای هوش مصنوعی در تصویر و ویدئو بهطور مفصل باز کردهام؛ در اینجا، جنبههای مرتبط با یادگیری ماشین و پیشرفتهای اخیر را مرور میکنم.
Flow Matching: جایگزین احتمالی Diffusion
Flow Matching، رویکردی است که در آن، بهجای یادگیری معکوس نویز، یک جریان پیوسته از توزیع اولیه به توزیع هدف یاد گرفته میشود. مزیت: آموزش سادهتر، نمونهگیری کارآمدتر، و کیفیت بالاتر. Meta در Movie Gen و Stability AI در Stable Diffusion 3 از Flow Matching استفاده کردهاند.
Consistency Models و نمونهگیری تکگامی
Consistency Models، خانوادهای از مدلها هستند که در آنها، یک تابع بهطور مستقیم نگاشت از نویز به تصویر را یاد میگیرد. مزیت: نمونهگیری تکگامی (بدون نیاز به چند مرحله). Latent Consistency Models (LCM) و SDXL-Turbo نمونههای موفق این رویکرد هستند.
فصل یازدهم: یادگیری تقویتی
یادگیری تقویتی (Reinforcement Learning)، در سالهای اخیر پیشرفتهای چشمگیری داشته — بهویژه در ترکیب با مدلهای زبانی.
Offline RL و Decision Transformers
Offline RL، زیرشاخهای از RL است که در آن، آموزش فقط روی دادههای تاریخی (بدون تعامل آنلاین) انجام میشود. Decision Transformer، رویکردی است که RL را بهعنوان یک مسئلهٔ Sequence Modeling فرمولبندی میکند. مزیت: استفاده از همان ابزارهای ترنسفورمر و پایداری بیشتر از RL کلاسیک.
World Models و شبیهسازی شناختی
World Models، مدلهایی هستند که یک نمایش داخلی از محیط میسازند و میتوانند رفتار محیط را پیشبینی کنند. این ایده در یادگیری تقویتی، امکان آموزش مدلها با شبیهسازی داخلی را فراهم میکند — بدون نیاز به تعامل مستقیم با محیط واقعی. DreamerV3 (از DeepMind) نمونهای موفق از این حوزه است.
فصل دوازدهم: یادگیری فدرال و حریم خصوصی
Federated Learning، رویکردی است که در آن، مدل روی دستگاههای مختلف (بدون انتقال داده) آموزش میبیند. این رویکرد، برای سناریوهای حساس به حریم خصوصی (مثل دادههای پزشکی) حیاتی است.
Differential Privacy: از تئوری تا عمل
Differential Privacy (DP)، چارچوبی ریاضی برای تضمین حریم خصوصی است. ایدهٔ اصلی: خروجی یک الگوریتم، بهقدر کافی مستقل از حضور هر یک نمونه باشد. برای پیادهسازی، معمولاً به Gradient نویز اضافه میشود (DP-SGD). چالش اصلی: تعادل بین حریم خصوصی و کیفیت مدل.
معماریهای Federated Learning
سه معماری اصلی FL:
- Horizontal FL: دستگاهها با هم روی یک مدل کار میکنند ولی دادههایشان متفاوت است.
- Vertical FL: چند سازمان، دادهٔ یک کاربر را بین خودشان تقسیم میکنند و مدل مشترک میسازند.
- Federated Transfer Learning: ترکیبی از دو حالت قبلی.
فصل سیزدهم: Graph Neural Networks
Graph Neural Networks (GNN)، خانوادهای از مدلها برای پردازش دادههای گرافی. کاربردها: پیشبینی ساختار مولکول، تحلیل شبکههای اجتماعی، سیستمهای توصیهگر.
Graph Transformers
Graph Transformer، ترکیبی از GNN و Transformer است که روی گراف کار میکند. مزیت: قابلیت انتقال (Transfer Learning) از ترنسفورمرهای استاندارد، و پردازش گرافهای بزرگ. مثالها: Graphormer (از Microsoft)، GPS (از Google)، و SAN.
فصل چهاردهم: محاسبات نورومورفیک و سختافزار تخصصی
سختافزار تخصصی برای یادگیری ماشین، یکی از جبهههای اصلی پیشرفت است:
- Google TPU: Tensor Processing Unit، پردازندهٔ اختصاصی برای Tensor Operations.
- Groq LPU: Language Processing Unit، طراحیشده برای استنتاج با تأخیر پایین.
- Cerebras WSE: Wafer-Scale Engine، بزرگترین تراشه دنیا با میلیونها هسته.
- Neuromorphic: تراشههای الهامگرفته از مغز مثل Loihi (Intel) و TrueNorth (IBM) که از Spiking Neural Networks استفاده میکنند.
هر کدام از این سختافزارها، مزایا و معایب خودشان را دارند. TPU برای آموزش در مقیاس بزرگ، LPU برای استنتاج real-time، و WSE برای مدلهای بسیار بزرگ مناسب است.
فصل پانزدهم: یادگیری ماشین کوانتومی
Quantum Machine Learning (QML)، ترکیب محاسبات کوانتومی و یادگیری ماشین. سه حوزهٔ اصلی:
- Quantum-enhanced classical ML: استفاده از کامپیوترهای کوانتومی برای تسریع الگوریتمهای ML کلاسیک.
- Classical-enhanced Quantum ML: استفاده از ML کلاسیک برای طراحی مدارهای کوانتومی بهتر.
- Quantum-native ML: الگوریتمهای ML که ذاتاً کوانتومی هستند.
QML امروز یک حوزهٔ تحقیقاتی است، ولی هنوز کاربرد صنعتی واقعی در مقیاس تولیدی پیدا نکرده. چالشهای اصلی: نویز در Qubit ها، محدودیت تعداد Qubit، و نبود مزیت اثباتشده در مسائل واقعی.
فصل شانزدهم: تفسیرپذیری مکانیستی
Mechanistic Interpretability، حوزهای است که تلاش میکند مکانیزم داخلی مدلهای عصبی را بفهمد — نه فقط رفتار خروجی آنها. این حوزه، در سالهای اخیر توجه زیادی جلب کرده، بهویژه بهدلیل کارهای Anthropic و Google DeepMind.
Sparse Autoencoders و کشف ویژگیها
Sparse Autoencoders (SAEs)، ابزاری هستند که در آنها، فعالسازیهای مدل به یک فضای پرفضا و پراکنده (Sparse) نگاشت میشوند. ایده: اگر مدل، ویژگیهای معنایی را بهطور پراکنده در فعالسازیها ذخیره کند، SAE میتواند این ویژگیها را کشف کند. Anthropic در سال ۲۰۲۴ با استفاده از SAEs، میلیونها ویژگی معنایی در Claude 3 Sonnet کشف کرد.
Circuit Analysis در مدلهای زبانی
Circuit Analysis، رویکردی است که تلاش میکند مسیرهای محاسباتی در مدل را بهصورت گراف مداری مدلسازی کند. مثال معروف: «Indirect Object Identification» در GPT-2 Small، که نشان میدهد مدل چطور تصمیم میگیرد به چه اشاره کند. این تحلیلها، برای درک رفتار مدل و طراحی مدلهای بهتر ضروری هستند.
فصل هفدهم: استقرار و استنتاج مقیاسپذیر
استقرار مدلهای بزرگ، یکی از چالشهای اصلی در تولید است. تکنیکهای کلیدی:
vLLM، PagedAttention و مدیریت حافظه
vLLM از UC Berkeley، یکی از پرکاربردترین فریمورکهای استنتاج LLM. نوآوری اصلی: PagedAttention، که مدیریت Key-Value Cache را بهشکل حافظهٔ صفحهبندی (Paging) در سیستمعامل انجام میدهد. نتیجه: مصرف حافظه تا ۷۰٪ کاهش مییابد و throughput چند برابر میشود.
Continuous Batching و کارایی
Continuous Batching، روشی است که در آن، درخواستها بهجای پردازش گروهی، بهطور پیوسته در Batch قرار میگیرند. یعنی بهجای انتظار برای کامل شدن یک Batch، بهمحض خالی شدن یک جای خالی، درخواست جدید اضافه میشود. این تکنیک، تأخیر را بهطور چشمگیر کاهش میدهد.
فصل هجدهم: ارزیابی و معیارها
ارزیابی مدلهای بزرگ، چالشی جدی است. سه مسئلهٔ اصلی:
MMLU، GSM8K، MATH و چالش آلودگی داده
MMLU (Massive Multitask Language Understanding)، یکی از معیارهای پرکاربرد برای سنجش دانش عمومی مدلهاست. GSM8K و MATH، برای سنجش توانایی ریاضی. HumanEval و MBPP، برای سنجش کدنویسی.
چالش اصلی: آلودگی داده (Data Contamination). اگر بخشی از دادههای تست، در دادههای آموزش بوده باشد، نتایج گمراهکننده میشوند. روشهای جدید (مثل N-gram Overlap Detection) تلاش میکنند این مسئله را تشخیص دهند ولی کار سختی است.
معیارهای جدیدتر: Chatbot Arena که در آن، دو پاسخ از دو مدل با هم مقایسه میشود و رأی انسانی، برنده را تعیین میکند. این رویکرد، در برابر آلودگی داده مقاومتر است، ولی هزینه و سوگیری خاص خودش را دارد.
فصل نوزدهم: ایمنی، همسویی و حاکمیت
همسویی (Alignment)، یکی از مهمترین چالشهای این حوزه است. هدف: اطمینان از اینکه مدل، بهجای بیشینهسازی صرف Reward، واقعاً به نفع انسان عمل میکند.
چارچوبهای حاکمیتی و AI Safety
سه رویکرد اصلی برای ایمنی:
- RLHF و Constitutional AI: آموزش مدل با بازخورد انسانی و قوانین اخلاقی.
- Red Teaming: کشف آسیبپذیریهای مدل با تستهای خصمانه.
- Scalable Oversight: توسعهٔ روشهایی که به انسان امکان میدهد مدلهای پیچیدهتر از خودش را ارزیابی کند.
در سطح حاکمیتی، اتحادیهٔ اروپا با EU AI Act، آمریکا با Executive Order، و چین با قوانین داخلی، چارچوبهای مختلفی ارائه کردهاند. این چارچوبها، اثر مستقیم روی طراحی و استقرار مدلها دارند.
فصل بیستم: مرزها و مسائل باز
با همهٔ پیشرفتها، این حوزه مسائل باز مهمی دارد:
مسئلهٔ اول: استدلال قابلاتکا
مدلهای امروزی در وظایف استدلالی پیشرفت کردهاند، ولی هنوز خطاهای سیستماتیک دارند. آیا با مقیاس بیشتر یا با رویکردهای جدید، میتوان به استدلال کامل رسید؟ این پرسش، باز است.
مسئلهٔ دوم: حافظهٔ طولانیمدت
مدلهای امروزی، حافظهٔ درون-مکالمه دارند ولی حافظهٔ بلندمدت (بین مکالمات) ندارند. برخی تلاشها با Memory Layer ها و Memory-Augmented Models در جریان است، ولی هنوز به بلوغ نرسیده.
مسئلهٔ سوم: یادگیری پیوسته
مدلها امروز یکبار آموزش میبینند و سپس ثابت میمانند. یادگیری پیوسته (Continual Learning) — یعنی مدلی که با تجربهٔ جدید بهطور پیوسته بهتر میشود — یکی از مسائل حلنشدهٔ این حوزه است. چالش اصلی: Catastrophic Forgetting، یعنی فراموشی دانش قبلی هنگام یادگیری دادههای جدید.
مسئلهٔ چهارم: هوش عمومی
پرسش بزرگ: آیا مدلهای زبان، مسیر رسیدن به AGI هستند یا یک بنبست؟ پاسخ قطعی وجود ندارد، ولی تجربهٔ من میگوید هنوز چیزهای زیادی وجود دارد که نمیدانیم. مسیر پیش رو، احتمالاً ترکیبی از معماریهای جدید، پارادایمهای آموزشی جدید، و درک عمیقتر از ماهیت هوش است.
اگر به روند بلندمدت این حوزه علاقه دارید، مراجع آینده یادگیری ماشین و تفاوت یادگیری ماشین و هوش مصنوعی دید خوبی میدهند. برای کاربردهای عملی، کاربردهای یادگیری ماشین در کسب و کار و یادگیری ماشین در پردازش زبان طبیعی دو مرجع عملیتر هستند. برای شروع یادگیری، چگونه یادگیری ماشین را شروع کنیم نقطهٔ شروع است و برای درک چالشهای عملی، چالشهای پیادهسازی یادگیری ماشین مفید است. اگر به دنبال درک مبانی هستید، انواع یادگیری ماشین و یادگیری نظارتشده و بدون نظارت دو مرجع بنیادیناند. و برای درک ابزارهای این حوزه، ابزارهای یادگیری ماشین و الگوریتمهای محبوب یادگیری ماشین دید عملی ارائه میدهند.
خط پایان: نقشهٔ راه پیش رو
پیشرفتهای جدید در یادگیری ماشین، در پنج سال گذشته، این حوزه را از یک ابزار آماری به یک پلتفرم عمومی هوش تبدیل کرده. این تحول، در سه محور اصلی رخ داده: معماری (از Transformer خالص به MoE، SSM، و ترکیبی)، پارادایم آموزش (از پیشآموزش ساده به زنجیرهٔ پیچیدهٔ Self-Supervised + RLHF + Reasoning)، و فشردهسازی (از مدلهای بزرگ به مدلهای کارآمد و استدلالی).
از دید مهندسی، موفقیت در این حوزه به سه چیز بستگی دارد: درک عمیق معماریها (نه سطحی)، توانایی مدیریت پیچیدگی سیستمهای توزیعشده، و دید راهبردی به تحولات این حوزه. تیمهایی که این سه را دارند، در مسابقهٔ پیوستهٔ این حوزه پیشرو خواهند بود. تیمهایی که فقط یکی را دارند، دیر یا زود در یکی از سه جبهه عقب میمانند.
این مقاله، تلاشی بود برای ارائهٔ تصویری فنی و جامع از پیشرفتهای اخیر. اگر در پروژهای با چالشی خاص در این حوزه روبهرو شدهاید — مثلاً مدیریت MoE در مقیاس تولید، یا استقرار مدلهای استدلالی با هزینهٔ پایین — تجربهتان را در دیدگاه بنویسید. این نوع دادهٔ واقعی، برای خوانندهٔ بعدی که در همان موقعیت ایستاده، از هر مقالهٔ تئوریک ارزشمندتر است. 🧬