سه سال پیش، اگر می‌خواستیم یک مدل زبانی بزرگ را روی یک کاربرد صنعتی مستقر کنیم، با دو محدودیت بنیادین مواجه بودیم: هزینهٔ محاسباتی استنتاج، و ناتوانی مدل در استدلال چندمرحله‌ای قابل‌اتکا. امروز، هر دو محدودیت در حال فروپاشی است — نه به‌دلیل یک جهش علمی ناگهانی، بلکه به‌دلیل هم‌گرایی چندین خط تحقیقاتی موازی: معماری‌های کارآمد، یادگیری با بازخورد انسان، استدلال در زمان استنتاج، و پارامترهای فشرده. این مقاله، تلاش می‌کند این تحول را در سطح مهندسی بررسی کند — از طریق کالبدشکافی معماری‌ها، بررسی معادلات و کارایی، و بحث دربارهٔ مرزهای فعلی دانش. هدف، نه مرور سطحی مقالات پرطرفدار، بلکه تحلیل عمیق مسائلی است که در تیم‌های تحقیقاتی بزرگ (Google DeepMind, Meta FAIR, OpenAI, Anthropic) به‌طور جدی روی آن‌ها کار می‌شود.

نقطهٔ شروع: چرا سال‌های اخیر، متفاوت‌اند؟

پیشرفت‌های یادگیری ماشین (Machine Learning) در پنج سال گذشته، نه خطی، بلکه به‌شکل پیوسته و انباشتی رخ داده. اگر بخواهم یک تصویر دقیق از این تغییر ارائه دهم، سه محور اصلی آن را می‌بینم:

محور اول: معماری. از Transformer استاندارد به سمت معماری‌های کارآمدتر، ترکیبی، و تخصصی. این تحول، هم‌زمان در سه جبهه اتفاق می‌افتد: کاهش مرتبهٔ محاسباتی Attention از O(n²) به چیزی نزدیک به O(n)، معرفی State Space Models به‌عنوان جایگزین یا مکمل، و استفاده از Sparsity در قالب Mixture of Experts (MoE).

محور دوم: پارادایم آموزش. از «پیش‌آموزش خالص، سپس Fine-Tune سرتاسری» به سمت زنجیره‌ای چندمرحله‌ای: Self-Supervised Pretraining، Supervised Fine-Tuning، RLHF، DPO، RLAIF، و سرانجام، استدلال در زمان استنتاج. هر لایه از این زنجیره، قابلیت‌های جدیدی به مدل اضافه می‌کند.

محور سوم: فشرده‌سازی و استقرار. از مدل‌های بزرگ‌تر به سمت مدل‌هایی که «هوش کم‌حجم» را تولید می‌کنند: Parameter-Efficient Fine-Tuning، Quantization پس از آموزش، Distillation، Speculative Decoding، و اخیراً، مدل‌های استدلالی که با استنتاج طولانی‌تر، دقت بالاتری می‌سازند.

تجربهٔ من در پروژه‌های تولیدی این حوزه، یک نکتهٔ بنیادین را نشان می‌دهد: تیم‌هایی که این سه محور را به‌طور هم‌زمان دنبال می‌کنند، از تیم‌هایی که فقط روی یکی تمرکز دارند، فاصلهٔ قابل توجهی می‌گیرند. مثلاً استفاده از MoE بدون درک چالش‌های Routing، به‌سرعت به فروپاشی Expert می‌انجامد. استفاده از RLHF بدون Process Reward Model مناسب، مدل را به سمت پاسخ‌های ظاهراً درست اما نادرست هدایت می‌کند.

پیش از ورود به بحث فنی، لازم است بگویم که این مقاله، فرض می‌کند خواننده با مبانی یادگیری ماشین آشناست. اگر تازه در این حوزه هستید، توصیه می‌کنم پیش از ادامه، مراجع یادگیری ماشین چیست و چگونه کار می‌کند و یادگیری عمیق چه تفاوتی با یادگیری ماشین دارد را بخوانید. همچنین برای درک تصویر کلی این خانواده از مدل‌ها، مرور هوش مصنوعی مولد چیست و چگونه کار می‌کند پیش‌زمینهٔ خوبی می‌سازد.

پیشرفت‌های جدید یادگیری ماشین، نه در یک جهت، بلکه در هم‌گرایی سه محور اتفاق می‌افتند: معماری، پارادایم آموزش، و فشرده‌سازی. تیم‌هایی که یکی را نادیده می‌گیرند، در یکی از سه جبهه عقب می‌مانند.

فصل اول: انقلاب معماری — از Attention تا SSM

معماری Transformer، از سال ۲۰۱۷ تا امروز، ستون فقرات مدل‌های یادگیری ماشین بوده. اما این معماری، یک ضعف ساختاری بنیادین دارد: مکانیزم Self-Attention از نظر مرتبهٔ محاسباتی، O(n²) است که در آن n طول دنباله است. این یعنی با دو برابر شدن طول متن، هزینهٔ محاسبات چهار برابر می‌شود. در طول چهار سال گذشته، سه خانوادهٔ معماری برای حل این مسئله توسعه یافته: Attention کارآمد، State Space Models، و Sparse Architectures.

تکامل Attention: از نرخ مربعی تا زیرمرتبهٔ خطی

یکی از نقاط کانونی تحقیقات در سال‌های اخیر، کاهش هزینهٔ مکانیزم Attention بوده. مسیر این تکامل را می‌توان در چند نقطهٔ عطف دید:

Flash Attention

در سال ۲۰۲۲، تری دائو و همکارانش در استنفورد، تکنیکی معرفی کردند به‌نام Flash Attention که مسئله را از منظر «محاسبهٔ عددی بهینه» حل می‌کرد. ایدهٔ اصلی: به‌جای محاسبهٔ کل ماتریس Attention در حافظهٔ GPU و سپس Softmax، محاسبه به بلوک‌های کوچک تقسیم می‌شود و در حافظهٔ SRAM (که به پردازنده بسیار نزدیک‌تر است) انجام می‌شود. نتیجه: مصرف حافظه از O(n²) به O(n) کاهش می‌یابد و سرعت ۲ تا ۴ برابر افزایش پیدا می‌کند. Flash Attention 2 و Flash Attention 3، نسخه‌های به‌مراتب بهینه‌تر این تکنیک هستند.

نکتهٔ کلیدی که کمتر گفته می‌شود: Flash Attention، پیچیدگی الگوریتمی را تغییر نمی‌دهد؛ همان O(n²) می‌ماند. اما با بهینه‌سازی ساختار داده و ترتیب محاسبه، از حافظهٔ سلسله‌مراتبی GPU استفادهٔ بهینه می‌کند. این یعنی برای طول‌های بسیار طولانی (مثلاً بالای ۳۲K توکن)، Flash Attention به‌تنهایی کافی نیست.

Multi-Query Attention و Grouped-Query Attention

در سال ۲۰۱۹، Shazeer پیشنهاد Multi-Query Attention را داد: به‌جای اینکه هر Head Query، Key و Value مستقل خودش را داشته باشد، همهٔ Head های Query، از یک مجموعهٔ مشترک Key و Value استفاده کنند. این تغییر ساده، مصرف حافظهٔ Key-Value Cache را به‌شدت کاهش می‌دهد — که در استنتاج خودرگرسیو (Autoregressive) بحرانی است. Grouped-Query Attention (GQA) نسخهٔ میانی است که در آن، Head ها به گروه‌هایی تقسیم می‌شوند و هر گروه Key و Value مشترک دارد. GQA امروز استاندارد اکثر مدل‌های بزرگ (Llama 3، Mistral، Gemma) است.

Sliding Window Attention و Longformer

یکی از رویکردهای مقابله با O(n²) این است که هر توکن، فقط به توکن‌های نزدیک خودش Attention داشته باشد — با یک پنجرهٔ لغزان (Sliding Window). این ایده در Longformer و BigBird مطرح شد و در Mistral و Gemma به کار رفته. مشکل این رویکرد: از دست رفتن ارتباط‌های دوردست. راه‌حل‌های ترکیبی، مثل استفاده از Global Tokens یا لایه‌بندی (مثلاً یک لایه با پنجرهٔ محلی، لایهٔ بعدی با پنجرهٔ گسترده‌تر) تا حدی این مشکل را حل می‌کند.

Linear Attention

خانواده‌ای از مکانیزم‌ها که با تغییر ترتیب محاسبه و استفاده از تکنیک‌های کرنل، Attention را به O(n) کاهش می‌دهند. Performer، Linear Transformer، و Linformer از این دسته‌اند. مزیت نظری: مقیاس‌پذیری خطی برای طول‌های بسیار طولانی. عیب عملی: از دست دادن دقت در مقایسه با Attention استاندارد، به‌ویژه در وظایف استدلالی. در عمل، Linear Attention جای Attention استاندارد را نگرفته، ولی در ترکیب با SSM یا در وظایف خاص، مفید است.

State Space Models: از S4 تا Mamba و Mamba-2

شاید مهم‌ترین نوآوری معماری سال‌های اخیر، بازگشت مفهوم State Space از تئوری کنترل به یادگیری عمیق باشد. ایدهٔ State Space Model (SSM) در تئوری سیستم‌های خطی ریشه دارد: هر سیستم دینامیک، با یک بردار حالت (State) و معادلات انتقال حالت توصیف می‌شود.

S4: Stone Soup

در سال ۲۰۲۱، آلبرت گو و همکارانش در استنفورد، معماری S4 را معرفی کردند. S4، یک SSM پیوسته است که با یک تکنیک به‌نام «Discretization» به حالت گسسته تبدیل می‌شود. سه ویژگی کلیدی S4:

  • پارامترسازی HiPPO: یک ماتریس انتقال حالت خاص که تئوری آن تضمین می‌کند سیستم، حافظهٔ طولانی‌مدت داشته باشد.
  • کانولوشن کرنل: S4 می‌تواند به‌صورت یک کانولوشن نمایش داده شود، که اجازه می‌دهد آموزش به‌طور موازی روی طول دنباله انجام شود.
  • پیچیدگی O(n log n): با استفاده از FFT، پیچیدگی محاسباتی به زیر-مرتبهٔ مربعی کاهش می‌یابد.

S4 در وظایف دنباله‌های طولانی (مثل audio و genomic) نتایج چشمگیری گرفت. اما دو محدودیت داشت: مکانیزم حالت ثابت بود (نه داده-محور)، و در وظایف زبانی، عملکردی در حد Transformer نداشت.

Mamba: SSM انتخابی

در سال ۲۰۲۳، آلبرت گو و تری دائو مقالهٔ Mamba را منتشر کردند. ایدهٔ اصلی: به‌جای اینکه ماتریس‌های SSM ثابت باشند، داده-محور (Input-Dependent) باشند. یعنی در هر گام، بر اساس ورودی فعلی، ماتریس‌های A, B, C محاسبه می‌شوند. این رویکرد، به Mamba اجازه می‌دهد مانند Attention رفتار کند: تصمیم بگیرد چه اطلاعاتی را نگه دارد و چه اطلاعاتی را فراموش کند.

مشکل: با داده-محور شدن، S4 نمی‌تواند از کانولوشن موازی استفاده کند. راه‌حل Mamba: استفاده از یک الگوریتم Selective Scan که در GPU به‌طور کارآمد موازی‌سازی می‌شود. نتیجه: Mamba هم کیفیت Transformer را می‌گیرد و هم پیچیدگی خطی دارد. روی وظایف زبانی، Mamba عملکردی در حد Transformer نشان داد، ولی با هزینهٔ استنتاج چند برابر کمتر در دنباله‌های بلند.

Mamba-2: ارتباط با Attention

در سال ۲۰۲۴، همان تیم مقالهٔ Mamba-2 را منتشر کرد که نشان می‌داد SSM و Attention، دو روی یک سکه‌اند. با استفاده از مفهوم «Structured State Space Duality»، می‌توان SSM و Attention را به‌شکل یکپارچه دید. Mamba-2 با این چارچوب، عملکرد بهتری از Mamba گرفت و امکان آموزش موازی کارآمدتری را فراهم کرد.

نقش Mamba در عمل

تجربهٔ من در پروژه‌های واقعی: Mamba در وظایف دنباله‌های بسیار طولانی (مثلاً پردازش ژنومی، تحلیل audio طولانی) موفق است. اما در وظایف استدلالی پیچیده با طول متن متوسط، تفاوت معناداری با Transformer دیده نمی‌شود. امروز، اکثر مدل‌های تولیدی از معماری ترکیبی استفاده می‌کنند: بخشی از لایه‌ها Attention، بخشی SSM. این الگو که «Hybrid SSM-Transformer» نامیده می‌شود، در مدل‌هایی مثل Jamba و Zamba (از AI21) دیده می‌شود.

Mixture of Experts: مقیاس‌پذیری بدون هزینهٔ متناسب

اگر بخواهم یک ایدهٔ معماری را که بیشترین تأثیر را در سال‌های اخیر داشته معرفی کنم، آن Mixture of Experts (MoE) است. ایدهٔ اصلی: به‌جای یک شبکهٔ Feed-Forward بزرگ که برای همهٔ توکن‌ها فعال می‌شود، چندین «Expert» کوچک داشته باشیم و در هر گام، فقط تعداد محدودی از آن‌ها فعال شوند.

معماری پایهٔ MoE

در یک لایهٔ MoE کلاسیک:

y = Σ_{i∈Top-K} G(x)_i · E_i(x)

که در آن E_i(x) خروجی Expert i است و G(x)_i وزن اختصاص‌داده‌شده به آن Expert توسط Router است. در Top-K، معمولاً K=۱ یا ۲. یعنی در هر گام، فقط ۱ یا ۲ Expert از بین (مثلاً) ۸ تا ۶۴ Expert فعال می‌شوند.

مزیت محاسباتی: اگر مدل ۱۰۰ میلیارد پارامتر داشته باشد ولی در هر گام فقط ۱۰ میلیارد فعال باشند، هزینهٔ استنتاج مانند یک مدل ۱۰ میلیاردی است — با کیفیتی نزدیک به مدل ۱۰۰ میلیاردی.

MoE در مقیاس

اولین مدل‌های بزرگ MoE (Mixtral 8x7B، Switch Transformer) نشان دادند که این معماری مقیاس‌پذیر است. DeepSeek-V3 با معماری MoE، با ۶۷۱ میلیارد پارامتر کل و ۳۷ میلیارد پارامتر فعال در هر توکن، به کیفیتی نزدیک به مدل‌های Dense بزرگ‌تر رسید. Llama 4 Scout و Maverick نیز از MoE استفاده می‌کنند.

مسئلهٔ Routing: چالش بنیادین MoE

MoE ظاهراً ساده به‌نظر می‌رسد، ولی چالش‌های عمیقی دارد:

چالش اول: فروپاشی Expert

Router تمایل دارد همیشه به تعداد محدودی از Expert ها وزن بدهد. نتیجه: اکثر Expert ها هرگز آموزش نمی‌بینند و مدل عملاً معادل یک شبکهٔ کوچک می‌شود. راه‌حل: استفاده از Load Balancing Loss که به Router فشار می‌آورد ترافیک را بین Expert ها متعادل کند. اما این Loss، خودش چالش‌های جدیدی می‌سازد — می‌تواند به نفع توزیع یکنواخت، کیفیت Routing را قربانی کند.

چالش دوم: عدم تعادل محاسباتی

در MoE، بار محاسباتی در هر گام متغیر است. اگر در یک Batch، اکثر توکن‌ها به یک Expert بروند، آن Expert گلوگاه می‌شود و بقیه بیکار می‌مانند. راه‌حل‌های موجود: Capacity Factor (تعیین حداکثر توکن برای هر Expert)، Token Dropping (حذف توکن‌های اضافی)، و Expert Choice Routing (به‌جای اینکه توکن Expert انتخاب کند، Expert توکن انتخاب کند).

چالش سوم: ارتباط بین Expert ها

در سیستم‌های توزیع‌شده، Expert ها روی GPU های مختلفی هستند. Router باید تصمیم بگیرد کدام توکن به کدام GPU برود. این «All-to-All Communication» یکی از بزرگ‌ترین گلوگاه‌های کارایی MoE است. راه‌حل‌های پیشرفته مثل DeepSpeed-MoE و Tutel از تکنیک‌های Grouped GEMM و Hierarchical All-to-All استفاده می‌کنند.

چالش چهارم: Fine-Tuning MoE

Fine-Tuning یک مدل MoE، دشوارتر از Dense است. اگر فقط روی یک دامنه آموزش ببینید، ممکن است Router را به سمت استفادهٔ صرف از یک Expert هدایت کنید و بقیه را بی‌استفاده بگذارید. راه‌حل‌های فعلی: Freeze کردن Router، استفاده از LoRA روی Expert های خاص، و آموزش تنها بخشی از Expert ها.

MoE، یک معاملهٔ دقیق است: در ازای مقیاس‌پذیری بالاتر، پیچیدگی مهندسی چند برابر می‌شود. تیم‌هایی که آمادهٔ مدیریت این پیچیدگی نیستند، در MoE شکست می‌خورند — نه به‌دلیل ضعف معماری، بلکه به‌دلیل نبود زیرساخت.

معماری‌های ترکیبی: Attention + SSM + MoE

معماری‌های امروزی، به‌ندرت «خالص» هستند. اکثر مدل‌های پیشرو، ترکیبی از چندین ایدهٔ معماری‌اند:

  • Jamba (AI21): ترکیبی از Transformer + Mamba + MoE. نسبت لایه‌ها ۱ به ۷ (یک Transformer، هفت Mamba) به‌علاوه MoE در بخش‌هایی از لایه‌ها.
  • Zamba: استفاده از یک لایهٔ Attention مشترک در ابتدا، سپس لایه‌های Mamba در ادامه.
  • RecurrentGemma (Google): ترکیبی از Attention محلی و مکانیزم‌های بازگشتی.
  • StripedHyena: ترکیب Attention و معماری‌های کانولوشنی طولانی (مثل Hyena).

الگوی مشترک: استفاده از Attention در لایه‌های ابتدایی یا لایه‌های کلیدی (برای کیفیت)، و SSM یا مکانیزم‌های کارآمدتر در لایه‌های میانی (برای کارایی). این طراحی، به تعادل بین کیفیت و کارایی می‌رسد.

یک نکتهٔ مهندسی: در معماری‌های ترکیبی، ترتیب لایه‌ها حیاتی است. تجربهٔ من نشان می‌دهد اگر Attention در ابتدا باشد و SSM در ادامه، عملکرد بهتری از حالت عکس دارد. دلیل احتمالی: Attention برای کشف روابط اولیه مناسب‌تر است، ولی SSM برای حفظ اطلاعات در طول دنباله طولانی بهتر عمل می‌کند.

فصل دوم: قوانین مقیاس و مدل‌های بنیادین

قوانین مقیاس (Scaling Laws)، یکی از مفاهیم محوری در این حوزه است. این قوانین، رابطهٔ بین اندازهٔ مدل، حجم داده، و کیفیت خروجی را توصیف می‌کنند.

Chinchilla و بازتعریف بهینهٔ مقیاس

در سال ۲۰۲۰، Kaplan و همکارانش در OpenAI مقاله‌ای منتشر کردند که نشان می‌داد در مقیاس ثابت محاسبات، بزرگ‌تر کردن مدل، بهره‌وری بیشتری از اضافه‌کردن داده دارد. این یافته، به ساخت مدل‌های بسیار بزرگ با داده‌های محدود منجر شد (مثل GPT-3 با ۱۷۵ میلیارد پارامتر و ۳۰۰ میلیارد توکن).

در سال ۲۰۲۲، DeepMind در مقالهٔ Chinchilla این یافته را بازتعریف کرد. آن‌ها نشان دادند که Kaplan در محاسبهٔ نسبت بهینه اشتباه کرده و در واقع، برای مقیاس محاسباتی ثابت، باید اندازهٔ مدل و حجم داده به‌طور هم‌زمان افزایش یابند. نسبت بهینه: برای هر پارامتر، حدود ۲۰ توکن داده.

نتیجهٔ عملی این بازتعریف: مدل‌های نسل بعد، کوچک‌تر ولی با دادهٔ بیشتر آموزش دیدند. مثلاً Llama 3 8B، با ۱۵ تریلیون توکن داده آموزش دیده — یعنی حدود ۱۸۰۰ توکن به‌ازای هر پارامتر، که چند برابر نسبت Chinchilla است. این نشان می‌دهد در عمل، «Over-Training» روی داده، به مدل‌های کارآمدتر منجر می‌شود، حتی اگر از نظر محاسباتی بهینه نباشد.

در سال ۲۰۲۴، مقاله‌ای از DeepMind این را دقیق‌تر تحلیل کرد و نشان داد که فرمول بهینه، وابسته به «هدف استنتاج» است. اگر هدف، Minimize کردن هزینهٔ استنتاج باشد، باید داده را در نسبت‌های بسیار بالاتری آموزش داد.

توانایی‌های ظهوریافته و بحث دربارهٔ وجودشان

یکی از مباحث جذاب این حوزه، مفهوم «توانایی‌های ظهوریافته» (Emergent Abilities) است. ایدهٔ اولیه: با افزایش اندازهٔ مدل، توانایی‌های کیفی جدیدی ظاهر می‌شوند که در مدل‌های کوچک‌تر وجود ندارند. مثلاً در مدل‌های زیر ۱۰ میلیارد پارامتر، انجام جمع ساده ممکن نیست؛ در مدل‌های ۱۰۰ میلیاردی، مدل می‌تواند ریاضیات پایه انجام دهد.

اما در سال ۲۰۲۳، Schaeffer و همکارانش در مقاله‌ای بحث‌برانگیز نشان دادند که این «ظهور»، در بخش‌هایی، نتیجهٔ انتخاب معیارهای ارزیابی است. اگر به‌جای معیارهای باینری (درست/غلط)، از معیارهای پیوسته (مثل Cross-Entropy) استفاده کنیم، بهبود عملکرد پیوسته به نظر می‌رسد، نه ظهور ناگهانی.

این بحث، هنوز حل نشده. تجربهٔ من می‌گوید در برخی حوزه‌ها (مثل استدلال چندمرحله‌ای)، ظهور واقعی وجود دارد. در حوزه‌های دیگر، صرفاً توهم معیار است.

فصل سوم: پارادایم‌های پیش‌آموزش

پارادایم پیش‌آموزش، از یک مرحلهٔ ساده به زنجیره‌ای پیچیده تبدیل شده. مسیر این تحول:

Self-Supervised Learning: پیشرفت‌های معاصر

Self-Supervised Learning (SSL)، به رویکردی گفته می‌شود که در آن مدل، بدون برچسب، از ساختار داده یاد می‌گیرد. دو خانوادهٔ اصلی:

خانوادهٔ پیش‌بینی Masked

در این رویکرد، بخشی از ورودی حذف می‌شود و مدل باید آن را پیش‌بینی کند. BERT (Masked Language Modeling)، MAE (Masked Autoencoder)، و SpanBERT از این دسته‌اند. در مدل‌های جدید، این رویکرد با تکنیک‌های پیشرفته‌تر مثل Span Masking و Whole Word Masking ترکیب شده.

خانوادهٔ تقابلی

در این رویکرد، مدل یاد می‌گیرد نمایش‌هایی بسازد که نمونه‌های مرتبط، به هم نزدیک و نمونه‌های بی‌ربط، دور باشند. SimCLR، MoCo، BYOL، و SimSiam از این دسته‌اند. خانوادهٔ تقابلی، پایهٔ CLIP است که در بخش‌های بعدی به آن می‌پردازیم.

پیشرفت‌های جدید در SSL، به‌سمت کاهش وابستگی به Augmentation و افزایش کارایی رفته. مثلاً Self-Distillation with No Labels (DINO) نشان داد می‌توان بدون Augmentation سنگین، به نمایش‌های معنایی قوی رسید.

RLHF، DPO و نسل جدید Alignment

RLHF (Reinforcement Learning from Human Feedback)، رویکردی است که در آن، یک مدل پاداش (Reward Model) با بازخورد انسانی آموزش می‌بیند، سپس مدل زبانی با RL روی این پاداش بهینه می‌شود. این رویکرد، در ChatGPT به‌کار رفت و نقطهٔ چرخش این حوزه شد.

چالش‌های RLHF در مقیاس:

  • هزینهٔ آموزش Reward Model: نیاز به داده‌های مقایسه‌ای انسانی، که هم گران است و هم سوگیری دارد.
  • Reward Hacking: مدل یاد می‌گیرد امتیاز Reward Model را بالا ببرد، بدون اینکه واقعاً بهتر شود.
  • ناپایداری PPO: آموزش با Proximal Policy Optimization (PPO)، دشوار و پرنوسان است.

در سال ۲۰۲۳، DPO (Direct Preference Optimization) از استنفورد معرفی شد که این چرخه را ساده‌تر می‌کند. در DPO، به‌جای آموزش Reward Model و RL جداگانه، مدل مستقیماً روی داده‌های مقایسه‌ای بهینه می‌شود. نتیجه: سادگی پیاده‌سازی، پایداری بیشتر، و هزینهٔ کمتر.

پیشرفت‌های بعدی شامل IPO، KTO، ORPO، و SimPO هستند. هر کدام، تغییرات کوچکی در تابع هدف DPO برای حل محدودیت‌های خاص آن اعمال می‌کنند.

Constitutional AI و RLAIF

Constitutional AI (CAI) که توسط Anthropic معرفی شد، رویکردی است که در آن، به‌جای تکیهٔ کامل بر بازخورد انسانی، از یک «قانون اساسی» متنی استفاده می‌شود. مدل، بر اساس این قوانین، پاسخ‌های خود را نقد و اصلاح می‌کند. مزیت: کاهش هزینهٔ بازخورد انسانی و امکان تعریف شفاف قواعد اخلاقی.

RLAIF (Reinforcement Learning from AI Feedback)، نسخهٔ بعدی این رویکرد است که در آن، به‌جای انسان، یک مدل زبانی دیگر (معمولاً قوی‌تر) بازخورد می‌دهد. این رویکرد، مقیاس‌پذیری بالاتری دارد ولی چالش‌های جدیدی مثل هم‌سویی مدل‌ها با یکدیگر به‌همراه می‌آورد.

فصل چهارم: استدلال و زمان تست

شاید بزرگ‌ترین تغییر پارادایم سال ۲۰۲۴، مفهوم «استدلال در زمان استنتاج» (Test-Time Reasoning) باشد. ایدهٔ اصلی: مدل، به‌جای تولید پاسخ مستقیم، چند مرحله استدلال انجام می‌دهد و از این استدلال اضافی، به پاسخ دقیق‌تری می‌رسد.

Chain of Thought و پیامدهای معماری

Chain of Thought (CoT) یا «زنجیرهٔ تفکر»، یک تکنیک ساده است: به‌جای پرسیدن مستقیم از مدل، از آن بخواهید مرحله‌به‌مرحله استدلال کند. مثلاً به‌جای «۵ × ۲۳ چند است؟»، بپرسید «۵ × ۲۳ را مرحله‌به‌مرحله محاسبه کن». در مدل‌های بزرگ، این تکنیک می‌تواند دقت را از ۲۰٪ به ۹۰٪ برساند.

نکتهٔ عمیق: CoT نشان می‌دهد که مدل‌های Transformer، توانایی‌های نهفته دارند که با استنتاج ساده آشکار نمی‌شوند. یعنی «هوش» مدل، بیش از آن‌که در یک پاسخ واحد باشد، در ظرفیت انجام استدلال چندمرحله‌ای است. این یافته، به توسعهٔ Self-Consistency (نمونه‌گیری چندگانه و رأی‌گیری)، Tree of Thoughts (کاوش درخت استدلال)، و Graph of Thoughts (کاوش گراف) منجر شد.

Test-Time Compute: پارادایم جدید

در سال ۲۰۲۴، OpenAI با مدل o1 نشان داد که می‌توان با افزایش محاسبه در زمان استنتاج (Test-Time Compute)، کیفیت مدل را به‌طور معنادار افزایش داد. این یعنی به‌جای صرف بودجهٔ محاسباتی بیشتر روی آموزش (که به دیوار مقیاس برخورده)، همان مدل را با استدلال بیشتر در زمان اجرا قوی‌تر کنیم.

تکنیک‌های کلیدی:

  • Best-of-N: N پاسخ تولید می‌کنیم و بهترین را با Reward Model انتخاب می‌کنیم.
  • Beam Search در فضای استدلال: به‌جای انتخاب یک مسیر، چند مسیر موازی را کاوش می‌کنیم.
  • Self-Refinement: مدل، پاسخ اول را نقد و اصلاح می‌کند.
  • Long-form Reasoning: مدل، با تولید توکن‌های بسیار زیاد (ده‌ها هزار)، به پاسخ می‌رسد.

این پارادایم، بحث‌های عمیقی دربارهٔ مقیاس‌پذیری و کارایی ایجاد کرده. اگر کیفیت، تابعی از Test-Time Compute باشد، ممکن است مدل‌های کوچک‌تر با استنتاج طولانی، از مدل‌های بزرگ‌تر با استنتاج کوتاه بهتر عمل کنند. این پدیده، توسط DeepMind در مقالهٔ «Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters» تحلیل شده.

Process Reward Models

Process Reward Model (PRM)، یک Reward Model است که به‌جای ارزیابی کل پاسخ، هر گام از استدلال را ارزیابی می‌کند. مزیت: در استدلال چندمرحله‌ای، اگر مدل در گام پنجم اشتباه کند، PRM این را تشخیص می‌دهد — در حالی که Outcome Reward Model فقط نتیجهٔ نهایی را می‌بیند.

آموزش PRM، نیاز به داده‌های برچسب‌دار در سطح گام دارد. این داده‌ها معمولاً به‌طور دستی یا با رویکردهای نیمه‌خودکار ساخته می‌شوند. OpenAI در آموزش مدل o1 از PRM به‌طور گسترده استفاده کرده.

درخت جست‌وجوی مونت‌کارلو در LLM

Monte Carlo Tree Search (MCTS)، الگوریتمی است که در AlphaGo استفاده شد. در LLM، ایده این است که درخت استدلال را به‌طور نمونه‌گیری‌شده کاوش کنیم و مسیرهای امیدبخش‌تر را بیشتر بررسی کنیم. این رویکرد، به‌ویژه در وظایف ریاضی و برنامه‌نویسی نتایج خوبی داده.

چالش اصلی: هزینهٔ محاسباتی. MCTS نیاز به ارزیابی هزاران مسیر دارد. راه‌حل‌های فعلی، استفاده از مدل‌های Value کوچک برای هرس درخت و محدودسازی عمق کاوش است.

فصل پنجم: تطبیق کارآمد پارامترها

Parameter-Efficient Fine-Tuning (PEFT)، خانواده‌ای از تکنیک‌ها است که هدفشان تطبیق مدل‌های بزرگ با وظایف جدید بدون آموزش همهٔ پارامترها است.

LoRA، QLoRA و کارایی حافظه

LoRA (Low-Rank Adaptation)، که در سال ۲۰۲۱ توسط Hu و همکارانش در Microsoft معرفی شد، انقلابی در Fine-Tuning ایجاد کرد. ایده: به‌جای به‌روزرسانی همهٔ وزن‌های W، یک ماتریس به‌روزرسانی با رتبهٔ پایین اضافه کنیم:

W' = W + BA

که در آن B و A ماتریس‌هایی با ابعاد بسیار کوچک‌تر از W هستند. اگر W ابعاد (d, k) داشته باشد، B با ابعاد (d, r) و A با ابعاد (r, k) که r << min(d, k). مزیت: تعداد پارامترهای قابل‌آموزش از d×k به (d+k)×r کاهش می‌یابد — که معمولاً یک تا دو مرتبهٔ بزرگی کمتر است.

QLoRA (Quantized LoRA)، توسعهٔ LoRA است که در آن، مدل پایه به ۴ بیت کوانتیزه می‌شود و فقط آداپتورهای LoRA در دقت بالا آموزش می‌بینند. این تکنیک، Fine-Tuning مدل ۷۰ میلیاردی را روی یک GPU با ۴۸ گیگابایت حافظه ممکن می‌کند.

Model Merging: TIES، DARE، Model Soup

Model Merging، یک تکنیک نسبتاً جدید است که در آن، چند مدل Fine-Tuned را با هم ترکیب می‌کنیم تا یک مدل ترکیبی با توانایی‌های متنوع بسازیم — بدون آموزش اضافی.

Model Soup

ساده‌ترین رویکرد: میانگین‌گیری از وزن‌های چند مدل Fine-Tuned. جالب اینکه این کار، معمولاً عملکرد بهتری از هر مدل تک می‌دهد.

TIES (Trim, Elect, Sign)

رویکرد پیشرفته‌تر که سه مرحله دارد: Trim (حذف وزن‌های کم‌اهمیت)، Elect (انتخاب علامت وزن)، و Sign (ادغام با علامت انتخابی). TIES در رفع تعارض بین مدل‌ها مؤثر است.

DARE (Drop And REscale)

رویکردی که بخش بزرگی از دلتاهای وزن را حذف می‌کند و بقیه را مجدداً مقیاس‌بندی می‌کند. نتایج نشان می‌دهد که می‌توان ۹۰٪ از دلتاها را حذف کرد و همچنان عملکرد خوبی داشت.

Model Merging، به‌ویژه برای تیم‌هایی که می‌خواهند توانایی‌های مختلف را در یک مدل جمع کنند، بسیار مفید است. در تجربهٔ من، این تکنیک در پروژه‌هایی که چند کاربرد تخصصی داشتند، تا ۷۰٪ کاهش در هزینهٔ آموزش به‌دنبال داشت.

فصل ششم: مدل‌های چندوجهی

مدل‌های چندوجهی (Multimodal Models)، مدل‌هایی هستند که می‌توانند چند نوع داده (متن، تصویر، صدا، ویدئو) را هم‌زمان پردازش کنند.

CLIP و یادگیری تقابلی چندوجهی

CLIP (Contrastive Language-Image Pre-training)، که در سال ۲۰۲۱ توسط OpenAI معرفی شد، نقطهٔ چرخش این حوزه بود. ایدهٔ اصلی: آموزش هم‌زمان یک Text Encoder و یک Image Encoder، به‌طوری‌که نمایش متن و تصویر مربوطه در فضای نهفته نزدیک باشند. CLIP روی ۴۰۰ میلیون جفت متن-تصویر آموزش دید و قابلیت انتقال (Transfer Learning) قابل توجهی در وظایف بینایی نشان داد.

معماری CLIP، پایهٔ اکثر مدل‌های چندوجهی مدرن است. تفاوت‌های اصلی در Text Encoder (که معمولاً Transformer است)، Image Encoder (که می‌تواند CNN یا ViT باشد)، و روش‌های تقابل (Contrastive) است.

معماری‌های Vision-Language مدرن

سه خانوادهٔ اصلی در معماری‌های Vision-Language Model (VLM):

  • خانوادهٔ Cross-Attention: مشابه Flamingo، که از مکانیزم Cross-Attention برای اتصال بخش بینایی و بخش زبانی استفاده می‌کند.
  • خانوادهٔ Projection-based: مشابه LLaVA، که یک Projection Layer ساده (مثلاً MLP) بین بخش بینایی و بخش زبانی قرار می‌دهد.
  • خانوادهٔ Unified: مشابه Gemini و GPT-4V، که همهٔ مودالیتی‌ها را از ابتدا در یک معماری یکپارچه می‌آموزد.

تفاوت‌های عملی این خانواده‌ها در آموزش، کارایی، و کیفیت انتقال است. LLaVA-style، ساده‌تر و سریع‌تر آموزش می‌بیند، ولی در وظایف پیچیده ممکن است از Unified ضعیف‌تر باشد.

مدل‌های چندوجهی یکپارچه

مدل‌های Unified Multimodal، مانند Gemini 2.5 و GPT-4o، از ابتدا برای پردازش چند مودالیتی طراحی شده‌اند. این معماری‌ها معمولاً از یک رمزگذار مشترک استفاده می‌کنند که همهٔ انواع داده را به یک فضای نهفته مشترک تبدیل می‌کند.

مزیت: قابلیت پردازش cross-modal بهتر. مثلاً مدل می‌تواند از تصویر به کد، از کد به تصویر، یا از متن به ویدئو برود. عیب: پیچیدگی آموزش و نیاز به دادهٔ عظیم.

فصل هفتم: Retrieval-Augmented Generation

Retrieval-Augmented Generation (RAG)، رویکردی است که در آن، مدل زبانی قبل از تولید پاسخ، اطلاعات مربوطه را از یک پایگاه داده بیرونی بازیابی می‌کند. این رویکرد، دو مشکل بنیادین LLM را حل می‌کند: توهم‌زایی (Hallucination) و فقدان دانش تازه.

Retrieval نهفته و معماری‌های برداری

مدرن‌ترین روش‌های RAG، از Retrieval نهفته (Dense Retrieval) استفاده می‌کنند: متن‌ها و پرسش‌ها به بردارهای نهفته تبدیل می‌شوند و شباهت آن‌ها با Cosine Similarity محاسبه می‌شود. مدل‌هایی مثل DPR (Dense Passage Retrieval) و E5 (from Microsoft) در این حوزه پیشرو هستند.

تکنیک‌های کلیدی در Dense Retrieval:

  • Hard Negative Mining: انتخاب نمونه‌های منفی که از نظر معنایی نزدیک به پرسش هستند ولی پاسخ صحیح نیستند.
  • In-batch Negatives: استفاده از نمونه‌های دیگر در همان Batch به‌عنوان نمونه‌های منفی.
  • Cross-Encoder Re-ranking: پس از بازیابی اولیه با Bi-Encoder، از Cross-Encoder برای رتبه‌بندی دقیق‌تر استفاده می‌شود.

GraphRAG و ساختاردهی دانش

GraphRAG، توسعهٔ RAG است که در آن، دانش به‌جای متن خام، به‌صورت گراف ساختاردهی می‌شود. مزیت: امکان پرسش‌های چندمرحله‌ای که نیاز به ترکیب اطلاعات از چند منبع دارند. Microsoft در سال ۲۰۲۴ GraphRAG را به‌طور عمومی معرفی کرد.

فصل هشتم: بهینه‌سازی آموزش

آموزش مدل‌های بزرگ، چالش‌های مهندسی پیچیده‌ای دارد. بهینه‌سازی، در سه سطح اتفاق می‌افتد: الگوریتم بهینه‌سازی، توزیع‌شده بودن، و مدیریت حافظه.

AdamW، Lion، Sophia و Muon

AdamW، بهینه‌ساز استاندارد سال‌های اخیر، بر پایهٔ Adam با یک تغییر کلیدی است: Weight Decay به‌طور مستقل از Gradient محاسبه می‌شود. این تغییر، عملکرد را در مدل‌های بزرگ بهبود می‌دهد.

در سال ۲۰۲۳، Google بهینه‌ساز Lion را معرفی کرد که با استفاده از علامت Gradient (به‌جای مقدار کامل)، مصرف حافظه را کاهش می‌دهد. Lion در مدل‌های تصویری و multimodal نتایج خوبی داده.

Sophia (از Microsoft) از تخمین Hessian برای Adaptive Learning Rate استفاده می‌کند. Muon (از Keller Jordan) از تکنیک Newton-Schulz برای تصویر کردن Gradient به ماتریس متعامد استفاده می‌کند و در آموزش مدل‌های کوچک نتایج چشمگیری می‌دهد.

آموزش توزیع‌شده: ZeRO، FSDP، Tensor Parallel

آموزش مدل‌های بزرگ روی صدها یا هزاران GPU، نیاز به تکنیک‌های توزیع‌شده دارد:

Data Parallelism

هر GPU نسخهٔ کامل مدل را دارد و روی بخشی از Batch آموزش می‌بیند. ساده ولی محدود به اندازهٔ مدل (باید در حافظهٔ یک GPU جای بگیرد).

ZeRO (Zero Redundancy Optimizer)

از Microsoft DeepSpeed. در ZeRO Stage 1، ۲، و ۳، به‌تدریج پارامترهای Optimizer State، Gradient، و پارامترهای مدل بین GPU ها تقسیم می‌شوند. ZeRO-3 اجازه می‌دهد مدل‌های چند صد میلیارد پارامتری روی خوشه‌های معمولی آموزش ببینند.

FSDP (Fully Sharded Data Parallel)

نسخهٔ PyTorch از ZeRO-3. با API ساده‌تر و پشتیبانی از Mixed Precision.

Tensor Parallelism

یک لایهٔ خاص (مثلاً یک Attention Block) بین چند GPU تقسیم می‌شود. مناسب برای مدل‌هایی که یک لایهٔ واحد بزرگ‌تر از حافظهٔ یک GPU است.

Pipeline Parallelism

لایه‌های مختلف مدل بین GPU های مختلف تقسیم می‌شوند. هر GPU یک بخش از مدل را دارد و داده در Pipeline جریان می‌یابد.

Gradient Checkpointing و مدیریت حافظه

Gradient Checkpointing، تکنیکی است که مصرف حافظه را با محاسبهٔ مجدد کاهش می‌دهد. در Forward Pass عادی، همهٔ فعال‌سازی‌ها ذخیره می‌شوند تا در Backward استفاده شوند. در Gradient Checkpointing، فقط بخشی از فعال‌سازی‌ها ذخیره می‌شوند و بقیه در Backward محاسبهٔ مجدد می‌شوند. این تکنیک، مصرف حافظه را تا ۷۰٪ کاهش می‌دهد — با قیمت ۳۰٪ افزایش زمان آموزش.

فصل نهم: کوانتیزه‌سازی و فشرده‌سازی

کوانتیزه‌سازی (Quantization)، فرآیند کاهش دقت نمایش اعداد از FP32/FP16 به دقت‌های پایین‌تر (INT8، INT4، و حتی INT2) است. مزیت: کاهش چشمگیر در حافظه و افزایش سرعت استنتاج.

GPTQ، AWQ، GGUF و معماری‌های نوین

GPTQ

یک روش Post-Training Quantization که وزن‌های مدل را یکی‌یکی کوانتیزه می‌کند و خطا را با به‌روزرسانی وزن‌های باقی‌مانده جبران می‌کند. GPTQ به ۴ بیت کاهش دقت می‌دهد بدون افت محسوس کیفیت.

AWQ (Activation-aware Weight Quantization)

رویکردی که بر اساس اهمیت فعال‌سازی‌ها، وزن‌های مهم‌تر را با دقت بالاتر نگه می‌دارد. AWQ در مدل‌های کوچک تا متوسط عملکرد خوبی دارد.

GGUF

یک فرمت ذخیره‌سازی که در llama.cpp استفاده می‌شود و از کوانتیزه‌سازی با دقت‌های مختلف (از ۲ بیت تا ۸ بیت) پشتیبانی می‌کند. GGUF به‌ویژه برای اجرای مدل‌ها روی CPU و لپ‌تاپ‌ها محبوب است.

Knowledge Distillation

در Knowledge Distillation، یک مدل کوچک (Student) تلاش می‌کند رفتار یک مدل بزرگ (Teacher) را یاد بگیرد. دو نوع distillation:

  • Response-based: Student یاد می‌گیرد خروجی نهایی Teacher را بازتولید کند.
  • Feature-based: Student یاد می‌گیرد نمایش‌های داخلی Teacher را بازتولید کند.

DistilBERT، TinyBERT، و MobileBERT نمونه‌های موفق distillation در حوزهٔ زبانی هستند. در حوزهٔ LLM، مدل‌های کوچک مثل Phi (از Microsoft) با distillation از GPT-4 آموزش دیده‌اند.

Pruning ساختاری و غیرساختاری

Pruning، حذف بخشی از پارامترهای مدل است:

  • Unstructured Pruning: حذف پارامترهای تکی. حفظ کیفیت بیشتر ولی نیاز به پشتیبانی سخت‌افزاری.
  • Structured Pruning: حذف کامل نورون‌ها، فیلترها، یا سرها. کارایی بالاتر ولی با افت کیفیت بیشتر.
  • Sparse Attention Patterns: حذف بخشی از Attention Matrix. در Longformer و BigBird استفاده می‌شود.

در LLM، Pruning معمولاً با Retraining ترکیب می‌شود تا افت کیفیت جبران شود. SparseGPT و Wanda از رویکردهای برجسته در این حوزه هستند.

Speculative Decoding و Medusa

Speculative Decoding، تکنیکی است که سرعت استنتاج را با استفاده از یک مدل کوچک (Draft Model) برای پیشنهاد توکن‌های بعدی، و یک مدل بزرگ برای تأیید پیشنهادها، افزایش می‌دهد. اگر مدل کوچک ۷۰٪ توکن‌ها را درست پیشنهاد دهد، سرعت کل به‌طور قابل توجهی بالا می‌رود.

Medusa، نسخهٔ توسعه‌یافتهٔ این ایده است که به‌جای مدل Draft جداگانه، چند Head اضافه در مدل اصلی قرار می‌دهد که هر Head پیش‌بینی چند توکن آینده را می‌کند. این رویکرد، پیاده‌سازی را ساده‌تر و سرعت را بالاتر می‌برد.

فصل دهم: Diffusion و جریان‌های مولد

Diffusion Models، یکی از بزرگ‌ترین پیشرفت‌های سال‌های اخیر در حوزهٔ تولید تصویر و ویدئو. مبانی این حوزه را در پیشرفت‌های هوش مصنوعی در تصویر و ویدئو به‌طور مفصل باز کرده‌ام؛ در اینجا، جنبه‌های مرتبط با یادگیری ماشین و پیشرفت‌های اخیر را مرور می‌کنم.

Flow Matching: جایگزین احتمالی Diffusion

Flow Matching، رویکردی است که در آن، به‌جای یادگیری معکوس نویز، یک جریان پیوسته از توزیع اولیه به توزیع هدف یاد گرفته می‌شود. مزیت: آموزش ساده‌تر، نمونه‌گیری کارآمدتر، و کیفیت بالاتر. Meta در Movie Gen و Stability AI در Stable Diffusion 3 از Flow Matching استفاده کرده‌اند.

Consistency Models و نمونه‌گیری تک‌گامی

Consistency Models، خانواده‌ای از مدل‌ها هستند که در آن‌ها، یک تابع به‌طور مستقیم نگاشت از نویز به تصویر را یاد می‌گیرد. مزیت: نمونه‌گیری تک‌گامی (بدون نیاز به چند مرحله). Latent Consistency Models (LCM) و SDXL-Turbo نمونه‌های موفق این رویکرد هستند.

فصل یازدهم: یادگیری تقویتی

یادگیری تقویتی (Reinforcement Learning)، در سال‌های اخیر پیشرفت‌های چشمگیری داشته — به‌ویژه در ترکیب با مدل‌های زبانی.

Offline RL و Decision Transformers

Offline RL، زیرشاخه‌ای از RL است که در آن، آموزش فقط روی داده‌های تاریخی (بدون تعامل آنلاین) انجام می‌شود. Decision Transformer، رویکردی است که RL را به‌عنوان یک مسئلهٔ Sequence Modeling فرمول‌بندی می‌کند. مزیت: استفاده از همان ابزارهای ترنسفورمر و پایداری بیشتر از RL کلاسیک.

World Models و شبیه‌سازی شناختی

World Models، مدل‌هایی هستند که یک نمایش داخلی از محیط می‌سازند و می‌توانند رفتار محیط را پیش‌بینی کنند. این ایده در یادگیری تقویتی، امکان آموزش مدل‌ها با شبیه‌سازی داخلی را فراهم می‌کند — بدون نیاز به تعامل مستقیم با محیط واقعی. DreamerV3 (از DeepMind) نمونه‌ای موفق از این حوزه است.

فصل دوازدهم: یادگیری فدرال و حریم خصوصی

Federated Learning، رویکردی است که در آن، مدل روی دستگاه‌های مختلف (بدون انتقال داده) آموزش می‌بیند. این رویکرد، برای سناریوهای حساس به حریم خصوصی (مثل داده‌های پزشکی) حیاتی است.

Differential Privacy: از تئوری تا عمل

Differential Privacy (DP)، چارچوبی ریاضی برای تضمین حریم خصوصی است. ایدهٔ اصلی: خروجی یک الگوریتم، به‌قدر کافی مستقل از حضور هر یک نمونه باشد. برای پیاده‌سازی، معمولاً به Gradient نویز اضافه می‌شود (DP-SGD). چالش اصلی: تعادل بین حریم خصوصی و کیفیت مدل.

معماری‌های Federated Learning

سه معماری اصلی FL:

  • Horizontal FL: دستگاه‌ها با هم روی یک مدل کار می‌کنند ولی داده‌هایشان متفاوت است.
  • Vertical FL: چند سازمان، دادهٔ یک کاربر را بین خودشان تقسیم می‌کنند و مدل مشترک می‌سازند.
  • Federated Transfer Learning: ترکیبی از دو حالت قبلی.

فصل سیزدهم: Graph Neural Networks

Graph Neural Networks (GNN)، خانواده‌ای از مدل‌ها برای پردازش داده‌های گرافی. کاربردها: پیش‌بینی ساختار مولکول، تحلیل شبکه‌های اجتماعی، سیستم‌های توصیه‌گر.

Graph Transformers

Graph Transformer، ترکیبی از GNN و Transformer است که روی گراف کار می‌کند. مزیت: قابلیت انتقال (Transfer Learning) از ترنسفورمرهای استاندارد، و پردازش گراف‌های بزرگ. مثال‌ها: Graphormer (از Microsoft)، GPS (از Google)، و SAN.

فصل چهاردهم: محاسبات نورومورفیک و سخت‌افزار تخصصی

سخت‌افزار تخصصی برای یادگیری ماشین، یکی از جبهه‌های اصلی پیشرفت است:

  • Google TPU: Tensor Processing Unit، پردازندهٔ اختصاصی برای Tensor Operations.
  • Groq LPU: Language Processing Unit، طراحی‌شده برای استنتاج با تأخیر پایین.
  • Cerebras WSE: Wafer-Scale Engine، بزرگ‌ترین تراشه دنیا با میلیون‌ها هسته.
  • Neuromorphic: تراشه‌های الهام‌گرفته از مغز مثل Loihi (Intel) و TrueNorth (IBM) که از Spiking Neural Networks استفاده می‌کنند.

هر کدام از این سخت‌افزارها، مزایا و معایب خودشان را دارند. TPU برای آموزش در مقیاس بزرگ، LPU برای استنتاج real-time، و WSE برای مدل‌های بسیار بزرگ مناسب است.

فصل پانزدهم: یادگیری ماشین کوانتومی

Quantum Machine Learning (QML)، ترکیب محاسبات کوانتومی و یادگیری ماشین. سه حوزهٔ اصلی:

  • Quantum-enhanced classical ML: استفاده از کامپیوترهای کوانتومی برای تسریع الگوریتم‌های ML کلاسیک.
  • Classical-enhanced Quantum ML: استفاده از ML کلاسیک برای طراحی مدارهای کوانتومی بهتر.
  • Quantum-native ML: الگوریتم‌های ML که ذاتاً کوانتومی هستند.

QML امروز یک حوزهٔ تحقیقاتی است، ولی هنوز کاربرد صنعتی واقعی در مقیاس تولیدی پیدا نکرده. چالش‌های اصلی: نویز در Qubit ها، محدودیت تعداد Qubit، و نبود مزیت اثبات‌شده در مسائل واقعی.

فصل شانزدهم: تفسیرپذیری مکانیستی

Mechanistic Interpretability، حوزه‌ای است که تلاش می‌کند مکانیزم داخلی مدل‌های عصبی را بفهمد — نه فقط رفتار خروجی آن‌ها. این حوزه، در سال‌های اخیر توجه زیادی جلب کرده، به‌ویژه به‌دلیل کارهای Anthropic و Google DeepMind.

Sparse Autoencoders و کشف ویژگی‌ها

Sparse Autoencoders (SAEs)، ابزاری هستند که در آن‌ها، فعال‌سازی‌های مدل به یک فضای پرفضا و پراکنده (Sparse) نگاشت می‌شوند. ایده: اگر مدل، ویژگی‌های معنایی را به‌طور پراکنده در فعال‌سازی‌ها ذخیره کند، SAE می‌تواند این ویژگی‌ها را کشف کند. Anthropic در سال ۲۰۲۴ با استفاده از SAEs، میلیون‌ها ویژگی معنایی در Claude 3 Sonnet کشف کرد.

Circuit Analysis در مدل‌های زبانی

Circuit Analysis، رویکردی است که تلاش می‌کند مسیرهای محاسباتی در مدل را به‌صورت گراف مداری مدل‌سازی کند. مثال معروف: «Indirect Object Identification» در GPT-2 Small، که نشان می‌دهد مدل چطور تصمیم می‌گیرد به چه اشاره کند. این تحلیل‌ها، برای درک رفتار مدل و طراحی مدل‌های بهتر ضروری هستند.

فصل هفدهم: استقرار و استنتاج مقیاس‌پذیر

استقرار مدل‌های بزرگ، یکی از چالش‌های اصلی در تولید است. تکنیک‌های کلیدی:

vLLM، PagedAttention و مدیریت حافظه

vLLM از UC Berkeley، یکی از پرکاربردترین فریم‌ورک‌های استنتاج LLM. نوآوری اصلی: PagedAttention، که مدیریت Key-Value Cache را به‌شکل حافظهٔ صفحه‌بندی (Paging) در سیستم‌عامل انجام می‌دهد. نتیجه: مصرف حافظه تا ۷۰٪ کاهش می‌یابد و throughput چند برابر می‌شود.

Continuous Batching و کارایی

Continuous Batching، روشی است که در آن، درخواست‌ها به‌جای پردازش گروهی، به‌طور پیوسته در Batch قرار می‌گیرند. یعنی به‌جای انتظار برای کامل شدن یک Batch، به‌محض خالی شدن یک جای خالی، درخواست جدید اضافه می‌شود. این تکنیک، تأخیر را به‌طور چشمگیر کاهش می‌دهد.

فصل هجدهم: ارزیابی و معیارها

ارزیابی مدل‌های بزرگ، چالشی جدی است. سه مسئلهٔ اصلی:

MMLU، GSM8K، MATH و چالش آلودگی داده

MMLU (Massive Multitask Language Understanding)، یکی از معیارهای پرکاربرد برای سنجش دانش عمومی مدل‌هاست. GSM8K و MATH، برای سنجش توانایی ریاضی. HumanEval و MBPP، برای سنجش کدنویسی.

چالش اصلی: آلودگی داده (Data Contamination). اگر بخشی از داده‌های تست، در داده‌های آموزش بوده باشد، نتایج گمراه‌کننده می‌شوند. روش‌های جدید (مثل N-gram Overlap Detection) تلاش می‌کنند این مسئله را تشخیص دهند ولی کار سختی است.

معیارهای جدیدتر: Chatbot Arena که در آن، دو پاسخ از دو مدل با هم مقایسه می‌شود و رأی انسانی، برنده را تعیین می‌کند. این رویکرد، در برابر آلودگی داده مقاوم‌تر است، ولی هزینه و سوگیری خاص خودش را دارد.

فصل نوزدهم: ایمنی، همسویی و حاکمیت

همسویی (Alignment)، یکی از مهم‌ترین چالش‌های این حوزه است. هدف: اطمینان از اینکه مدل، به‌جای بیشینه‌سازی صرف Reward، واقعاً به نفع انسان عمل می‌کند.

چارچوب‌های حاکمیتی و AI Safety

سه رویکرد اصلی برای ایمنی:

  • RLHF و Constitutional AI: آموزش مدل با بازخورد انسانی و قوانین اخلاقی.
  • Red Teaming: کشف آسیب‌پذیری‌های مدل با تست‌های خصمانه.
  • Scalable Oversight: توسعهٔ روش‌هایی که به انسان امکان می‌دهد مدل‌های پیچیده‌تر از خودش را ارزیابی کند.

در سطح حاکمیتی، اتحادیهٔ اروپا با EU AI Act، آمریکا با Executive Order، و چین با قوانین داخلی، چارچوب‌های مختلفی ارائه کرده‌اند. این چارچوب‌ها، اثر مستقیم روی طراحی و استقرار مدل‌ها دارند.

فصل بیستم: مرزها و مسائل باز

با همهٔ پیشرفت‌ها، این حوزه مسائل باز مهمی دارد:

مسئلهٔ اول: استدلال قابل‌اتکا

مدل‌های امروزی در وظایف استدلالی پیشرفت کرده‌اند، ولی هنوز خطاهای سیستماتیک دارند. آیا با مقیاس بیشتر یا با رویکردهای جدید، می‌توان به استدلال کامل رسید؟ این پرسش، باز است.

مسئلهٔ دوم: حافظهٔ طولانی‌مدت

مدل‌های امروزی، حافظهٔ درون-مکالمه دارند ولی حافظهٔ بلندمدت (بین مکالمات) ندارند. برخی تلاش‌ها با Memory Layer ها و Memory-Augmented Models در جریان است، ولی هنوز به بلوغ نرسیده.

مسئلهٔ سوم: یادگیری پیوسته

مدل‌ها امروز یک‌بار آموزش می‌بینند و سپس ثابت می‌مانند. یادگیری پیوسته (Continual Learning) — یعنی مدلی که با تجربهٔ جدید به‌طور پیوسته بهتر می‌شود — یکی از مسائل حل‌نشدهٔ این حوزه است. چالش اصلی: Catastrophic Forgetting، یعنی فراموشی دانش قبلی هنگام یادگیری داده‌های جدید.

مسئلهٔ چهارم: هوش عمومی

پرسش بزرگ: آیا مدل‌های زبان، مسیر رسیدن به AGI هستند یا یک بن‌بست؟ پاسخ قطعی وجود ندارد، ولی تجربهٔ من می‌گوید هنوز چیزهای زیادی وجود دارد که نمی‌دانیم. مسیر پیش رو، احتمالاً ترکیبی از معماری‌های جدید، پارادایم‌های آموزشی جدید، و درک عمیق‌تر از ماهیت هوش است.

اگر به روند بلندمدت این حوزه علاقه دارید، مراجع آینده یادگیری ماشین و تفاوت یادگیری ماشین و هوش مصنوعی دید خوبی می‌دهند. برای کاربردهای عملی، کاربردهای یادگیری ماشین در کسب و کار و یادگیری ماشین در پردازش زبان طبیعی دو مرجع عملی‌تر هستند. برای شروع یادگیری، چگونه یادگیری ماشین را شروع کنیم نقطهٔ شروع است و برای درک چالش‌های عملی، چالش‌های پیاده‌سازی یادگیری ماشین مفید است. اگر به دنبال درک مبانی هستید، انواع یادگیری ماشین و یادگیری نظارت‌شده و بدون نظارت دو مرجع بنیادین‌اند. و برای درک ابزارهای این حوزه، ابزارهای یادگیری ماشین و الگوریتم‌های محبوب یادگیری ماشین دید عملی ارائه می‌دهند.

خط پایان: نقشهٔ راه پیش رو

پیشرفت‌های جدید در یادگیری ماشین، در پنج سال گذشته، این حوزه را از یک ابزار آماری به یک پلتفرم عمومی هوش تبدیل کرده. این تحول، در سه محور اصلی رخ داده: معماری (از Transformer خالص به MoE، SSM، و ترکیبی)، پارادایم آموزش (از پیش‌آموزش ساده به زنجیرهٔ پیچیدهٔ Self-Supervised + RLHF + Reasoning)، و فشرده‌سازی (از مدل‌های بزرگ به مدل‌های کارآمد و استدلالی).

از دید مهندسی، موفقیت در این حوزه به سه چیز بستگی دارد: درک عمیق معماری‌ها (نه سطحی)، توانایی مدیریت پیچیدگی سیستم‌های توزیع‌شده، و دید راهبردی به تحولات این حوزه. تیم‌هایی که این سه را دارند، در مسابقهٔ پیوستهٔ این حوزه پیشرو خواهند بود. تیم‌هایی که فقط یکی را دارند، دیر یا زود در یکی از سه جبهه عقب می‌مانند.

این مقاله، تلاشی بود برای ارائهٔ تصویری فنی و جامع از پیشرفت‌های اخیر. اگر در پروژه‌ای با چالشی خاص در این حوزه روبه‌رو شده‌اید — مثلاً مدیریت MoE در مقیاس تولید، یا استقرار مدل‌های استدلالی با هزینهٔ پایین — تجربه‌تان را در دیدگاه بنویسید. این نوع دادهٔ واقعی، برای خوانندهٔ بعدی که در همان موقعیت ایستاده، از هر مقالهٔ تئوریک ارزشمندتر است. 🧬