سال ۲۰۱۴ که Ian Goodfellow و همکارانش در Université de Montréal مقالهٔ Generative Adversarial Networks را منتشر کردند، تصور نمی‌کردم یک دهه بعد، همان ایدهٔ سادهٔ رقابت بین دو شبکه، به ستون فقرات صنعتی تبدیل شود که ارزش بازار آن به صدها میلیارد دلار برسد. اما آنچه در این سال‌ها یاد گرفته‌ام این است: هوش مصنوعی مولد (Generative AI) یک جادوی واحد نیست؛ خانواده‌ای از معماری‌های ریاضی است که هر کدام توزیع احتمال داده را به شکل متفاوتی مدل می‌کنند. هدف این متن، عبور از سطح تیتر اخبار و ورود به لایه‌هایی است که مهندسان ارشد هنگام طراحی سیستم‌های مبتنی بر مدل‌های زبانی بزرگ با آن‌ها دست‌وپنجه نرم می‌کنند.

اگر با پایه‌های machine learning آشنا نیستید، پیشنهاد می‌کنم ابتدا یادگیری ماشین چیست و چگونه کار می‌کند را مرور کنید. اما اگر با backpropagation، توزیع احتمال و gradient descent راحت هستید، این متن را می‌توانید بدون وقفه دنبال کنید.

هوش مصنوعی مولد چیست؟ تعریف فنی و مرزهای آن

در ساده‌ترین تعریف، هوش مصنوعی مولد به خانواده‌ای از مدل‌های آماری گفته می‌شود که هدفشان یادگیری توزیع احتمال داده‌های آموزشی است تا بتوانند نمونه‌های جدیدی از همان توزیع تولید کنند. اگر با نماد ریاضی بیان کنیم، مدل مولد تابعی مثل p(x) را تقریب می‌زند که در آن x می‌تواند یک تصویر، یک متن، یک قطعه کد یا یک مولکول باشد. این تعریف، تفاوت بنیادی آن با مدل‌های تشخیصی (Discriminative) را روشن می‌کند: مدل تشخیصی p(y|x) را یاد می‌گیرد تا ورودی را دسته‌بندی کند؛ مدل مولد p(x) یا p(x|y) را می‌آموزد تا خودِ داده را بازتولید کند. تفاوت‌های عملی این دو خانواده در هوش مصنوعی مولد در برابر هوش مصنوعی سنتی با مثال‌های کاربردی شرح داده شده است.

مرز مولد بودن، مرز روشنی است: هر سیستمی که فقط برچسب می‌زند، خوشه‌بندی می‌کند یا پیش‌بینی عددی می‌کند، مولد نیست. مولد یعنی سیستم بتواند نمونه‌ای تولید کند که در مجموعهٔ آموزشی وجود نداشته باشد، اما از نظر آماری به آن شبیه باشد. این تعریف دقیقاً همان چیزی است که در ادبیات Bayesian به آن density estimation می‌گویند و پایهٔ ریاضی تمام معماری‌های امروزی است.

سه خانوادهٔ اصلی معماری مولد امروز وجود دارد که هر کدام از یک استراتژی متفاوت برای تقریب p(x) استفاده می‌کنند. مدل‌های autoregressive که توزیع مشترک را به حاصل‌ضرب توزیع‌های شرطی تجزیه می‌کنند، مدل‌های latent variable مثل VAE که یک متغیر نهان z را وارد می‌کنند و p(x) را به انتگرال روی z تبدیل می‌کنند، و مدل‌های score-based و diffusion که از فرآیند تصادفی برای یادگیری گرادیان log-density استفاده می‌کنند. درک تفاوت این سه خانواده، کلید فهم این است که چرا یک مدل زبانی بزرگ با یک مدل تصویری بزرگ تفاوت‌های معماری چشمگیری دارند، هرچند هر دو مولد هستند. اگر علاقه‌مندید ببینید این معماری‌ها چطور در تصمیم‌گیری agentها ظاهر می‌شوند، نحوهٔ تصمیم‌گیری agentهای هوش مصنوعی را ببینید.

هوش مصنوعی مولد یک سیستم دانش نیست؛ یک سیستم توزیع احتمالاتی است. تفاوت این دو نگاه، تمام تفاوت بین یک دایرة‌المعارف و یک نویسنده است.

تکامل تاریخی: از VAE و GAN تا Transformer و Diffusion

مسیر تاریخی هوش مصنوعی مولد، مسیر جستجوی مدل‌هایی است که بتوانند توزیع‌های با ابعاد بالا را تقریب بزنند، بدون اینکه به curse of dimensionality سقوط کنند. در دههٔ ۲۰۱۰، دو معماری اولین پیشرفت‌های جدی را رقم زدند. Variational Autoencoder که Diederik Kingma و Max Welling در ۲۰۱۳ معرفی کردند، یک شبکهٔ encoder-decoder بود که در فضای نهان یک توزیع گاوسی تقریب می‌زد. مزیت آن یک هدف آموزش صریح (ELBO) بود؛ ضعف آن کیفیت نسبتاً پایین نمونه‌ها. GAN که Ian Goodfellow در ۲۰۱۴ معرفی کرد، به‌جای مدل‌سازی صریح density، یک بازی min-max بین generator و discriminator طراحی کرد که منجر به تصاویر بسیار واقع‌گرایانه شد. اما GANها به دو مشکل دیرینه دچار بودند: mode collapse و ناپایداری آموزش.

نقطهٔ عطف واقعی، مقالهٔ Attention Is All You Need از Ashish Vaswani و همکارانش در Google Brain در سال ۲۰۱۷ بود. این مقاله، معماری Transformer را معرفی کرد که مبتنی بر self-attention بود و برخلاف RNN و LSTM، امکان موازی‌سازی کامل در طول توالی را فراهم می‌کرد. اما نکتهٔ عمیق‌تر این بود که Transformer یک inductive bias متفاوت به مدل تحمیل می‌کرد: به‌جای فرض توالی‌بودن یا ترجمه‌ناوردایی (translation invariance)، فرض می‌کرد که روابط بین عناصر باید از داده یاد گرفته شوند. همین انعطاف بود که باعث شد Transformer در دههٔ بعد به ستون فقرات تقریباً همهٔ مدل‌های مولد تبدیل شود. اگر با مسیر تحول این معماری در مدل‌های زبانی آشنا نیستید، مدل‌های زبانی بزرگ و انقلاب آن‌ها را بخوانید.

موج دوم در سال ۲۰۲۰ آمد، زمانی که Jonathan Ho و همکارانش در UC Berkeley مقالهٔ Denoising Diffusion Probabilistic Models را منتشر کردند. این مقاله یک ایدهٔ قدیمی از Sohl-Dickstein در ۲۰۱۵ را احیا کرد: به‌جای تولید مستقیم داده، یک فرآیند forward تعریف شود که داده را به‌تدریج با نویز گاوسی خراب کند، و بعد یک شبکهٔ عصبی آموزش ببیند که این فرآیند را معکوس کند. این ایده در ابتدا به‌خاطر هزینهٔ نمونه‌گیری (چند صد تا چند هزار قدم) کند به نظر می‌رسید، اما Yang Song و همکارانش با چارچوب score-based SDE و بعدها مقالهٔ DDIM از Jiaming Song، سرعت نمونه‌گیری را به حدی رساندند که در عمل قابل استفاده شد. موج سوم در سال ۲۰۲۲ با انتشار Stable Diffusion توسط Robin Rombach و همکارانش در LMU Munich و Stability AI رقم خورد، که نمایش diffusion را از فضای پیکسل به فضای نهان VAE منتقل کرد و هزینهٔ محاسباتی را چند مرتبه کاهش داد.

سالنقطهٔ عطفمحقق شاخصسهم فنی
۲۰۱۳VAEKingma و Wellingحساب تغییراتی و فضای نهان پیوسته
۲۰۱۴GANIan Goodfellowآموزش رقابتی بدون density صریح
۲۰۱۷TransformerVaswani و همکارانSelf-attention و موازی‌سازی کامل
۲۰۲۰DDPMJonathan HoDiffusion احتمالاتی با denoising
۲۰۲۲Latent DiffusionRobin RombachDiffusion در فضای نهان

معماری Transformer در عمق: از attention تا feed-forward

برای مهندس ارشد، فهم Transformer از سطح attention شروع می‌شود. در هستهٔ این معماری، یک عملیات به‌نام Scaled Dot-Product Attention وجود دارد که در فرم ساده به‌صورت زیر بیان می‌شود:

Attention(Q, K, V) = softmax(Q @ K.T / sqrt(d_k)) @ V

در اینجا Q ماتریس query، K ماتریس key و V ماتریس value است. d_k بعد فضای نهان هر head است. تقسیم بر sqrt(d_k) به‌خاطر جلوگیری از اشباع softmax در ابعاد بالا انجام می‌شود؛ اگر این نرمال‌سازی حذف شود، gradients در طول آموزش بسیار کوچک می‌شوند و یادگیری مختل می‌شود. اما نکتهٔ ظریفی که در پیاده‌سازی‌های سطحی گم می‌شود این است که self-attention در Transformer یک عملیات permutation-equivariant است. این یعنی اگر ترتیب توکن‌ها را تغییر دهید، خروجی attention بدون positional encoding هم‌چنان همان مجموعهٔ وزنی را می‌دهد. به همین دلیل positional encoding از نوع sinusoidal یا learned یا rotary (RoPE) ضروری است، و انتخاب نوع آن اثر مستقیم بر تعمیم طول context دارد. این جزئیات معماری، پایهٔ تفاوت رفتار مدل‌های زبانی در وظایف long-context است و در مدل‌های زبانی بزرگ با جزئیات بیشتری باز شده است.

Multi-Head Attention که به‌طور موازی چند attention را با projectionهای مختلف اجرا می‌کند، به مدل اجازه می‌دهد همزمان به روابط نحوی، معنایی و بلندمدت توجه کند. هر head یک زیرفضای متفاوت از بازنمایی را می‌آموزد و نتایج در انتها concat می‌شوند. از نظر تئوری، این طراحی به مدل قدرت بیان بیشتری می‌دهد، اما در عمل مشاهده شده که با افزایش تعداد headها، بازده کاهش می‌یابد و برخی headها تخصصی‌تر از بقیه عمل می‌کنند؛ پدیده‌ای که به آن head pruning گفته می‌شود.

بخش feed-forward در Transformer معمولاً یک شبکهٔ دو لایه با activation غیرخطی مثل GELU یا SwiGLU است. جالب است که در سال‌های اخیر، پژوهش‌ها نشان داده‌اند بخش عمدهٔ دانش واقعی مدل در همین لایه‌های feed-forward ذخیره می‌شود، نه در attention. تفسیرپذیری این لایه‌ها به حوزه‌ای فعال به‌نام mechanistic interpretability تبدیل شده که در آن محققانی مثل Chris Olah در Anthropic و Neel Nanda در DeepMind نقش کلیدی دارند.

Transformer در ظاهر یک معماری است؛ در عمق، یک فرضیه دربارهٔ ماهیت بازنمایی است: هر رابطه‌ای که در داده وجود دارد، قابل کشف با نگاشت‌های خطی در فضایی با ابعاد کافی است.

مدل‌های Diffusion و فرآیند معکوس denoising

در Diffusion، داده x_0 از توزیع واقعی به‌تدریج با نویز خراب می‌شود تا در نهایت به نویز خالص گاوسی تبدیل شود. این فرآیند forward با پارامتر β_t کنترل می‌شود و در فرم بسته به‌صورت زیر نوشته می‌شود:

x_t = sqrt(alpha_bar_t) * x_0 + sqrt(1 - alpha_bar_t) * epsilon
where alpha_bar_t = product of (1 - beta_i) for i = 1..t

شبکهٔ عصبی در Diffusion آموزش می‌بیند که با دیدن x_t و گام زمانی t، نویز ε را پیش‌بینی کند. این فرمول‌بندی که به آن epsilon-prediction می‌گویند، در DDPM (Denoising Diffusion Probabilistic Models) معرفی شد و اساس تقریباً همهٔ مدل‌های تصویری مدرن است. اما همان‌طور که Jonathan Ho خودش بارها اشاره کرده، انتخاب پارامتربندی اهمیت تعیین‌کننده‌ای دارد. در مقالهٔ بعدی که در سال ۲۰۲۲ منتشر شد، پیش‌بینی v (velocity) به‌عنوان جایگزینی برای epsilon-prediction پیشنهاد شد که پایداری آموزش در سطوح بالای نویز را بهبود می‌دهد. چارچوب کامل این پیشرفت‌ها در چگونگی ساخت تصاویر واقع‌گرایانه با هوش مصنوعی مولد توضیح داده شده است.

فرآیند معکوس، که در آن مدل از نویز خالص شروع می‌کند و تدریجاً یک نمونهٔ تمیز می‌سازد، در ابتدا چند صد گام نیاز داشت. اما DDIM که توسط Jiaming Song و Stefano Ermon در Stanford معرفی شد، نشان داد می‌توان با گام‌های بزرگ‌تر و تعیین‌گرایانه‌تر، همان کیفیت را در چند ده گام به دست آورد. بعدتر، الگوریتم‌های samplers مثل DPM-Solver و Heun که توسط Cheng Lu و همکارانش در Tsinghua توسعه یافتند، تعداد گام‌ها را به محدودهٔ ۱۵ تا ۳۰ رساندند. این سرعت‌بخشی، تفاوت بین یک سیستم آزمایشگاهی و یک محصول واقعی است که در آن کاربر نمی‌تواند دو دقیقه برای یک تصویر صبر کند.

مدل‌های Diffusion هم‌چنین از یک مفهوم مهم به‌نام classifier-free guidance استفاده می‌کنند که توسط Jonathan Ho و Tim Salimans در ۲۰۲۲ معرفی شد. در این تکنیک، مدل هم با شرط (prompt) و هم بدون شرط آموزش می‌بیند و هنگام نمونه‌گیری، خروجی این دو حالت با یک ضریب guidance ترکیب می‌شود. این تکنیک باعث می‌شود مدل بتواند بین وفاداری به prompt و تنوع نمونه‌ها تعادل برقرار کند. مقدار guidance scale یک ابرپارامتر کلیدی است که تجربه نشان داده در محدودهٔ ۷ تا ۱۲ بهترین نتیجه را می‌دهد و بیرون از آن، یا نمونه‌ها اشباع‌شده و کم‌تنوع می‌شوند یا به prompt بی‌اعتنا می‌مانند. نمونه‌هایی از کاربردهای پیشرفتهٔ این تکنیک در طراحی و ویدئو در هوش مصنوعی مولد در ویدئو و صدا بررسی شده است.

Pipeline آموزش: pretraining، SFT، RLHF و DPO

پشت هر مدل زبانی بزرگ تجاری، یک pipeline چندمرحله‌ای پیچیده وجود دارد که عدم درک درست آن، منبع بسیاری از سوءبرداشت‌ها دربارهٔ رفتار مدل است. مرحلهٔ اول pretraining است: مدل روی مجموعه‌ای از تریلیون‌ها توکن متن آموزش می‌بیند و هدفش پیش‌بینی توکن بعدی است. این مرحله ماه‌ها روی هزاران GPU اجرا می‌شود و هزینهٔ آن به ده‌ها میلیون دلار می‌رسد. مقالهٔ GPT-3 از Tom Brown و همکارانش در OpenAI نشان داد که با بزرگ‌کردن مقیاس، مدل‌ها توانایی‌های emergent پیدا می‌کنند که در مدل‌های کوچک‌تر وجود نداشت. اما این توانایی‌ها همیشه هم مطلوب نیستند؛ بخش قابل‌توجهی از تحقیقات alignment به این اختصاص یافته که چطور می‌توان از این توانایی‌های emergent به‌نفع کاربر استفاده کرد.

مرحلهٔ دوم Supervised Fine-Tuning یا SFT است. در این مرحله، مدل روی مجموعه‌ای از نمونه‌های دست‌چین‌شدهٔ input-output آموزش می‌بیند که توسط annotatorهای انسانی تولید شده‌اند. SFT رفتار پایهٔ مدل را از تکمیل متن به پاسخ‌دهی به سؤال تغییر می‌دهد. اما SFT به‌تنهایی کافی نیست، چون نمی‌تواند ترجیحات ظریف انسانی مثل مفید بودن، بی‌طرفی و ایمنی را به‌طور کامل منتقل کند. اینجاست که مرحلهٔ سوم، Reinforcement Learning from Human Feedback یا RLHF، وارد می‌شود.

در RLHF، ابتدا یک reward model با مقایسهٔ جفت پاسخ‌های تولیدشده توسط مدل و رأی انسانی آموزش داده می‌شود. سپس خود مدل با الگوریتم PPO که توسط John Schulman و همکارانش در OpenAI توسعه یافت، بر اساس این reward model بهینه می‌شود. این الگو در InstructGPT و بعدتر ChatGPT به کار رفت. اما RLHF دو ضعف دارد: اول، هزینهٔ آموزش reward model و حساسیت آن به نحوهٔ جمع‌آوری داده؛ دوم، instability ذاتی PPO که گاهی مدل را به سمت reward hacking می‌برد. این مشکلات باعث شد روش DPO که توسط Rafael Rafailov و همکارانش در Stanford در ۲۰۲۳ معرفی شد، به سرعت جایگزین شود. در DPO، مسئلهٔ RLHF به یک مسئلهٔ classification ساده تبدیل می‌شود و نیازی به reward model جداگانه نیست. این سادگی، آموزش alignment را برای تیم‌های متوسط دسترس‌پذیرتر کرده است. بحث تفاوت‌های این روش‌ها در سطح عملی، بخش جدایی‌ناپذیر از فهم امروز هوش مصنوعی مولد است.

استراتژی‌های نمونه‌گیری و پارامترهای دیکدینگ

بعد از آموزش، سؤال اساسی این است که مدل چطور از توزیع احتمال پیش‌بینی‌شده نمونه بگیرد. در حالت autoregressive، مدل در هر گام یک توزیع احتمال روی واژگان تولید می‌کند. greedy decoding یعنی انتخاب توکن با بالاترین احتمال، که به متن‌های تکراری و خسته‌کننده منجر می‌شود. beam search با نگه‌داشتن چند مسیر موازی، احتمال شرطی کل توالی را بهینه می‌کند اما در تولید باز نمی‌تواند خلاقیت نشان دهد، چون دنبال احتمال بیشینه است.

روش‌های sampling تصادفی با تنظیم temperature، توزیع logits را تخت یا تیز می‌کنند. temperature نزدیک به صفر معادل greedy است و temperature بالای ۱ به تنوع بیش‌ازحد و بی‌معنایی می‌انجامد. top-k sampling که توسط Angela Fan و همکارانش در Facebook AI Research در ۲۰۱۸ معرفی شد، انتخاب را به k توکن با بالاترین احتمال محدود می‌کند. اما top-p یا nucleus sampling که Ari Holtzman و همکارانش در ۲۰۲۰ معرفی کردند، محدودیت را بر اساس جرم تجمعی تعیین می‌کند و به همین دلیل پایداری بیشتری در طول‌های مختلف توزیع دارد. این روش امروز استاندارد تقریبی همهٔ APIهای تجاری است و انتخاب مقدار p معمولاً در محدودهٔ ۰.۹ تا ۰.۹۵ انجام می‌شود.

در سال‌های اخیر، روش‌های جدیدتری مثل min-p sampling که توسط Minh Nguyen و همکارانش در ۲۰۲۴ پیشنهاد شد، به‌جای جرم تجمعی، از نسبت احتمال توکن بیشینه استفاده می‌کند و ادعا می‌کند در temperatureهای بالا نتایج بهتری می‌دهد. اما نکته‌ای که در عمل اهمیت دارد این است که انتخاب پارامترهای sampling باید بر اساس نوع کار انجام شود. برای تولید کد، temperature پایین و top-p محدودتر لازم است؛ برای نوشتن خلاقانه، temperature بالاتر و top-p بازتر. این تنظیمات در بهترین ابزارهای هوش مصنوعی مولد معمولاً به‌صورت پیش‌فرض وجود دارند اما اغلب کاربران از اثر آن‌ها بر کیفیت خروجی بی‌خبرند.

فضای نهان و هندسهٔ بازنمایی

یکی از مفاهیمی که در هوش مصنوعی مولد بارها با آن روبه‌رو می‌شویم، فضای نهان یا latent space است. در VAE و Diffusion latent، مدل داده را به یک فضای پیوسته و کم‌بعدتر نگاشت می‌کند که در آن عملیات ساده‌تر انجام شود. در مدل‌های زبانی بزرگ، فضای نهان در هر لایه یک بازنمایی با ابعاد هزاران است و conceptهای پیچیده در این فضا به‌صورت جهت‌های برداری ظاهر می‌شوند. پژوهش‌های اخیر نشان داده‌اند که این فضا ساختار هندسی قابل‌تفسیری دارد: مثلاً در فضای نهان یک مدل زبانی، بردار تفاوت بین کلمات مرتبط با جنسیت یا با زمان، جهت ثابتی دارد. این یافته، پایهٔ تکنیک‌هایی مثل activation steering و representation engineering است که امروز در Anthropic و DeepMind فعالانه دنبال می‌شود.

مفهوم latent space در سیستم‌های retrieval-augmented هم حیاتی است. وقتی از RAG استفاده می‌کنید، اسناد به embedding تبدیل می‌شوند و در فضای نهان جستجو می‌شوند. کیفیت embedding، مستقیماً کیفیت retrieval را تعیین می‌کند. اگر با این معماری آشنا نیستید، RAG چیست و چرا دقت مدل‌ها را بالا می‌برد را ببینید.

تفاوت بین یک مدل مولد کارآمد و یک مدل ناکارآمد، در تعداد پارامتر نیست؛ در ساختار هندسی فضای نهان آن است که با چه inductive bias و چه هدف آموزشی ساخته شده.

بنچمارک‌ها، آمار و چهره‌های شاخص این حوزه

سنجش پیشرفت مدل‌های مولد، خود حوزه‌ای است که در سال‌های اخیر به بلوغ قابل‌توجهی رسیده. بنچمارک MMLU که توسط Dan Hendrycks و همکارانش در UC Berkeley در ۲۰۲۰ معرفی شد، تا مدت‌ها معیار استاندارد ارزیابی دانش مدل‌های زبانی بود. اما با اشباع آن توسط مدل‌های پیشرفته، جایگزین‌هایی مثل MMLU-Pro با ۱۲٬۰۳۲ سؤال دشوارتر و GPQA با سؤالات سطح دکتری مطرح شدند. در حوزهٔ کد، HumanEval که توسط Mark Chen و همکارانش در OpenAI معرفی شد، و بعدتر SWE-bench از Princeton که توسط Carlos Jimenez و همکارانش طراحی شد، معیار ارزیابی توانایی برنامه‌نویسی شدند.

آمار adoption و روند رشد صنعت در سال ۲۰۲۵ نشان می‌دهد که ۷۸ درصد از سازمان‌ها در حداقل یک عملکرد از هوش مصنوعی مولد استفاده می‌کنند. اما آنچه کمتر گزارش می‌شود این است که بیش از نیمی از این استفاده‌ها در سطح proof of concept باقی مانده و به تولید نرسیده. سرمایه‌گذاری جهانی روی زیرساخت هوش مصنوعی در سال ۲۰۲۵ از مرز ۵۰۰ میلیارد دلار گذشته و پیش‌بینی می‌شود تا ۲۰۲۸ به دو تریلیون دلار برسد. اما این سرمایه‌گذاری بیشتر در لایهٔ زیرساخت متمرکز است تا در لایهٔ کاربرد، که خودش نشان‌دهندهٔ عدم بلوغ لایهٔ کاربردی است.

در سطح چهره‌های شاخص، نمی‌توان از Geoffrey Hinton و Yann LeCun و Yoshua Bengio که جایزهٔ Turing 2018 را برای کارهای بنیادی در یادگیری عمیق دریافت کردند، بی‌توجه گذشت. Ilya Sutskever که یکی از معماران GPT و از بنیان‌گذاران OpenAI و بعدتر SSI (Safe Superintelligence) است، نقش کلیدی در مسیر research این حوزه داشته. Dario Amodei از Anthropic که خود از OpenAI آمده، رهبری تحقیقات alignment و mechanistic interpretability را در اختیار دارد. در حوزهٔ diffusion، Jonathan Ho، Yang Song، Jiaming Song و Robin Rombach نقش‌آفرینان اصلی هستند. Fei-Fei Li از Stanford که با ImageNet پایهٔ انقلاب بینایی کامپیوتری را گذاشت، امروز در حوزهٔ spatial intelligence فعالیت می‌کند. در ایران هم پژوهشگران در دانشگاه‌های صنعتی شریف، تهران و امیرکبیر در حوزهٔ NLP و بینایی کامپیوتری مقالات قابل‌توجهی منتشر می‌کنند، هرچند زیرساخت محاسباتی محدودیت اصلی آن‌هاست.

یکی از بحث‌های جاری که مستقیم به آیندهٔ این حوزه مربوط است، شکاف بین مقیاس‌پذیری و کارایی است. مدل‌هایی مثل Mixture of Experts (MoE) که در آن‌ها فقط بخشی از پارامترها در هر forward pass فعال می‌شوند، امکان ساخت مدل‌های بزرگ‌تر با هزینهٔ محاسباتی کمتر را فراهم کرده‌اند. این معماری که توسط Noam Shazeer و همکارانش در Google در ۲۰۱۷ معرفی شد، امروز در مدل‌هایی مثل Gemini و Mixtral استفاده می‌شود.

چالش‌های باقی‌مانده و شکاف استدلال

با تمام پیشرفت‌ها، مدل‌های مولد امروز همچنان در چند زمینه شکاف‌های بنیادی دارند. اولین و شناخته‌شده‌ترین، hallucination است: مدل با اطمینان کامل چیزی تولید می‌کند که وجود ندارد. علت ریشه‌ای این پدیده در این است که مدل به‌جای به‌خاطر سپردن حقایق، توزیع احتمال زبان را یاد می‌گیرد. راه‌حل‌های فعلی مثل RAG و tool use، فقط لایه‌ای بیرونی روی این مشکل می‌گذارند؛ حل بنیادی آن نیازمند معماری‌های جدید است.

چالش دوم، reasoning چندمرحله‌ای است. مدل‌های autoregressive در طول‌های کوتاه خوب عمل می‌کنند، اما در استدلال‌های چندگامی که نیاز به نگه‌داشتن state طولانی دارند، خطای تجمعی ظاهر می‌شود. روش‌هایی مثل Chain-of-Thought و Tree-of-Thought این مشکل را تا حدی کاهش داده‌اند، اما همچنان در مسائلی مثل ریاضیات رقابتی و برنامه‌نویسی الگوریتمی، شکاف محسوسی با انسان وجود دارد.

چالش سوم، محدودیت‌های اخلاقی و حقوقی است. مدل‌های مولد روی داده‌ای آموزش می‌بینند که غالباً از منابع عمومی جمع‌آوری شده و در بسیاری موارد مسئلهٔ حق مؤلف دربارهٔ آن حل نشده است. پروندهٔ حقوقی نیویورک تایمز علیه OpenAI و Microsoft، و پرونده‌های مشابه در حوزهٔ تصویر و موسیقی، نمونه‌هایی از این تنش هستند. در سطح سازمانی، پیروی از قوانین AI Act اروپا که در ۲۰۲۴ تصویب شد، برای شرکت‌هایی که مدل‌های مولد را در اتحادیهٔ اروپا مستقر می‌کنند اجباری است. جنبه‌های اخلاقی این حوزه در اخلاقیات استفاده از هوش مصنوعی مولد به تفصیل بررسی شده است.

چهارمین چالش که کمتر بحث می‌شود، محدودیت محاسباتی است. هزینهٔ آموزش مدل‌های frontier در سال ۲۰۲۴ به ده‌ها میلیون دلار رسیده و هزینهٔ inference در مقیاس صنعتی هم قابل‌توجه است. این فشار محاسباتی، هم محدودیت زیست‌محیطی ایجاد کرده و هم نابرابری دسترسی را افزایش داده؛ چون فقط تعداد محدودی از شرکت‌ها توان مالی رقابت در frontier را دارند. این مسئله در محدودیت‌های هوش مصنوعی مولد با نگاه عملی‌تر تحلیل شده است.

پرسش‌های متداول دربارهٔ هوش مصنوعی مولد

تفاوت هوش مصنوعی مولد با مدل‌های تشخیصی چیست؟ مدل‌های تشخیصی برچسب می‌زنند یا دسته‌بندی می‌کنند؛ مدل‌های مولد نمونهٔ جدید تولید می‌کنند. از نظر ریاضی، اولی p(y|x) را یاد می‌گیرد و دومی p(x). این تفاوت، در هزینهٔ آموزش، اندازهٔ مدل و کاربرد عملی آن‌ها اثر مستقیم دارد.

آیا هوش مصنوعی مولد واقعاً می‌فهمد یا فقط الگو کپی می‌کند؟ پاسخ دقیق این سؤال همچنان موضوع بحث است. شواهد نشان می‌دهد مدل‌ها در برخی وظایف رفتار شبیه به فهم نشان می‌دهند و در وظایف دیگر شکست‌های نظام‌مند دارند که با فهم سازگار نیست. بهترین چارچوب مفهومی فعلی این است که مدل‌ها یک فشرده‌سازی آماری از داده ساخته‌اند که در مواردی با فهم هم‌راستا است و در مواردی صرفاً الگوهای سطحی را بازتولید می‌کند.

حالا که Transformer اشباع شده، معماری بعدی چیست؟ معماری‌های جایگزین مثل State Space Models (Mamba از Albert Gu و Tri Dao)، RWKV و RetNet در حال توسعه هستند و هر کدام trade-off متفاوتی بین کیفیت، حافظه و موازی‌سازی ارائه می‌دهند. اما هیچ‌کدام تا این لحظه به‌طور کامل جایگزین Transformer نشده‌اند و احتمالاً در آیندهٔ نزدیک شاهد معماری‌های هیبرید خواهیم بود.

چقدر طول می‌کشد تا یک تیم متوسط یک مدل مولد سفارشی بسازد؟ برای fine-tune کردن یک مدل متن‌باز روی دامنهٔ خاص، با ۴ GPU مدرن و چند هفته کار مهندسی امکان‌پذیر است. اما ساخت یک مدل پایه از صفر، حداقل چند میلیون دلار و چند ماه کار یک تیم بزرگ متخصص نیاز دارد. بنابراین برای اکثر پروژه‌های تجاری، fine-tune یا RAG مسیر عملی‌تری است.

نقش human feedback در مدل‌های تصویری چطور پیاده می‌شود؟ در مدل‌های تصویری، به‌جای RLHF از روش‌هایی مثل Direct Preference Optimization روی جفت تصاویر و reward model مبتنی بر CLIP score استفاده می‌شود. همچنین روش‌های جدیدتر مثل Diffusion-DPO که توسط Bram Wallace و همکارانش در ۲۰۲۴ معرفی شد، امکان انجام alignment مستقیم روی diffusion model را فراهم کرده است.

مسیری که مهندسان ارشد باید ترسیم کنند

پس از ده سال کار روی این خانواده از مدل‌ها، سه نکته برای من روشن‌تر از همیشه است. اول، هوش مصنوعی مولد یک حوزهٔ میان‌رشته‌ای است که فهم کامل آن نیازمند ترکیبی از ریاضیات احتمالاتی، مهندسی سیستم‌های توزیع‌شده و طراحی تجربهٔ کاربری است. مهندس ارشد در این حوزه، کسی نیست که فقط با API کار کند؛ کسی است که بتواند تصمیم‌های معماری را در هر سه لایه توضیح دهد.

دوم، مسیر رشد این حوزه خطی نیست. پنج سال پیش کسی پیش‌بینی نمی‌کرد که diffusion به استاندارد تولید تصویر تبدیل شود؛ همان‌طور که امروز کسی به‌طور قطع نمی‌داند پنج سال بعد معماری غالب چه خواهد بود. این یعنی تصمیم‌های معماری باید modular و قابل تعویض باشند. هر سیستمی که hard-code روی یک مدل یا یک provider بزند، در دو سال آینده بدهی فنی سنگینی خواهد داشت.

سوم، مرز بین research و engineering در این حوزه محو شده. بسیاری از پیشرفت‌های عملی — از LoRA و QLoRA گرفته تا speculative decoding و KV cache optimization — از تیم‌های engineering آمده‌اند نه از تیم‌های research. این یعنی برای مهندس ارشد امروز، درک عمیق معماری‌های مولد یک مزیت رقابتی نیست، یک ضرورت است. اگر به‌دنبال مسیر تکامل این حوزه در سال‌های آینده هستید، آیندهٔ هوش مصنوعی مولد را بخوانید.

اگر روی پروژه‌ای کار کرده‌اید که در آن یک تصمیم معماری روی انتخاب معماری مولد اثر مستقیم داشته — مثلاً جایی که MoE در برابر dense model رفتار سیستم را زیر بار تغییر داده — تجربهٔ عملی‌تان را بنویسید. جزئیات آن تصمیم و پیامدش، برای مهندس بعدی که همین مسیر را طی می‌کند، از هر مقالهٔ آکادمیک ارزشمندتر است.