هوش مصنوعی مولد یا Generative AI دقیقاً چطور کار میکند؟
کالبدشکافی فنی معماریهای مولد؛ از مکانیزم attention در Transformer و فرآیند معکوس در مدلهای diffusion تا pipeline آموزش، استراتژیهای sampling و شکافهای باقیمانده در استدلال.
سال ۲۰۱۴ که Ian Goodfellow و همکارانش در Université de Montréal مقالهٔ Generative Adversarial Networks را منتشر کردند، تصور نمیکردم یک دهه بعد، همان ایدهٔ سادهٔ رقابت بین دو شبکه، به ستون فقرات صنعتی تبدیل شود که ارزش بازار آن به صدها میلیارد دلار برسد. اما آنچه در این سالها یاد گرفتهام این است: هوش مصنوعی مولد (Generative AI) یک جادوی واحد نیست؛ خانوادهای از معماریهای ریاضی است که هر کدام توزیع احتمال داده را به شکل متفاوتی مدل میکنند. هدف این متن، عبور از سطح تیتر اخبار و ورود به لایههایی است که مهندسان ارشد هنگام طراحی سیستمهای مبتنی بر مدلهای زبانی بزرگ با آنها دستوپنجه نرم میکنند.
اگر با پایههای machine learning آشنا نیستید، پیشنهاد میکنم ابتدا یادگیری ماشین چیست و چگونه کار میکند را مرور کنید. اما اگر با backpropagation، توزیع احتمال و gradient descent راحت هستید، این متن را میتوانید بدون وقفه دنبال کنید.
هوش مصنوعی مولد چیست؟ تعریف فنی و مرزهای آن
در سادهترین تعریف، هوش مصنوعی مولد به خانوادهای از مدلهای آماری گفته میشود که هدفشان یادگیری توزیع احتمال دادههای آموزشی است تا بتوانند نمونههای جدیدی از همان توزیع تولید کنند. اگر با نماد ریاضی بیان کنیم، مدل مولد تابعی مثل p(x) را تقریب میزند که در آن x میتواند یک تصویر، یک متن، یک قطعه کد یا یک مولکول باشد. این تعریف، تفاوت بنیادی آن با مدلهای تشخیصی (Discriminative) را روشن میکند: مدل تشخیصی p(y|x) را یاد میگیرد تا ورودی را دستهبندی کند؛ مدل مولد p(x) یا p(x|y) را میآموزد تا خودِ داده را بازتولید کند. تفاوتهای عملی این دو خانواده در هوش مصنوعی مولد در برابر هوش مصنوعی سنتی با مثالهای کاربردی شرح داده شده است.
مرز مولد بودن، مرز روشنی است: هر سیستمی که فقط برچسب میزند، خوشهبندی میکند یا پیشبینی عددی میکند، مولد نیست. مولد یعنی سیستم بتواند نمونهای تولید کند که در مجموعهٔ آموزشی وجود نداشته باشد، اما از نظر آماری به آن شبیه باشد. این تعریف دقیقاً همان چیزی است که در ادبیات Bayesian به آن density estimation میگویند و پایهٔ ریاضی تمام معماریهای امروزی است.
سه خانوادهٔ اصلی معماری مولد امروز وجود دارد که هر کدام از یک استراتژی متفاوت برای تقریب p(x) استفاده میکنند. مدلهای autoregressive که توزیع مشترک را به حاصلضرب توزیعهای شرطی تجزیه میکنند، مدلهای latent variable مثل VAE که یک متغیر نهان z را وارد میکنند و p(x) را به انتگرال روی z تبدیل میکنند، و مدلهای score-based و diffusion که از فرآیند تصادفی برای یادگیری گرادیان log-density استفاده میکنند. درک تفاوت این سه خانواده، کلید فهم این است که چرا یک مدل زبانی بزرگ با یک مدل تصویری بزرگ تفاوتهای معماری چشمگیری دارند، هرچند هر دو مولد هستند. اگر علاقهمندید ببینید این معماریها چطور در تصمیمگیری agentها ظاهر میشوند، نحوهٔ تصمیمگیری agentهای هوش مصنوعی را ببینید.
هوش مصنوعی مولد یک سیستم دانش نیست؛ یک سیستم توزیع احتمالاتی است. تفاوت این دو نگاه، تمام تفاوت بین یک دایرةالمعارف و یک نویسنده است.
تکامل تاریخی: از VAE و GAN تا Transformer و Diffusion
مسیر تاریخی هوش مصنوعی مولد، مسیر جستجوی مدلهایی است که بتوانند توزیعهای با ابعاد بالا را تقریب بزنند، بدون اینکه به curse of dimensionality سقوط کنند. در دههٔ ۲۰۱۰، دو معماری اولین پیشرفتهای جدی را رقم زدند. Variational Autoencoder که Diederik Kingma و Max Welling در ۲۰۱۳ معرفی کردند، یک شبکهٔ encoder-decoder بود که در فضای نهان یک توزیع گاوسی تقریب میزد. مزیت آن یک هدف آموزش صریح (ELBO) بود؛ ضعف آن کیفیت نسبتاً پایین نمونهها. GAN که Ian Goodfellow در ۲۰۱۴ معرفی کرد، بهجای مدلسازی صریح density، یک بازی min-max بین generator و discriminator طراحی کرد که منجر به تصاویر بسیار واقعگرایانه شد. اما GANها به دو مشکل دیرینه دچار بودند: mode collapse و ناپایداری آموزش.
نقطهٔ عطف واقعی، مقالهٔ Attention Is All You Need از Ashish Vaswani و همکارانش در Google Brain در سال ۲۰۱۷ بود. این مقاله، معماری Transformer را معرفی کرد که مبتنی بر self-attention بود و برخلاف RNN و LSTM، امکان موازیسازی کامل در طول توالی را فراهم میکرد. اما نکتهٔ عمیقتر این بود که Transformer یک inductive bias متفاوت به مدل تحمیل میکرد: بهجای فرض توالیبودن یا ترجمهناوردایی (translation invariance)، فرض میکرد که روابط بین عناصر باید از داده یاد گرفته شوند. همین انعطاف بود که باعث شد Transformer در دههٔ بعد به ستون فقرات تقریباً همهٔ مدلهای مولد تبدیل شود. اگر با مسیر تحول این معماری در مدلهای زبانی آشنا نیستید، مدلهای زبانی بزرگ و انقلاب آنها را بخوانید.
موج دوم در سال ۲۰۲۰ آمد، زمانی که Jonathan Ho و همکارانش در UC Berkeley مقالهٔ Denoising Diffusion Probabilistic Models را منتشر کردند. این مقاله یک ایدهٔ قدیمی از Sohl-Dickstein در ۲۰۱۵ را احیا کرد: بهجای تولید مستقیم داده، یک فرآیند forward تعریف شود که داده را بهتدریج با نویز گاوسی خراب کند، و بعد یک شبکهٔ عصبی آموزش ببیند که این فرآیند را معکوس کند. این ایده در ابتدا بهخاطر هزینهٔ نمونهگیری (چند صد تا چند هزار قدم) کند به نظر میرسید، اما Yang Song و همکارانش با چارچوب score-based SDE و بعدها مقالهٔ DDIM از Jiaming Song، سرعت نمونهگیری را به حدی رساندند که در عمل قابل استفاده شد. موج سوم در سال ۲۰۲۲ با انتشار Stable Diffusion توسط Robin Rombach و همکارانش در LMU Munich و Stability AI رقم خورد، که نمایش diffusion را از فضای پیکسل به فضای نهان VAE منتقل کرد و هزینهٔ محاسباتی را چند مرتبه کاهش داد.
| سال | نقطهٔ عطف | محقق شاخص | سهم فنی |
|---|---|---|---|
| ۲۰۱۳ | VAE | Kingma و Welling | حساب تغییراتی و فضای نهان پیوسته |
| ۲۰۱۴ | GAN | Ian Goodfellow | آموزش رقابتی بدون density صریح |
| ۲۰۱۷ | Transformer | Vaswani و همکاران | Self-attention و موازیسازی کامل |
| ۲۰۲۰ | DDPM | Jonathan Ho | Diffusion احتمالاتی با denoising |
| ۲۰۲۲ | Latent Diffusion | Robin Rombach | Diffusion در فضای نهان |
معماری Transformer در عمق: از attention تا feed-forward
برای مهندس ارشد، فهم Transformer از سطح attention شروع میشود. در هستهٔ این معماری، یک عملیات بهنام Scaled Dot-Product Attention وجود دارد که در فرم ساده بهصورت زیر بیان میشود:
Attention(Q, K, V) = softmax(Q @ K.T / sqrt(d_k)) @ V
در اینجا Q ماتریس query، K ماتریس key و V ماتریس value است. d_k بعد فضای نهان هر head است. تقسیم بر sqrt(d_k) بهخاطر جلوگیری از اشباع softmax در ابعاد بالا انجام میشود؛ اگر این نرمالسازی حذف شود، gradients در طول آموزش بسیار کوچک میشوند و یادگیری مختل میشود. اما نکتهٔ ظریفی که در پیادهسازیهای سطحی گم میشود این است که self-attention در Transformer یک عملیات permutation-equivariant است. این یعنی اگر ترتیب توکنها را تغییر دهید، خروجی attention بدون positional encoding همچنان همان مجموعهٔ وزنی را میدهد. به همین دلیل positional encoding از نوع sinusoidal یا learned یا rotary (RoPE) ضروری است، و انتخاب نوع آن اثر مستقیم بر تعمیم طول context دارد. این جزئیات معماری، پایهٔ تفاوت رفتار مدلهای زبانی در وظایف long-context است و در مدلهای زبانی بزرگ با جزئیات بیشتری باز شده است.
Multi-Head Attention که بهطور موازی چند attention را با projectionهای مختلف اجرا میکند، به مدل اجازه میدهد همزمان به روابط نحوی، معنایی و بلندمدت توجه کند. هر head یک زیرفضای متفاوت از بازنمایی را میآموزد و نتایج در انتها concat میشوند. از نظر تئوری، این طراحی به مدل قدرت بیان بیشتری میدهد، اما در عمل مشاهده شده که با افزایش تعداد headها، بازده کاهش مییابد و برخی headها تخصصیتر از بقیه عمل میکنند؛ پدیدهای که به آن head pruning گفته میشود.
بخش feed-forward در Transformer معمولاً یک شبکهٔ دو لایه با activation غیرخطی مثل GELU یا SwiGLU است. جالب است که در سالهای اخیر، پژوهشها نشان دادهاند بخش عمدهٔ دانش واقعی مدل در همین لایههای feed-forward ذخیره میشود، نه در attention. تفسیرپذیری این لایهها به حوزهای فعال بهنام mechanistic interpretability تبدیل شده که در آن محققانی مثل Chris Olah در Anthropic و Neel Nanda در DeepMind نقش کلیدی دارند.
Transformer در ظاهر یک معماری است؛ در عمق، یک فرضیه دربارهٔ ماهیت بازنمایی است: هر رابطهای که در داده وجود دارد، قابل کشف با نگاشتهای خطی در فضایی با ابعاد کافی است.
مدلهای Diffusion و فرآیند معکوس denoising
در Diffusion، داده x_0 از توزیع واقعی بهتدریج با نویز خراب میشود تا در نهایت به نویز خالص گاوسی تبدیل شود. این فرآیند forward با پارامتر β_t کنترل میشود و در فرم بسته بهصورت زیر نوشته میشود:
x_t = sqrt(alpha_bar_t) * x_0 + sqrt(1 - alpha_bar_t) * epsilon
where alpha_bar_t = product of (1 - beta_i) for i = 1..t
شبکهٔ عصبی در Diffusion آموزش میبیند که با دیدن x_t و گام زمانی t، نویز ε را پیشبینی کند. این فرمولبندی که به آن epsilon-prediction میگویند، در DDPM (Denoising Diffusion Probabilistic Models) معرفی شد و اساس تقریباً همهٔ مدلهای تصویری مدرن است. اما همانطور که Jonathan Ho خودش بارها اشاره کرده، انتخاب پارامتربندی اهمیت تعیینکنندهای دارد. در مقالهٔ بعدی که در سال ۲۰۲۲ منتشر شد، پیشبینی v (velocity) بهعنوان جایگزینی برای epsilon-prediction پیشنهاد شد که پایداری آموزش در سطوح بالای نویز را بهبود میدهد. چارچوب کامل این پیشرفتها در چگونگی ساخت تصاویر واقعگرایانه با هوش مصنوعی مولد توضیح داده شده است.
فرآیند معکوس، که در آن مدل از نویز خالص شروع میکند و تدریجاً یک نمونهٔ تمیز میسازد، در ابتدا چند صد گام نیاز داشت. اما DDIM که توسط Jiaming Song و Stefano Ermon در Stanford معرفی شد، نشان داد میتوان با گامهای بزرگتر و تعیینگرایانهتر، همان کیفیت را در چند ده گام به دست آورد. بعدتر، الگوریتمهای samplers مثل DPM-Solver و Heun که توسط Cheng Lu و همکارانش در Tsinghua توسعه یافتند، تعداد گامها را به محدودهٔ ۱۵ تا ۳۰ رساندند. این سرعتبخشی، تفاوت بین یک سیستم آزمایشگاهی و یک محصول واقعی است که در آن کاربر نمیتواند دو دقیقه برای یک تصویر صبر کند.
مدلهای Diffusion همچنین از یک مفهوم مهم بهنام classifier-free guidance استفاده میکنند که توسط Jonathan Ho و Tim Salimans در ۲۰۲۲ معرفی شد. در این تکنیک، مدل هم با شرط (prompt) و هم بدون شرط آموزش میبیند و هنگام نمونهگیری، خروجی این دو حالت با یک ضریب guidance ترکیب میشود. این تکنیک باعث میشود مدل بتواند بین وفاداری به prompt و تنوع نمونهها تعادل برقرار کند. مقدار guidance scale یک ابرپارامتر کلیدی است که تجربه نشان داده در محدودهٔ ۷ تا ۱۲ بهترین نتیجه را میدهد و بیرون از آن، یا نمونهها اشباعشده و کمتنوع میشوند یا به prompt بیاعتنا میمانند. نمونههایی از کاربردهای پیشرفتهٔ این تکنیک در طراحی و ویدئو در هوش مصنوعی مولد در ویدئو و صدا بررسی شده است.
Pipeline آموزش: pretraining، SFT، RLHF و DPO
پشت هر مدل زبانی بزرگ تجاری، یک pipeline چندمرحلهای پیچیده وجود دارد که عدم درک درست آن، منبع بسیاری از سوءبرداشتها دربارهٔ رفتار مدل است. مرحلهٔ اول pretraining است: مدل روی مجموعهای از تریلیونها توکن متن آموزش میبیند و هدفش پیشبینی توکن بعدی است. این مرحله ماهها روی هزاران GPU اجرا میشود و هزینهٔ آن به دهها میلیون دلار میرسد. مقالهٔ GPT-3 از Tom Brown و همکارانش در OpenAI نشان داد که با بزرگکردن مقیاس، مدلها تواناییهای emergent پیدا میکنند که در مدلهای کوچکتر وجود نداشت. اما این تواناییها همیشه هم مطلوب نیستند؛ بخش قابلتوجهی از تحقیقات alignment به این اختصاص یافته که چطور میتوان از این تواناییهای emergent بهنفع کاربر استفاده کرد.
مرحلهٔ دوم Supervised Fine-Tuning یا SFT است. در این مرحله، مدل روی مجموعهای از نمونههای دستچینشدهٔ input-output آموزش میبیند که توسط annotatorهای انسانی تولید شدهاند. SFT رفتار پایهٔ مدل را از تکمیل متن به پاسخدهی به سؤال تغییر میدهد. اما SFT بهتنهایی کافی نیست، چون نمیتواند ترجیحات ظریف انسانی مثل مفید بودن، بیطرفی و ایمنی را بهطور کامل منتقل کند. اینجاست که مرحلهٔ سوم، Reinforcement Learning from Human Feedback یا RLHF، وارد میشود.
در RLHF، ابتدا یک reward model با مقایسهٔ جفت پاسخهای تولیدشده توسط مدل و رأی انسانی آموزش داده میشود. سپس خود مدل با الگوریتم PPO که توسط John Schulman و همکارانش در OpenAI توسعه یافت، بر اساس این reward model بهینه میشود. این الگو در InstructGPT و بعدتر ChatGPT به کار رفت. اما RLHF دو ضعف دارد: اول، هزینهٔ آموزش reward model و حساسیت آن به نحوهٔ جمعآوری داده؛ دوم، instability ذاتی PPO که گاهی مدل را به سمت reward hacking میبرد. این مشکلات باعث شد روش DPO که توسط Rafael Rafailov و همکارانش در Stanford در ۲۰۲۳ معرفی شد، به سرعت جایگزین شود. در DPO، مسئلهٔ RLHF به یک مسئلهٔ classification ساده تبدیل میشود و نیازی به reward model جداگانه نیست. این سادگی، آموزش alignment را برای تیمهای متوسط دسترسپذیرتر کرده است. بحث تفاوتهای این روشها در سطح عملی، بخش جداییناپذیر از فهم امروز هوش مصنوعی مولد است.
استراتژیهای نمونهگیری و پارامترهای دیکدینگ
بعد از آموزش، سؤال اساسی این است که مدل چطور از توزیع احتمال پیشبینیشده نمونه بگیرد. در حالت autoregressive، مدل در هر گام یک توزیع احتمال روی واژگان تولید میکند. greedy decoding یعنی انتخاب توکن با بالاترین احتمال، که به متنهای تکراری و خستهکننده منجر میشود. beam search با نگهداشتن چند مسیر موازی، احتمال شرطی کل توالی را بهینه میکند اما در تولید باز نمیتواند خلاقیت نشان دهد، چون دنبال احتمال بیشینه است.
روشهای sampling تصادفی با تنظیم temperature، توزیع logits را تخت یا تیز میکنند. temperature نزدیک به صفر معادل greedy است و temperature بالای ۱ به تنوع بیشازحد و بیمعنایی میانجامد. top-k sampling که توسط Angela Fan و همکارانش در Facebook AI Research در ۲۰۱۸ معرفی شد، انتخاب را به k توکن با بالاترین احتمال محدود میکند. اما top-p یا nucleus sampling که Ari Holtzman و همکارانش در ۲۰۲۰ معرفی کردند، محدودیت را بر اساس جرم تجمعی تعیین میکند و به همین دلیل پایداری بیشتری در طولهای مختلف توزیع دارد. این روش امروز استاندارد تقریبی همهٔ APIهای تجاری است و انتخاب مقدار p معمولاً در محدودهٔ ۰.۹ تا ۰.۹۵ انجام میشود.
در سالهای اخیر، روشهای جدیدتری مثل min-p sampling که توسط Minh Nguyen و همکارانش در ۲۰۲۴ پیشنهاد شد، بهجای جرم تجمعی، از نسبت احتمال توکن بیشینه استفاده میکند و ادعا میکند در temperatureهای بالا نتایج بهتری میدهد. اما نکتهای که در عمل اهمیت دارد این است که انتخاب پارامترهای sampling باید بر اساس نوع کار انجام شود. برای تولید کد، temperature پایین و top-p محدودتر لازم است؛ برای نوشتن خلاقانه، temperature بالاتر و top-p بازتر. این تنظیمات در بهترین ابزارهای هوش مصنوعی مولد معمولاً بهصورت پیشفرض وجود دارند اما اغلب کاربران از اثر آنها بر کیفیت خروجی بیخبرند.
فضای نهان و هندسهٔ بازنمایی
یکی از مفاهیمی که در هوش مصنوعی مولد بارها با آن روبهرو میشویم، فضای نهان یا latent space است. در VAE و Diffusion latent، مدل داده را به یک فضای پیوسته و کمبعدتر نگاشت میکند که در آن عملیات سادهتر انجام شود. در مدلهای زبانی بزرگ، فضای نهان در هر لایه یک بازنمایی با ابعاد هزاران است و conceptهای پیچیده در این فضا بهصورت جهتهای برداری ظاهر میشوند. پژوهشهای اخیر نشان دادهاند که این فضا ساختار هندسی قابلتفسیری دارد: مثلاً در فضای نهان یک مدل زبانی، بردار تفاوت بین کلمات مرتبط با جنسیت یا با زمان، جهت ثابتی دارد. این یافته، پایهٔ تکنیکهایی مثل activation steering و representation engineering است که امروز در Anthropic و DeepMind فعالانه دنبال میشود.
مفهوم latent space در سیستمهای retrieval-augmented هم حیاتی است. وقتی از RAG استفاده میکنید، اسناد به embedding تبدیل میشوند و در فضای نهان جستجو میشوند. کیفیت embedding، مستقیماً کیفیت retrieval را تعیین میکند. اگر با این معماری آشنا نیستید، RAG چیست و چرا دقت مدلها را بالا میبرد را ببینید.
تفاوت بین یک مدل مولد کارآمد و یک مدل ناکارآمد، در تعداد پارامتر نیست؛ در ساختار هندسی فضای نهان آن است که با چه inductive bias و چه هدف آموزشی ساخته شده.
بنچمارکها، آمار و چهرههای شاخص این حوزه
سنجش پیشرفت مدلهای مولد، خود حوزهای است که در سالهای اخیر به بلوغ قابلتوجهی رسیده. بنچمارک MMLU که توسط Dan Hendrycks و همکارانش در UC Berkeley در ۲۰۲۰ معرفی شد، تا مدتها معیار استاندارد ارزیابی دانش مدلهای زبانی بود. اما با اشباع آن توسط مدلهای پیشرفته، جایگزینهایی مثل MMLU-Pro با ۱۲٬۰۳۲ سؤال دشوارتر و GPQA با سؤالات سطح دکتری مطرح شدند. در حوزهٔ کد، HumanEval که توسط Mark Chen و همکارانش در OpenAI معرفی شد، و بعدتر SWE-bench از Princeton که توسط Carlos Jimenez و همکارانش طراحی شد، معیار ارزیابی توانایی برنامهنویسی شدند.
آمار adoption و روند رشد صنعت در سال ۲۰۲۵ نشان میدهد که ۷۸ درصد از سازمانها در حداقل یک عملکرد از هوش مصنوعی مولد استفاده میکنند. اما آنچه کمتر گزارش میشود این است که بیش از نیمی از این استفادهها در سطح proof of concept باقی مانده و به تولید نرسیده. سرمایهگذاری جهانی روی زیرساخت هوش مصنوعی در سال ۲۰۲۵ از مرز ۵۰۰ میلیارد دلار گذشته و پیشبینی میشود تا ۲۰۲۸ به دو تریلیون دلار برسد. اما این سرمایهگذاری بیشتر در لایهٔ زیرساخت متمرکز است تا در لایهٔ کاربرد، که خودش نشاندهندهٔ عدم بلوغ لایهٔ کاربردی است.
در سطح چهرههای شاخص، نمیتوان از Geoffrey Hinton و Yann LeCun و Yoshua Bengio که جایزهٔ Turing 2018 را برای کارهای بنیادی در یادگیری عمیق دریافت کردند، بیتوجه گذشت. Ilya Sutskever که یکی از معماران GPT و از بنیانگذاران OpenAI و بعدتر SSI (Safe Superintelligence) است، نقش کلیدی در مسیر research این حوزه داشته. Dario Amodei از Anthropic که خود از OpenAI آمده، رهبری تحقیقات alignment و mechanistic interpretability را در اختیار دارد. در حوزهٔ diffusion، Jonathan Ho، Yang Song، Jiaming Song و Robin Rombach نقشآفرینان اصلی هستند. Fei-Fei Li از Stanford که با ImageNet پایهٔ انقلاب بینایی کامپیوتری را گذاشت، امروز در حوزهٔ spatial intelligence فعالیت میکند. در ایران هم پژوهشگران در دانشگاههای صنعتی شریف، تهران و امیرکبیر در حوزهٔ NLP و بینایی کامپیوتری مقالات قابلتوجهی منتشر میکنند، هرچند زیرساخت محاسباتی محدودیت اصلی آنهاست.
یکی از بحثهای جاری که مستقیم به آیندهٔ این حوزه مربوط است، شکاف بین مقیاسپذیری و کارایی است. مدلهایی مثل Mixture of Experts (MoE) که در آنها فقط بخشی از پارامترها در هر forward pass فعال میشوند، امکان ساخت مدلهای بزرگتر با هزینهٔ محاسباتی کمتر را فراهم کردهاند. این معماری که توسط Noam Shazeer و همکارانش در Google در ۲۰۱۷ معرفی شد، امروز در مدلهایی مثل Gemini و Mixtral استفاده میشود.
چالشهای باقیمانده و شکاف استدلال
با تمام پیشرفتها، مدلهای مولد امروز همچنان در چند زمینه شکافهای بنیادی دارند. اولین و شناختهشدهترین، hallucination است: مدل با اطمینان کامل چیزی تولید میکند که وجود ندارد. علت ریشهای این پدیده در این است که مدل بهجای بهخاطر سپردن حقایق، توزیع احتمال زبان را یاد میگیرد. راهحلهای فعلی مثل RAG و tool use، فقط لایهای بیرونی روی این مشکل میگذارند؛ حل بنیادی آن نیازمند معماریهای جدید است.
چالش دوم، reasoning چندمرحلهای است. مدلهای autoregressive در طولهای کوتاه خوب عمل میکنند، اما در استدلالهای چندگامی که نیاز به نگهداشتن state طولانی دارند، خطای تجمعی ظاهر میشود. روشهایی مثل Chain-of-Thought و Tree-of-Thought این مشکل را تا حدی کاهش دادهاند، اما همچنان در مسائلی مثل ریاضیات رقابتی و برنامهنویسی الگوریتمی، شکاف محسوسی با انسان وجود دارد.
چالش سوم، محدودیتهای اخلاقی و حقوقی است. مدلهای مولد روی دادهای آموزش میبینند که غالباً از منابع عمومی جمعآوری شده و در بسیاری موارد مسئلهٔ حق مؤلف دربارهٔ آن حل نشده است. پروندهٔ حقوقی نیویورک تایمز علیه OpenAI و Microsoft، و پروندههای مشابه در حوزهٔ تصویر و موسیقی، نمونههایی از این تنش هستند. در سطح سازمانی، پیروی از قوانین AI Act اروپا که در ۲۰۲۴ تصویب شد، برای شرکتهایی که مدلهای مولد را در اتحادیهٔ اروپا مستقر میکنند اجباری است. جنبههای اخلاقی این حوزه در اخلاقیات استفاده از هوش مصنوعی مولد به تفصیل بررسی شده است.
چهارمین چالش که کمتر بحث میشود، محدودیت محاسباتی است. هزینهٔ آموزش مدلهای frontier در سال ۲۰۲۴ به دهها میلیون دلار رسیده و هزینهٔ inference در مقیاس صنعتی هم قابلتوجه است. این فشار محاسباتی، هم محدودیت زیستمحیطی ایجاد کرده و هم نابرابری دسترسی را افزایش داده؛ چون فقط تعداد محدودی از شرکتها توان مالی رقابت در frontier را دارند. این مسئله در محدودیتهای هوش مصنوعی مولد با نگاه عملیتر تحلیل شده است.
پرسشهای متداول دربارهٔ هوش مصنوعی مولد
تفاوت هوش مصنوعی مولد با مدلهای تشخیصی چیست؟ مدلهای تشخیصی برچسب میزنند یا دستهبندی میکنند؛ مدلهای مولد نمونهٔ جدید تولید میکنند. از نظر ریاضی، اولی p(y|x) را یاد میگیرد و دومی p(x). این تفاوت، در هزینهٔ آموزش، اندازهٔ مدل و کاربرد عملی آنها اثر مستقیم دارد.
آیا هوش مصنوعی مولد واقعاً میفهمد یا فقط الگو کپی میکند؟ پاسخ دقیق این سؤال همچنان موضوع بحث است. شواهد نشان میدهد مدلها در برخی وظایف رفتار شبیه به فهم نشان میدهند و در وظایف دیگر شکستهای نظاممند دارند که با فهم سازگار نیست. بهترین چارچوب مفهومی فعلی این است که مدلها یک فشردهسازی آماری از داده ساختهاند که در مواردی با فهم همراستا است و در مواردی صرفاً الگوهای سطحی را بازتولید میکند.
حالا که Transformer اشباع شده، معماری بعدی چیست؟ معماریهای جایگزین مثل State Space Models (Mamba از Albert Gu و Tri Dao)، RWKV و RetNet در حال توسعه هستند و هر کدام trade-off متفاوتی بین کیفیت، حافظه و موازیسازی ارائه میدهند. اما هیچکدام تا این لحظه بهطور کامل جایگزین Transformer نشدهاند و احتمالاً در آیندهٔ نزدیک شاهد معماریهای هیبرید خواهیم بود.
چقدر طول میکشد تا یک تیم متوسط یک مدل مولد سفارشی بسازد؟ برای fine-tune کردن یک مدل متنباز روی دامنهٔ خاص، با ۴ GPU مدرن و چند هفته کار مهندسی امکانپذیر است. اما ساخت یک مدل پایه از صفر، حداقل چند میلیون دلار و چند ماه کار یک تیم بزرگ متخصص نیاز دارد. بنابراین برای اکثر پروژههای تجاری، fine-tune یا RAG مسیر عملیتری است.
نقش human feedback در مدلهای تصویری چطور پیاده میشود؟ در مدلهای تصویری، بهجای RLHF از روشهایی مثل Direct Preference Optimization روی جفت تصاویر و reward model مبتنی بر CLIP score استفاده میشود. همچنین روشهای جدیدتر مثل Diffusion-DPO که توسط Bram Wallace و همکارانش در ۲۰۲۴ معرفی شد، امکان انجام alignment مستقیم روی diffusion model را فراهم کرده است.
مسیری که مهندسان ارشد باید ترسیم کنند
پس از ده سال کار روی این خانواده از مدلها، سه نکته برای من روشنتر از همیشه است. اول، هوش مصنوعی مولد یک حوزهٔ میانرشتهای است که فهم کامل آن نیازمند ترکیبی از ریاضیات احتمالاتی، مهندسی سیستمهای توزیعشده و طراحی تجربهٔ کاربری است. مهندس ارشد در این حوزه، کسی نیست که فقط با API کار کند؛ کسی است که بتواند تصمیمهای معماری را در هر سه لایه توضیح دهد.
دوم، مسیر رشد این حوزه خطی نیست. پنج سال پیش کسی پیشبینی نمیکرد که diffusion به استاندارد تولید تصویر تبدیل شود؛ همانطور که امروز کسی بهطور قطع نمیداند پنج سال بعد معماری غالب چه خواهد بود. این یعنی تصمیمهای معماری باید modular و قابل تعویض باشند. هر سیستمی که hard-code روی یک مدل یا یک provider بزند، در دو سال آینده بدهی فنی سنگینی خواهد داشت.
سوم، مرز بین research و engineering در این حوزه محو شده. بسیاری از پیشرفتهای عملی — از LoRA و QLoRA گرفته تا speculative decoding و KV cache optimization — از تیمهای engineering آمدهاند نه از تیمهای research. این یعنی برای مهندس ارشد امروز، درک عمیق معماریهای مولد یک مزیت رقابتی نیست، یک ضرورت است. اگر بهدنبال مسیر تکامل این حوزه در سالهای آینده هستید، آیندهٔ هوش مصنوعی مولد را بخوانید.
اگر روی پروژهای کار کردهاید که در آن یک تصمیم معماری روی انتخاب معماری مولد اثر مستقیم داشته — مثلاً جایی که MoE در برابر dense model رفتار سیستم را زیر بار تغییر داده — تجربهٔ عملیتان را بنویسید. جزئیات آن تصمیم و پیامدش، برای مهندس بعدی که همین مسیر را طی میکند، از هر مقالهٔ آکادمیک ارزشمندتر است.