اولین بار که یک تصویر تولیدشده با Midjourney را در نمایشگاه هنری دیدم، چند ثانیه طول کشید تا تشخیص دهم که این تصویر واقعی نیست. آن تجربه، شروع مطالعه‌ای شد که امروز به یکی از جذاب‌ترین حوزه‌های هوش مصنوعی مولد تبدیل شده است. تولید تصاویر واقع‌گرایانه، در چند سال اخیر از یک چالش فنی پیچیده به یک ابزار در دسترس تبدیل شده است. اما پشت این پیشرفت چشمگیر، معماری‌های ریاضی پیچیده، تصمیم‌های مهندسی دقیق و تکنیک‌های خلاقانه‌ای وجود دارد که بسیاری از کاربران حتی از وجودشان بی‌خبرند. این متن تلاش می‌کند این حوزه را در سطح مهندسی ارشد باز کند.

اگر با مفاهیم پایه آشنا نیستید، ابتدا هوش مصنوعی مولد چیست و چگونه کار می‌کند را مرور کنید. اگر با این مفاهیم راحتی دارید، این متن را می‌توانید بدون وقفه دنبال کنید.

مسیر تاریخی: از GAN تا Diffusion

تولید تصویر با هوش مصنوعی، مسیر تاریخی پرپیچ‌وخمی طی کرده است. سه نسل اصلی در این حوزه وجود دارد.

نسل اول، VAE (Variational Autoencoder) بود که در سال ۲۰۱۳ توسط Diederik Kingma و Max Welling معرفی شد. این معماری، یک encoder و decoder داشت که در فضای نهان، توزیع گاوسی تقریب می‌زد. کیفیت تصاویر تولیدشده توسط VAE، به‌طور محسوسی پایین بود و معمولاً تار به نظر می‌رسیدند.

نسل دوم، GAN (Generative Adversarial Network) بود که در سال ۲۰۱۴ توسط Ian Goodfellow و همکارانش معرفی شد. این معماری، یک بازی min-max بین generator و discriminator طراحی می‌کرد که منجر به تصاویر واقع‌گرایانه‌تر شد. اما GANها دو مشکل دیرینه داشتند: mode collapse و ناپایداری آموزش. تصاویر تولیدشده با GAN، به‌طور معمول sharp بودند اما گاهی artifacts قابل توجه داشتند.

نسل سوم، Diffusion Models بودند که در سال ۲۰۲۰ توسط Jonathan Ho و همکارانش در مقاله DDPM معرفی شدند. این معماری، بر اساس یک فرآیند forward و reverse probabilistic بنا شده است که در ادامه به تفصیل توضیح می‌دهم. Diffusion، هم کیفیت بالا و هم پایداری آموزش را فراهم کرد و به سرعت به استاندارد صنعت تبدیل شد.

موج چهارم، Latent Diffusion بود که در سال ۲۰۲۲ توسط Robin Rombach و همکارانش در LMU Munich معرفی شد. این معماری، فرآیند diffusion را از فضای پیکسل به فضای نهان VAE منتقل کرد و هزینه محاسباتی را چند مرتبه کاهش داد. Stable Diffusion که از این معماری استفاده می‌کند، یکی از پرکاربردترین مدل‌های تصویری امروز است.

نسلمعماریمزیتمحدودیت
اولVAEپایداری و فضای نهان پیوستهکیفیت پایین، تار
دومGANکیفیت بالا، sharpناپایداری و mode collapse
سومDiffusionکیفیت و پایداریهزینه محاسباتی بالا
چهارمLatent Diffusionکیفیت + کاراییپیچیدگی معماری

مکانیزم Diffusion: forward و reverse

در Diffusion، فرآیند تولید شامل دو مرحله است. مرحله‌ی اول، فرآیند forward است که در آن، یک تصویر واقعی به‌تدریج با نویز گاوسی خراب می‌شود تا در نهایت به نویز خالص تبدیل شود. این فرآیند با پارامتر β_t کنترل می‌شود و در فرم بسته به‌صورت زیر نوشته می‌شود:

x_t = sqrt(alpha_bar_t) * x_0 + sqrt(1 - alpha_bar_t) * epsilon
where alpha_bar_t = product of (1 - beta_i) for i = 1..t

در این معادله، x_0 تصویر اصلی، x_t تصویر در گام t و ε نویز گاوسی است. پارامتر beta_t به‌طور معمول به‌صورت خطی یا کسینوسی از ۰.۰۰۰۱ تا ۰.۰۲ افزایش می‌یابد. alpha_bar_t، جرم تجمعی از beta_t را نشان می‌دهد.

مرحله‌ی دوم، فرآیند reverse است. در این مرحله، مدل یاد می‌گیرد که با دیدن x_t و گام زمانی t، نویز ε را پیش‌بینی کند. این فرمول‌بندی که به آن epsilon-prediction می‌گویند، در DDPM معرفی شد و اساس تقریباً همه مدل‌های تصویری مدرن است:

x_(t-1) = 1/sqrt(alpha_t) * (x_t - (1-alpha_t)/sqrt(1-alpha_bar_t) * epsilon_theta(x_t, t)) + sigma_t * z

در این معادله، epsilon_theta شبکه عصبی است که نویز را پیش‌بینی می‌کند، sigma_t واریانس شرطی و z نویز تصادفی است. این فرآیند، از t=T شروع می‌شود (که x_T نویز خالص است) و تا t=0 ادامه می‌یابد که در آن x_0 تصویر تمیز است.

نکته‌ی مهم: کیفیت تصویر نهایی، بستگی مستقیم به کیفیت پیش‌بینی نویز در هر گام دارد. اگر مدل در پیش‌بینی نویز خطا کند، خطا در گام‌های بعدی تجمع می‌یابد و به artifacts منجر می‌شود. برای درک مبانی، مدل‌های زبانی بزرگ را ببینید.

Diffusion یک فرآیند معکوس زمانی است: از نویز خالص شروع می‌کند و در چند صد گام، به تصویر تمیز می‌رسد. جادو در این فرآیند تدریجی است، نه در یک جهش ناگهانی.

Latent Space و فشرده‌سازی ادراکی

اجرای diffusion در فضای پیکسل، به‌دلیل ابعاد بالا، هزینه محاسباتی قابل توجهی دارد. یک تصویر ۵۱۲ در ۵۱۲ پیکسل با سه کانال رنگی، حدود ۷۸۶ هزار بعد دارد. اجرای diffusion در این فضا، نیازمند منابع محاسباتی قابل توجه است.

Latent Diffusion این مسئله را با انتقال فرآیند به فضای نهان یک VAE حل می‌کند. در این معماری، تصویر ابتدا به‌وسیله‌ی encoder VAE به یک نمایش نهان کم‌بعد (مثلاً ۶۴ در ۶۴ با چهار کانال) تبدیل می‌شود. فرآیند diffusion در این فضای نهان انجام می‌شود و در پایان، تصویر با decoder VAE از فضای نهان به فضای پیکسل بازگردانده می‌شود.

مزیت این رویکرد، کاهش چشمگیر هزینه محاسباتی است. در Stable Diffusion، فرآیند diffusion در فضای نهان با ابعاد ۶۴ در ۶۴ انجام می‌شود که حدود ۴۸ برابر کمتر از فضای پیکسل ۵۱۲ در ۵۱۲ است. این کاهش، به آموزش و اجرای سریع‌تر منجر می‌شود.

نکته‌ی مهم: کیفیت VAE، تعیین‌کننده‌ی کیفیت تصویر نهایی است. اگر VAE در فشرده‌سازی یا بازسازی خطا داشته باشد، این خطا به تصویر نهایی منتقل می‌شود. به همین دلیل، VAEهای استفاده‌شده در مدل‌های مدرن، به‌طور دقیق تنظیم شده‌اند و از معماری‌های خاص برای حفظ جزئیات استفاده می‌کنند.

Text Encoding و پل بین متن و تصویر

برای تولید تصویر از متن، مدل باید متن را به یک نمایش معنایی تبدیل کند که با فضای نهان تصویر هم‌راستا باشد. این کار با یک encoder متن انجام می‌شود که معمولاً از مدل‌های زبانی مثل CLIP از OpenAI استفاده می‌کند.

مدل CLIP (Contrastive Language-Image Pre-training) که توسط Alec Radford و همکارانش در OpenAI در سال ۲۰۲۱ معرفی شد، یک مدل دوگانه است که در آن، encoder متن و encoder تصویر در فضای مشترکی آموزش می‌بینند. این آموزش، به‌گونه‌ای است که متن و تصویرهای مرتبط، در این فضا نزدیک و متن و تصویرهای نامرتبط، دور از هم قرار می‌گیرند.

در Stable Diffusion، به‌جای CLIP از مدل‌های پیشرفته‌تری مثل OpenCLIP یا T5 استفاده می‌شود که توانایی درک متن‌های پیچیده‌تر را دارند. این encoderها، متن prompt را به یک بردار تعبیه‌ی عددی تبدیل می‌کنند که به‌عنوان conditioning در فرآیند diffusion استفاده می‌شود.

نکته‌ی مهم: کیفیت encoder متن، تعیین‌کننده‌ی کیفیت هم‌راستایی تصویر با prompt است. اگر encoder نتواند معنای prompt را به‌درستی درک کند، تصویر تولیدشده ممکن است با prompt هم‌راستا نباشد. برای درک مبانی، RAG چیست و چرا دقت مدل‌ها را بالا می‌برد را ببینید.

Guidance: بین وفاداری و تنوع

Guidance، یکی از مهم‌ترین تکنیک‌ها در تولید تصویر با AI است. این تکنیک، به مدل اجازه می‌دهد بین وفاداری به prompt و تنوع تصویر تعادل برقرار کند.

ساده‌ترین نوع guidance، classifier guidance است که در آن یک classifier جداگانه آموزش می‌بیند که تصاویر را بر اساس کلاس دسته‌بندی می‌کند و gradient آن برای هدایت فرآیند diffusion استفاده می‌شود. اما این رویکرد، نیازمند یک classifier جداگانه و آموزش پیچیده است.

رویکرد مدرن‌تر، classifier-free guidance است که توسط Jonathan Ho و Tim Salimans در سال ۲۰۲۲ معرفی شد. در این رویکرد، مدل هم با condition (متن prompt) و هم بدون condition آموزش می‌بیند. در زمان نمونه‌گیری، خروجی این دو حالت با یک ضریب guidance ترکیب می‌شود:

epsilon_guided = epsilon_uncond + guidance_scale * (epsilon_cond - epsilon_uncond)

در این معادله، epsilon_uncond پیش‌بینی نویز بدون condition و epsilon_cond پیش‌بینی نویز با condition است. ضریب guidance_scale، تعیین می‌کند که مدل چقدر به prompt وفادار باشد.

نکته‌ی مهم: انتخاب guidance_scale، یک تصمیم مهندسی کلیدی است. در Stable Diffusion، مقدار guidance_scale به‌طور معمول بین ۷ تا ۱۲ تنظیم می‌شود. مقادیر پایین‌تر، تصاویر متنوع‌تر اما کمتر وفادار به prompt تولید می‌کند؛ مقادیر بالاتر، تصاویر وفادارتر اما اشباع‌شده و کم‌تنوع.

Samplers و کیفیت تصویر نهایی

Samplers الگوریتم‌هایی هستند که فرآیند reverse diffusion را از t=T به t=0 اجرا می‌کنند. ساده‌ترین sampler، DDPM است که در آن، همه‌ی گام‌های زمانی اجرا می‌شوند. اما این رویکرد کند است و ممکن است به ۱۰۰۰ گام نیاز داشته باشد.

Samplers پیشرفته‌تر مثل DDIM از Jiaming Song و Stefano Ermon، DPM-Solver از Cheng Lu و Heun، و Euler Ancestral، می‌توانند کیفیت مشابه را در چند ده گام به دست آورند. این الگوریتم‌ها، از معادلات دیفرانسیل تصادفی و deterministic برای تعریف یک مسیر کوتاه‌تر به تصویر نهایی استفاده می‌کنند.

نکته‌ی مهم: انتخاب sampler و تعداد گام، یک تصمیم مهندسی مهم است. samplers مختلف، ویژگی‌های متفاوتی دارند. مثلاً DDIM گام‌های تعیین‌گرا تولید می‌کند که نتایج تکرارپذیرتری دارند، در حالی که Euler Ancestral از گام‌های تصادفی استفاده می‌کند که تنوع بیشتری ایجاد می‌کند.

در پروژه‌های خودم، انتخاب sampler بر اساس نیاز تنظیم می‌شود: برای تولید سریع، DPM-Solver++ با ۲۰ گام. برای کیفیت بالا، Heun با ۵۰ گام. برای تنوع، Euler Ancestral با ۳۰ گام. برای درک مبانی، کاربردهای هوش مصنوعی مولد در تولید محتوا را ببینید.

چرا تصاویر واقع‌گرایانه به‌نظر می‌رسند؟

سؤال کلیدی: چرا تصاویر تولیدشده با diffusion، به‌طور محسوسی واقع‌گرایانه‌تر از تصاویر تولیدشده با GAN به‌نظر می‌رسند؟ پاسخ در چند ویژگی ساختاری diffusion نهفته است.

ویژگی اول، توزیع کامل داده است. در GAN، generator فقط learning signal از discriminator دریافت می‌کند که در نهایت یک classification دوسطحی است. در diffusion، مدل یاد می‌گیرد که در هر گام زمانی، توزیع شرطی کل داده را تقریب بزند. این توزیع کامل‌تر، به تولید تصاویری منجر می‌شود که در همه‌ی جنبه‌ها واقع‌گرایانه‌تر هستند.

ویژگی دوم، استحکام در آموزش است. در GAN، عدم تعادل بین generator و discriminator می‌تواند به mode collapse منجر شود که در آن، generator فقط تعداد محدودی از حالت‌ها را تولید می‌کند. diffusion از این مشکل رنج نمی‌برد، چون هدف آموزش صریح است (پیش‌بینی نویز) و نیازی به بازی min-max ندارد.

ویژگی سوم، پوشش جزئیات است. diffusion در هر گام، نویز را پیش‌بینی می‌کند. این پیش‌بینی، در گام‌های ابتدایی به ساختار کلی تصویر کمک می‌کند و در گام‌های انتهایی به جزئیات دقیق. این فرآیند تدریجی، به تولید تصاویری با جزئیات دقیق منجر می‌شود که در GAN دشوار است.

ویژگی چهارم، ترکیب با latent space است. با استفاده از latent space VAE، مدل می‌تواند روی ویژگی‌های معنایی سطح بالا تمرکز کند و VAE جزئیات را بازسازی کند. این تقسیم کار، به کیفیت بالاتر در تصویر نهایی منجر می‌شود.

شکاف‌های باقی‌مانده و حالت‌های شکست

با تمام پیشرفت‌ها، مدل‌های تصویری فعلی شکاف‌های مهمی دارند که باید در نظر گرفته شوند.

شکاف اول، دست و انگشتان است. یکی از شایع‌ترین خطاهای مدل‌های تصویری، تولید دست و انگشت با تعداد یا حالت اشتباه است. علت این مشکل، پیچیدگی ساختار دست و فراوانی کمتر آن در داده آموزشی است.

شکاف دوم، متن در تصویر است. مدل‌های تصویری معمولاً در تولید متن داخل تصویر ضعیف عمل می‌کنند. متن‌های تولیدشده معمولاً بی‌معنا یا با حروف نادرست هستند. این محدودیت به‌دلیل پیچیدگی ذاتی تولید متن دقیق با diffusion است.

شکاف سوم، فیزیک و منطق است. مدل‌ها در درک فیزیک ساده (مثل جاذبه) و منطق تصویر (مثل انعکاس در آینه) ضعیف عمل می‌کنند. مثلاً ممکن است تصویری تولید شود که در آن، سایه در جهت اشتباهی بیفتد.

شکاف چهارم، سوگیری در داده آموزشی است. مدل‌های تصویری بر اساس داده‌هایی آموزش دیده‌اند که ممکن است شامل سوگیری‌های فرهنگی، جنسیتی یا نژادی باشد. این سوگیری‌ها به تصاویر تولیدشده منتقل می‌شوند. برای درک دقیق‌تر، اخلاقیات استفاده از هوش مصنوعی مولد را ببینید.

شکاف پنجم، مسئله حق مؤلف است. مدل‌ها بر اساس داده‌هایی آموزش دیده‌اند که ممکن است شامل تصاویر دارای حق مؤلف باشد. اگر تصویر تولیدشده، شباهت محسوسی به تصویر موجود داشته باشد، مسائل حقوقی مطرح می‌شود.

پرسش‌های پرتکرار درباره تصویر AI

چرا تصاویر تولیدشده با diffusion واقع‌گرایانه‌تر از GAN هستند؟ چون diffusion توزیع کامل داده را تقریب می‌زند و از مشکل mode collapse رنج نمی‌برد. همچنین، فرآیند تدریجی denoising به جزئیات دقیق‌تر منجر می‌شود.

تفاوت Latent Diffusion با Diffusion معمولی چیست؟ در Latent Diffusion، فرآیند diffusion در فضای نهان VAE انجام می‌شود، نه در فضای پیکسل. این کار، هزینه محاسباتی را چند مرتبه کاهش می‌دهد بدون افت محسوس کیفیت.

چه عواملی بر کیفیت تصویر نهایی تأثیر می‌گذارند؟ سه عامل اصلی: کیفیت VAE (که فضای نهان را تعریف می‌کند)، کیفیت encoder متن (که درک prompt را تعیین می‌کند) و انتخاب sampler و تعداد گام (که فرآیند reverse را کنترل می‌کند).

چرا تصاویر AI گاهی دست یا انگشت اشتباه دارند؟ علت اصلی، پیچیدگی ساختار دست و فراوانی کمتر آن در داده آموزشی است. مدل‌ها معمولاً در تولید اشیاء پیچیده با ساختار خاص، ضعیف‌تر عمل می‌کنند.

چه روش‌هایی برای بهبود کیفیت تصویر وجود دارد؟ سه رویکرد: اول، استفاده از prompt دقیق و جامع. دوم، تنظیم مناسب guidance_scale و sampler. سوم، استفاده از تکنیک‌های پیشرفته مثل ControlNet و IP-Adapter برای کنترل دقیق‌تر.

آیا می‌توان تصویر تولیدشده با AI را ویرایش کرد؟ بله، ابزارهایی مثل inpainting و outpainting امکان ویرایش بخش‌هایی از تصویر را فراهم می‌کنند. تکنیک‌هایی مثل ControlNet امکان کنترل دقیق‌تر را فراهم می‌کنند.

آیا تصاویر تولیدشده با AI حق مؤلف دارند؟ در حقوق فعلی، اکثر کشورها آثار تولیدشده به‌طور کامل توسط AI را بدون حق مؤلف می‌دانند. اما اگر انسان در فرآیند تولید، ورودی خلاقانه قابل توجه داشته باشد، ممکن است مالکیت مشترک ایجاد شود. این حوزه در حال تحول است.

آینده مدل‌های تصویری چه خواهد بود؟ سه روند اصلی: اول، ادغام بیشتر با ویدئو و صوت. دوم، کنترل دقیق‌تر با تکنیک‌هایی مثل ۳D-aware generation. سوم، شفافیت بیشتر در مورد داده‌های آموزشی و مسائل حقوقی. برای مطالعه‌ی مفاهیم پایه، هوش مصنوعی مولد را در ویکی‌پدیا دنبال کنید.

سنتز نهایی: جادوی ریاضیات

پس از چند سال کار در این حوزه، سه نتیجه‌گیری برای من روشن است. اول، تولید تصاویر واقع‌گرایانه با AI، نتیجه‌ی هماهنگی چندین نوآوری فنی است. نه یک الگوریتم واحد، بلکه ترکیبی از VAE، diffusion، text encoding و guidance. درک این ترکیب، کلید فهم کیفیت تصاویر امروز است.

دوم، پیشرفت در این حوزه به‌سرعت در حال تحول است. ابزارهایی که دو سال پیش پیشرفته به نظر می‌رسیدند، امروز ابتدایی هستند. این سرعت، به هم یادگیری مستمر و انطباق سریع نیاز دارد.

سوم، با تمام پیشرفت‌ها، مسائل اخلاقی و حقوقی همچنان نیازمند توجه جدی هستند. این حوزه، بیشتر از متن، ظرفیت سوگیری، جعل و نقض حق مؤلف دارد. قوانین در حال شکل‌گیری هستند و نقش متخصصان در شکل‌دهی به آن‌ها کلیدی است. اگر تجربه‌ای از کار با مدل‌های تصویری دارید — چه موفق، چه چالشی — تجربه‌تان را بنویسید. جزئیات آن سناریو، برای متخصصان دیگری که همین مسیر را طی می‌کنند، ارزشمند است.