هوش مصنوعی مولد چطور تصاویر واقعگرایانه میسازد؟
از معماری diffusion و فرآیند معکوس denoising تا latent space و تکنیکهای guidance؛ کالبدشکافی فنی نحوه تولید تصاویر واقعگرایانه با هوش مصنوعی مولد در سطح مهندسی ارشد.
اولین بار که یک تصویر تولیدشده با Midjourney را در نمایشگاه هنری دیدم، چند ثانیه طول کشید تا تشخیص دهم که این تصویر واقعی نیست. آن تجربه، شروع مطالعهای شد که امروز به یکی از جذابترین حوزههای هوش مصنوعی مولد تبدیل شده است. تولید تصاویر واقعگرایانه، در چند سال اخیر از یک چالش فنی پیچیده به یک ابزار در دسترس تبدیل شده است. اما پشت این پیشرفت چشمگیر، معماریهای ریاضی پیچیده، تصمیمهای مهندسی دقیق و تکنیکهای خلاقانهای وجود دارد که بسیاری از کاربران حتی از وجودشان بیخبرند. این متن تلاش میکند این حوزه را در سطح مهندسی ارشد باز کند.
اگر با مفاهیم پایه آشنا نیستید، ابتدا هوش مصنوعی مولد چیست و چگونه کار میکند را مرور کنید. اگر با این مفاهیم راحتی دارید، این متن را میتوانید بدون وقفه دنبال کنید.
مسیر تاریخی: از GAN تا Diffusion
تولید تصویر با هوش مصنوعی، مسیر تاریخی پرپیچوخمی طی کرده است. سه نسل اصلی در این حوزه وجود دارد.
نسل اول، VAE (Variational Autoencoder) بود که در سال ۲۰۱۳ توسط Diederik Kingma و Max Welling معرفی شد. این معماری، یک encoder و decoder داشت که در فضای نهان، توزیع گاوسی تقریب میزد. کیفیت تصاویر تولیدشده توسط VAE، بهطور محسوسی پایین بود و معمولاً تار به نظر میرسیدند.
نسل دوم، GAN (Generative Adversarial Network) بود که در سال ۲۰۱۴ توسط Ian Goodfellow و همکارانش معرفی شد. این معماری، یک بازی min-max بین generator و discriminator طراحی میکرد که منجر به تصاویر واقعگرایانهتر شد. اما GANها دو مشکل دیرینه داشتند: mode collapse و ناپایداری آموزش. تصاویر تولیدشده با GAN، بهطور معمول sharp بودند اما گاهی artifacts قابل توجه داشتند.
نسل سوم، Diffusion Models بودند که در سال ۲۰۲۰ توسط Jonathan Ho و همکارانش در مقاله DDPM معرفی شدند. این معماری، بر اساس یک فرآیند forward و reverse probabilistic بنا شده است که در ادامه به تفصیل توضیح میدهم. Diffusion، هم کیفیت بالا و هم پایداری آموزش را فراهم کرد و به سرعت به استاندارد صنعت تبدیل شد.
موج چهارم، Latent Diffusion بود که در سال ۲۰۲۲ توسط Robin Rombach و همکارانش در LMU Munich معرفی شد. این معماری، فرآیند diffusion را از فضای پیکسل به فضای نهان VAE منتقل کرد و هزینه محاسباتی را چند مرتبه کاهش داد. Stable Diffusion که از این معماری استفاده میکند، یکی از پرکاربردترین مدلهای تصویری امروز است.
| نسل | معماری | مزیت | محدودیت |
|---|---|---|---|
| اول | VAE | پایداری و فضای نهان پیوسته | کیفیت پایین، تار |
| دوم | GAN | کیفیت بالا، sharp | ناپایداری و mode collapse |
| سوم | Diffusion | کیفیت و پایداری | هزینه محاسباتی بالا |
| چهارم | Latent Diffusion | کیفیت + کارایی | پیچیدگی معماری |
مکانیزم Diffusion: forward و reverse
در Diffusion، فرآیند تولید شامل دو مرحله است. مرحلهی اول، فرآیند forward است که در آن، یک تصویر واقعی بهتدریج با نویز گاوسی خراب میشود تا در نهایت به نویز خالص تبدیل شود. این فرآیند با پارامتر β_t کنترل میشود و در فرم بسته بهصورت زیر نوشته میشود:
x_t = sqrt(alpha_bar_t) * x_0 + sqrt(1 - alpha_bar_t) * epsilon
where alpha_bar_t = product of (1 - beta_i) for i = 1..t
در این معادله، x_0 تصویر اصلی، x_t تصویر در گام t و ε نویز گاوسی است. پارامتر beta_t بهطور معمول بهصورت خطی یا کسینوسی از ۰.۰۰۰۱ تا ۰.۰۲ افزایش مییابد. alpha_bar_t، جرم تجمعی از beta_t را نشان میدهد.
مرحلهی دوم، فرآیند reverse است. در این مرحله، مدل یاد میگیرد که با دیدن x_t و گام زمانی t، نویز ε را پیشبینی کند. این فرمولبندی که به آن epsilon-prediction میگویند، در DDPM معرفی شد و اساس تقریباً همه مدلهای تصویری مدرن است:
x_(t-1) = 1/sqrt(alpha_t) * (x_t - (1-alpha_t)/sqrt(1-alpha_bar_t) * epsilon_theta(x_t, t)) + sigma_t * z
در این معادله، epsilon_theta شبکه عصبی است که نویز را پیشبینی میکند، sigma_t واریانس شرطی و z نویز تصادفی است. این فرآیند، از t=T شروع میشود (که x_T نویز خالص است) و تا t=0 ادامه مییابد که در آن x_0 تصویر تمیز است.
نکتهی مهم: کیفیت تصویر نهایی، بستگی مستقیم به کیفیت پیشبینی نویز در هر گام دارد. اگر مدل در پیشبینی نویز خطا کند، خطا در گامهای بعدی تجمع مییابد و به artifacts منجر میشود. برای درک مبانی، مدلهای زبانی بزرگ را ببینید.
Diffusion یک فرآیند معکوس زمانی است: از نویز خالص شروع میکند و در چند صد گام، به تصویر تمیز میرسد. جادو در این فرآیند تدریجی است، نه در یک جهش ناگهانی.
Latent Space و فشردهسازی ادراکی
اجرای diffusion در فضای پیکسل، بهدلیل ابعاد بالا، هزینه محاسباتی قابل توجهی دارد. یک تصویر ۵۱۲ در ۵۱۲ پیکسل با سه کانال رنگی، حدود ۷۸۶ هزار بعد دارد. اجرای diffusion در این فضا، نیازمند منابع محاسباتی قابل توجه است.
Latent Diffusion این مسئله را با انتقال فرآیند به فضای نهان یک VAE حل میکند. در این معماری، تصویر ابتدا بهوسیلهی encoder VAE به یک نمایش نهان کمبعد (مثلاً ۶۴ در ۶۴ با چهار کانال) تبدیل میشود. فرآیند diffusion در این فضای نهان انجام میشود و در پایان، تصویر با decoder VAE از فضای نهان به فضای پیکسل بازگردانده میشود.
مزیت این رویکرد، کاهش چشمگیر هزینه محاسباتی است. در Stable Diffusion، فرآیند diffusion در فضای نهان با ابعاد ۶۴ در ۶۴ انجام میشود که حدود ۴۸ برابر کمتر از فضای پیکسل ۵۱۲ در ۵۱۲ است. این کاهش، به آموزش و اجرای سریعتر منجر میشود.
نکتهی مهم: کیفیت VAE، تعیینکنندهی کیفیت تصویر نهایی است. اگر VAE در فشردهسازی یا بازسازی خطا داشته باشد، این خطا به تصویر نهایی منتقل میشود. به همین دلیل، VAEهای استفادهشده در مدلهای مدرن، بهطور دقیق تنظیم شدهاند و از معماریهای خاص برای حفظ جزئیات استفاده میکنند.
Text Encoding و پل بین متن و تصویر
برای تولید تصویر از متن، مدل باید متن را به یک نمایش معنایی تبدیل کند که با فضای نهان تصویر همراستا باشد. این کار با یک encoder متن انجام میشود که معمولاً از مدلهای زبانی مثل CLIP از OpenAI استفاده میکند.
مدل CLIP (Contrastive Language-Image Pre-training) که توسط Alec Radford و همکارانش در OpenAI در سال ۲۰۲۱ معرفی شد، یک مدل دوگانه است که در آن، encoder متن و encoder تصویر در فضای مشترکی آموزش میبینند. این آموزش، بهگونهای است که متن و تصویرهای مرتبط، در این فضا نزدیک و متن و تصویرهای نامرتبط، دور از هم قرار میگیرند.
در Stable Diffusion، بهجای CLIP از مدلهای پیشرفتهتری مثل OpenCLIP یا T5 استفاده میشود که توانایی درک متنهای پیچیدهتر را دارند. این encoderها، متن prompt را به یک بردار تعبیهی عددی تبدیل میکنند که بهعنوان conditioning در فرآیند diffusion استفاده میشود.
نکتهی مهم: کیفیت encoder متن، تعیینکنندهی کیفیت همراستایی تصویر با prompt است. اگر encoder نتواند معنای prompt را بهدرستی درک کند، تصویر تولیدشده ممکن است با prompt همراستا نباشد. برای درک مبانی، RAG چیست و چرا دقت مدلها را بالا میبرد را ببینید.
Guidance: بین وفاداری و تنوع
Guidance، یکی از مهمترین تکنیکها در تولید تصویر با AI است. این تکنیک، به مدل اجازه میدهد بین وفاداری به prompt و تنوع تصویر تعادل برقرار کند.
سادهترین نوع guidance، classifier guidance است که در آن یک classifier جداگانه آموزش میبیند که تصاویر را بر اساس کلاس دستهبندی میکند و gradient آن برای هدایت فرآیند diffusion استفاده میشود. اما این رویکرد، نیازمند یک classifier جداگانه و آموزش پیچیده است.
رویکرد مدرنتر، classifier-free guidance است که توسط Jonathan Ho و Tim Salimans در سال ۲۰۲۲ معرفی شد. در این رویکرد، مدل هم با condition (متن prompt) و هم بدون condition آموزش میبیند. در زمان نمونهگیری، خروجی این دو حالت با یک ضریب guidance ترکیب میشود:
epsilon_guided = epsilon_uncond + guidance_scale * (epsilon_cond - epsilon_uncond)
در این معادله، epsilon_uncond پیشبینی نویز بدون condition و epsilon_cond پیشبینی نویز با condition است. ضریب guidance_scale، تعیین میکند که مدل چقدر به prompt وفادار باشد.
نکتهی مهم: انتخاب guidance_scale، یک تصمیم مهندسی کلیدی است. در Stable Diffusion، مقدار guidance_scale بهطور معمول بین ۷ تا ۱۲ تنظیم میشود. مقادیر پایینتر، تصاویر متنوعتر اما کمتر وفادار به prompt تولید میکند؛ مقادیر بالاتر، تصاویر وفادارتر اما اشباعشده و کمتنوع.
Samplers و کیفیت تصویر نهایی
Samplers الگوریتمهایی هستند که فرآیند reverse diffusion را از t=T به t=0 اجرا میکنند. سادهترین sampler، DDPM است که در آن، همهی گامهای زمانی اجرا میشوند. اما این رویکرد کند است و ممکن است به ۱۰۰۰ گام نیاز داشته باشد.
Samplers پیشرفتهتر مثل DDIM از Jiaming Song و Stefano Ermon، DPM-Solver از Cheng Lu و Heun، و Euler Ancestral، میتوانند کیفیت مشابه را در چند ده گام به دست آورند. این الگوریتمها، از معادلات دیفرانسیل تصادفی و deterministic برای تعریف یک مسیر کوتاهتر به تصویر نهایی استفاده میکنند.
نکتهی مهم: انتخاب sampler و تعداد گام، یک تصمیم مهندسی مهم است. samplers مختلف، ویژگیهای متفاوتی دارند. مثلاً DDIM گامهای تعیینگرا تولید میکند که نتایج تکرارپذیرتری دارند، در حالی که Euler Ancestral از گامهای تصادفی استفاده میکند که تنوع بیشتری ایجاد میکند.
در پروژههای خودم، انتخاب sampler بر اساس نیاز تنظیم میشود: برای تولید سریع، DPM-Solver++ با ۲۰ گام. برای کیفیت بالا، Heun با ۵۰ گام. برای تنوع، Euler Ancestral با ۳۰ گام. برای درک مبانی، کاربردهای هوش مصنوعی مولد در تولید محتوا را ببینید.
چرا تصاویر واقعگرایانه بهنظر میرسند؟
سؤال کلیدی: چرا تصاویر تولیدشده با diffusion، بهطور محسوسی واقعگرایانهتر از تصاویر تولیدشده با GAN بهنظر میرسند؟ پاسخ در چند ویژگی ساختاری diffusion نهفته است.
ویژگی اول، توزیع کامل داده است. در GAN، generator فقط learning signal از discriminator دریافت میکند که در نهایت یک classification دوسطحی است. در diffusion، مدل یاد میگیرد که در هر گام زمانی، توزیع شرطی کل داده را تقریب بزند. این توزیع کاملتر، به تولید تصاویری منجر میشود که در همهی جنبهها واقعگرایانهتر هستند.
ویژگی دوم، استحکام در آموزش است. در GAN، عدم تعادل بین generator و discriminator میتواند به mode collapse منجر شود که در آن، generator فقط تعداد محدودی از حالتها را تولید میکند. diffusion از این مشکل رنج نمیبرد، چون هدف آموزش صریح است (پیشبینی نویز) و نیازی به بازی min-max ندارد.
ویژگی سوم، پوشش جزئیات است. diffusion در هر گام، نویز را پیشبینی میکند. این پیشبینی، در گامهای ابتدایی به ساختار کلی تصویر کمک میکند و در گامهای انتهایی به جزئیات دقیق. این فرآیند تدریجی، به تولید تصاویری با جزئیات دقیق منجر میشود که در GAN دشوار است.
ویژگی چهارم، ترکیب با latent space است. با استفاده از latent space VAE، مدل میتواند روی ویژگیهای معنایی سطح بالا تمرکز کند و VAE جزئیات را بازسازی کند. این تقسیم کار، به کیفیت بالاتر در تصویر نهایی منجر میشود.
شکافهای باقیمانده و حالتهای شکست
با تمام پیشرفتها، مدلهای تصویری فعلی شکافهای مهمی دارند که باید در نظر گرفته شوند.
شکاف اول، دست و انگشتان است. یکی از شایعترین خطاهای مدلهای تصویری، تولید دست و انگشت با تعداد یا حالت اشتباه است. علت این مشکل، پیچیدگی ساختار دست و فراوانی کمتر آن در داده آموزشی است.
شکاف دوم، متن در تصویر است. مدلهای تصویری معمولاً در تولید متن داخل تصویر ضعیف عمل میکنند. متنهای تولیدشده معمولاً بیمعنا یا با حروف نادرست هستند. این محدودیت بهدلیل پیچیدگی ذاتی تولید متن دقیق با diffusion است.
شکاف سوم، فیزیک و منطق است. مدلها در درک فیزیک ساده (مثل جاذبه) و منطق تصویر (مثل انعکاس در آینه) ضعیف عمل میکنند. مثلاً ممکن است تصویری تولید شود که در آن، سایه در جهت اشتباهی بیفتد.
شکاف چهارم، سوگیری در داده آموزشی است. مدلهای تصویری بر اساس دادههایی آموزش دیدهاند که ممکن است شامل سوگیریهای فرهنگی، جنسیتی یا نژادی باشد. این سوگیریها به تصاویر تولیدشده منتقل میشوند. برای درک دقیقتر، اخلاقیات استفاده از هوش مصنوعی مولد را ببینید.
شکاف پنجم، مسئله حق مؤلف است. مدلها بر اساس دادههایی آموزش دیدهاند که ممکن است شامل تصاویر دارای حق مؤلف باشد. اگر تصویر تولیدشده، شباهت محسوسی به تصویر موجود داشته باشد، مسائل حقوقی مطرح میشود.
پرسشهای پرتکرار درباره تصویر AI
چرا تصاویر تولیدشده با diffusion واقعگرایانهتر از GAN هستند؟ چون diffusion توزیع کامل داده را تقریب میزند و از مشکل mode collapse رنج نمیبرد. همچنین، فرآیند تدریجی denoising به جزئیات دقیقتر منجر میشود.
تفاوت Latent Diffusion با Diffusion معمولی چیست؟ در Latent Diffusion، فرآیند diffusion در فضای نهان VAE انجام میشود، نه در فضای پیکسل. این کار، هزینه محاسباتی را چند مرتبه کاهش میدهد بدون افت محسوس کیفیت.
چه عواملی بر کیفیت تصویر نهایی تأثیر میگذارند؟ سه عامل اصلی: کیفیت VAE (که فضای نهان را تعریف میکند)، کیفیت encoder متن (که درک prompt را تعیین میکند) و انتخاب sampler و تعداد گام (که فرآیند reverse را کنترل میکند).
چرا تصاویر AI گاهی دست یا انگشت اشتباه دارند؟ علت اصلی، پیچیدگی ساختار دست و فراوانی کمتر آن در داده آموزشی است. مدلها معمولاً در تولید اشیاء پیچیده با ساختار خاص، ضعیفتر عمل میکنند.
چه روشهایی برای بهبود کیفیت تصویر وجود دارد؟ سه رویکرد: اول، استفاده از prompt دقیق و جامع. دوم، تنظیم مناسب guidance_scale و sampler. سوم، استفاده از تکنیکهای پیشرفته مثل ControlNet و IP-Adapter برای کنترل دقیقتر.
آیا میتوان تصویر تولیدشده با AI را ویرایش کرد؟ بله، ابزارهایی مثل inpainting و outpainting امکان ویرایش بخشهایی از تصویر را فراهم میکنند. تکنیکهایی مثل ControlNet امکان کنترل دقیقتر را فراهم میکنند.
آیا تصاویر تولیدشده با AI حق مؤلف دارند؟ در حقوق فعلی، اکثر کشورها آثار تولیدشده بهطور کامل توسط AI را بدون حق مؤلف میدانند. اما اگر انسان در فرآیند تولید، ورودی خلاقانه قابل توجه داشته باشد، ممکن است مالکیت مشترک ایجاد شود. این حوزه در حال تحول است.
آینده مدلهای تصویری چه خواهد بود؟ سه روند اصلی: اول، ادغام بیشتر با ویدئو و صوت. دوم، کنترل دقیقتر با تکنیکهایی مثل ۳D-aware generation. سوم، شفافیت بیشتر در مورد دادههای آموزشی و مسائل حقوقی. برای مطالعهی مفاهیم پایه، هوش مصنوعی مولد را در ویکیپدیا دنبال کنید.
سنتز نهایی: جادوی ریاضیات
پس از چند سال کار در این حوزه، سه نتیجهگیری برای من روشن است. اول، تولید تصاویر واقعگرایانه با AI، نتیجهی هماهنگی چندین نوآوری فنی است. نه یک الگوریتم واحد، بلکه ترکیبی از VAE، diffusion، text encoding و guidance. درک این ترکیب، کلید فهم کیفیت تصاویر امروز است.
دوم، پیشرفت در این حوزه بهسرعت در حال تحول است. ابزارهایی که دو سال پیش پیشرفته به نظر میرسیدند، امروز ابتدایی هستند. این سرعت، به هم یادگیری مستمر و انطباق سریع نیاز دارد.
سوم، با تمام پیشرفتها، مسائل اخلاقی و حقوقی همچنان نیازمند توجه جدی هستند. این حوزه، بیشتر از متن، ظرفیت سوگیری، جعل و نقض حق مؤلف دارد. قوانین در حال شکلگیری هستند و نقش متخصصان در شکلدهی به آنها کلیدی است. اگر تجربهای از کار با مدلهای تصویری دارید — چه موفق، چه چالشی — تجربهتان را بنویسید. جزئیات آن سناریو، برای متخصصان دیگری که همین مسیر را طی میکنند، ارزشمند است.