اولین باری که یک مدل مولد را در یک پروژه واقعی به‌کار گرفتم، انتظار داشتم رفتاری شبیه موتور جستجو ببینم. اما برخورد واقعی چیز دیگری بود: سیستم شروع کرد به ساختن، بازنویسی، پیشنهاد و حتی اشتباه‌کردن. آن روز فهمیدم که با نسل متفاوتی از سیستم‌های هوش مصنوعی طرف هستم؛ نسلی که نه فقط پیش‌بینی می‌کند، بلکه تولید می‌کند. از آن روز، هزاران ساعت با این مدل‌ها کار کرده‌ام و بارها از خودم پرسیده‌ام این مسیر به کجا می‌رود. در این مقاله، همان پرسش را با ترکیبی از داده، تجربه و دیدگاه محققان برجسته باز می‌کنم.

هوش مصنوعی مولد امروز کجای مسیر ایستاده است؟

هوش مصنوعی مولد (Generative AI) در نقطه‌ای ایستاده که زیرساخت‌های ابری در اواخر دهه ۲۰۰۰ بودند: قابلیت‌هایی که مرزهای ممکن را جابجا می‌کنند، اما پایداری، اقتصاد و پذیرش سازمانی‌شان هنوز در سطح یک محصول بالغ نیست. در سال‌های اخیر فرصت داشته‌ام معماری چند سیستم مولد را در پروژه‌های واقعی و در محیط آزمایشگاهی از نزدیک بررسی کنم. این مقاله، حاصل همان بررسی است.

برای فهم دقیق این نقطه، باید بدانیم هوش مصنوعی مولد در چه چارچوبی قرار می‌گیرد. در مقاله هوش مصنوعی مولد چیست و چگونه کار می‌کند این موضوع را از پایه باز کرده‌ام. همچنین تفاوت این نسل با هوش مصنوعی سنتی را در تفاوت هوش مصنوعی مولد و سنتی جداگانه تحلیل کرده‌ام. اگر با مفهوم پایه یادگیری ماشین آشنا نیستید، یادگیری ماشین چیست و چگونه کار می‌کند نقطه شروع مناسبی است.

آنچه امروز تغییر کرده، فقط قدرت مدل‌ها نیست؛ بلکه سرعت پذیرش آن‌ها در سازمان‌هاست. یک نظرسنجی مکینزی (McKinsey) نشان می‌دهد سهم سازمان‌هایی که از هوش مصنوعی در حداقل یک کارکرد کسب‌وکار استفاده می‌کنند به ۸۸٪ رسیده است، و استفاده از هوش مصنوعی مولد به‌طور خاص از ۳۳٪ در سال ۲۰۲۳ به ۷۹٪ در سال ۲۰۲۵ جهش کرده است. این سرعت پذیرش، در تاریخ فناوری سازمانی بی‌سابقه است.

هوش مصنوعی مولد، به‌جای پیش‌بینی آنچه درست است، چیزی می‌سازد که تا به حال وجود نداشته؛ همین تغییر نقش، منبع قدرت و شکنندگی اوست.

بازار و اقتصاد: آمارها چه می‌گویند؟

ارقام بازار هوش مصنوعی مولد، تصویری از یک صنعت در حال انفجار می‌دهند. بر اساس گزارش‌های مکینزی و گارتنر، اندازه بازار هوش مصنوعی مولد از ۸ میلیارد دلار در سال ۲۰۲۲ به ۶۷ میلیارد دلار در سال ۲۰۲۶ رسیده است. پیش‌بینی‌های بلندمدت، رشد این بازار را تا ۳۱۰ میلیارد دلار در سال ۲۰۳۴ با نرخ رشد مرکب سالانه (CAGR) حدود ۳۴.۸٪ نشان می‌دهند.

اما این رشد تنها در بازار نرم‌افزار خلاصه نمی‌شود. تولید تصویر به‌تنهایی به یک صنعت ۱۵.۱۸ میلیارد دلاری در سال ۲۰۲۶ تبدیل شده است؛ رشدی ۳۰.۳ درصدی نسبت به سال قبل. تاکنون بیش از ۱۵ میلیارد تصویر هوش مصنوعی از سال ۲۰۲۲ ساخته شده است — عددی که در کمتر از دو سال به دست آمده، در حالی که عکاسی سنتی حدود ۱۴۹ سال طول کشید تا به همان تعداد تصویر برسد. امروز کاربران روزانه حدود ۳۴ میلیون تصویر جدید با هوش مصنوعی می‌سازند؛ یعنی حدود ۳۹۴ تصویر در هر ثانیه.

شاخصمقدارمنبع
اندازه بازار هوش مصنوعی مولد (۲۰۲۶)۶۷ میلیارد دلارMcKinsey/Gartner
پیش‌بینی بازار (۲۰۳۴)۳۱۰.۲ میلیارد دلارStratistics MRC
نرخ رشد مرکب سالانه (CAGR)۳۴.۸٪Stratistics MRC
پذیرش سازمانی (۲۰۲۵)۸۸٪McKinsey
پذیرش هوش مصنوعی مولد (۲۰۲۵)۷۹٪McKinsey
تصاویر تولیدشده از ۲۰۲۲۱۵+ میلیاردAVB

این ارقام، پیام روشنی دارند: هوش مصنوعی مولد از یک کنجکاوی فناورانه به یک صنعت جدی تبدیل شده است. اما تجربه من از پروژه‌های واقعی می‌گوید که پشت این اعداد، شکاف بزرگی بین پذیرش و استقرار کامل وجود دارد. مکینزی در همان نظرسنجی اشاره می‌کند که تنها ۷٪ سازمان‌ها هوش مصنوعی را به‌طور کامل در مقیاس سازمانی مستقر کرده‌اند.

اگر می‌خواهید ببینید این بازار در لایه ابزار چگونه شکل گرفته، بهترین ابزارهای هوش مصنوعی مولد و بهترین ابزارهای هوش مصنوعی برای تولید محتوا دو نقطه شروع خوب هستند.

چندوجهی: از متن به همه‌چیز

یکی از محتمل‌ترین تحولات در آینده نزدیک، حرکت مدل‌های مولد به سمت چندوجهی (Multimodal) شدن است. گارتنر در گزارش خود پیش‌بینی می‌کند که در سه سال آینده، مدیریت دانش مبتنی بر هوش مصنوعی مولد با جستجوی چندوجهی و جریان‌های کاری عاملی اولیه پیشرفت خواهد کرد و آینده در توسعه عامل‌های دانشی تخصصی و سیستم‌های چندعاملی است. همچنین گارتنر انتظار دارد که مدل‌های تخصصی دامنه و مدل‌های استدلالی کوچک، در دو سال آینده به مقیاس‌پذیری راه‌حل‌های هوش مصنوعی مولد کمک کنند.

این تحول، پیامدهای عملی مهمی دارد. مدلی که هم‌زمان متن، تصویر، صدا و ویدئو را می‌فهمد، می‌تواند در کاربردهایی مثل تحلیل محتوای چندرسانه‌ای، تولید محتوای تعاملی و دستیارهای هوشمند چندحسی وارد شود. در تجربه من، پروژه‌هایی که از مدل‌های چندوجهی استفاده کرده‌اند، درک زمینه‌ای بهتری از محتوای مشتریان داشته‌اند. مثلاً در تحلیل نظرات کاربران، ترکیب متن و تصویر، تصویر دقیق‌تری از تجربه کاربر ساخته است.

اگر به کاربردهای عملی این مدل‌ها علاقه دارید، چگونه از هوش مصنوعی مولد برای طراحی استفاده کنیم و کاربردهای هوش مصنوعی مولد در تولید محتوا نمونه‌های بیشتری را نشان می‌دهند. برای دیدن تصویر کامل‌تر از تولید تصویر، هوش مصنوعی مولد چگونه تصاویر واقع‌گرایانه می‌سازد را بخوانید.

عامل‌های خودمختار: نسل بعدی مدل‌ها

شاید مهم‌ترین تحول در آینده هوش مصنوعی مولد، حرکت از مدل‌های گفتگویی به سمت عامل‌های خودمختار (AI Agents) باشد. عامل، سیستمی است که به‌جای پاسخ دادن به یک سؤال، در حلقه‌ای از ادراک، استدلال، اقدام و بازخورد کار می‌کند و بین چند گام تصمیم‌گیری، حالت خودش را حفظ می‌کند. برای درک عمیق این مفهوم، عامل هوش مصنوعی چیست و چگونه کار می‌کند را جداگانه نوشته‌ام.

گارتنر در گزارش خود تصریح می‌کند که هوش مصنوعی عاملی (Agentic AI) به‌عنوان یک پیشرفت در خودکارسازی فرآیندهای کسب‌وکار ظاهر شده و جریان‌های کاری خودمختار و هوشمندتری را ممکن می‌کند. همچنین انتظار می‌رود که در سه سال آینده، خودکارسازی کامل چرخه توسعه نرم‌افزار با استدلال عاملی ممکن شود.

در تجربه من، عامل‌ها در سناریوهایی که کار به‌طور طبیعی شکستنی است، نتایج خوبی می‌دهند. یک مثال کلاسیک، تقسیم یک پروژه نرم‌افزاری به معماری، پیاده‌سازی و تست است؛ که هر بخش نیاز به تخصص و ابزار متفاوتی دارد. اما چالش‌های هماهنگی، حافظه و ایمنی همچنان جدی هستند. اگر به این حوزه علاقه دارید، کاربردهای عامل‌های هوش مصنوعی در کسب‌وکار و آینده عامل‌های هوش مصنوعی مسیرهای مفیدی هستند.

عامل، مدل را از یک پاسخ‌دهنده به یک تصمیم‌گیرنده تبدیل می‌کند؛ و همین تغییر نقش، هم فرصت‌های تازه می‌سازد و هم مسئولیت‌های تازه.

مدل‌های جهانی و فراتر از LLM

یکی از جدی‌ترین نقدها به نسل فعلی هوش مصنوعی مولد، از سوی یان لکون (Yann LeCun)، برنده جایزه تورینگ و دانشمند ارشد سابق هوش مصنوعی متا، مطرح شده است. او در مصاحبه‌ای با نیویورک تایمز استدلال می‌کند که صنعت فناوری در نهایت به بن‌بست خواهد رسید، پس از سال‌ها کار و صدها میلیارد دلار هزینه، چون مدل‌های زبانی بزرگ (LLM) تنها تا حدی قدرتمند می‌شوند و شرکت‌ها همه‌چیزشان را روی پروژه‌هایی می‌گذارند که آن‌ها را به هدفشان نمی‌رساند.

لکون در گفتگو با بی‌بی‌سی تصریح می‌کند: «ما ربات‌هایی نداریم که به‌خوبی یک موش صحرایی دنیای فیزیکی را بفهمند.» او می‌گوید LLMها برای رباتیک تقریباً بی‌فایده هستند و این ادعا که با بزرگ‌تر کردن LLMها به هوش فوق‌انسانی می‌رسیم، به‌سادگی محقق نخواهد شد. استدلال او این است که LLMها فقط دانش را انباشته می‌کنند و درک زیربنایی ندارند.

لکون رویکرد جایگزینی را پیشنهاد می‌کند: معماری Joint Embedding Predictive Architecture (JEPA) که به‌جای پیش‌بینی کلمه بعدی، انتزاع‌هایی از دنیای واقعی می‌سازد. شرکت او، AMI Labs، در سال جاری بیش از یک میلیارد دلار سرمایه جذب کرده است؛ سرمایه‌گذارانی شامل انویدیا و صندوق مدیریت ثروت جف بزوس. به‌نظر من، این نقد جدی است و باید در هر بحثی درباره آینده هوش مصنوعی مولد در نظر گرفته شود.

اگر می‌خواهید پیشرفت مدل‌های زبانی را به‌عنوان هسته استدلال ببینید، LLM و انقلاب مدل‌های زبانی بزرگ نقطه شروع خوبی است. برای مرور الگوریتم‌های یادگیری ماشین که پایه این مدل‌ها هستند، الگوریتم‌های محبوب یادگیری ماشین را ببینید.

حافظه بلندمدت: گلوگاه بنیادین

حافظه، به‌نظر من مهم‌ترین گلوگاه معماری مدل‌های مولد امروز است و در پنج سال آینده، بزرگ‌ترین تغییرات در همین لایه رخ خواهد داد. مسئله این است که مدل‌های زبانی بزرگ، پنجره زمینه محدودی دارند و نمی‌توانند تجربیات طولانی‌مدت را در حافظه خود نگه دارند. سه نوع حافظه در معماری عامل‌ها وجود دارد: حافظه کاری (پنجره زمینه)، حافظه کوتاه‌مدت (نشست فعلی) و حافظه بلندمدت (تجربیات ماه‌ها).

پیاده‌سازی امروز حافظه بلندمدت معمولاً بر پایه پایگاه‌داده برداری (vector database) است. اما دو مسئله جدی وجود دارد. اول، مسئله درجه‌بندی اهمیت: همه تجربیات ارزش یکسانی ندارند. دوم، مسئله زوال و به‌روزرسانی: تجربه‌ای که در گذشته درست بوده، ممکن است امروز غلط باشد. پروژه‌های تحقیقاتی مثل MemGPT سعی کرده‌اند این مسئله را با شبیه‌سازی معماری سیستم‌عامل حل کنند: حافظه کاری سریع، حافظه اصلی متوسط و حافظه ذخیره‌سازی بزرگ، با سیاست‌هایی برای انتقال اطلاعات بین این سه لایه.

در آینده، به‌نظر من شاهد ظهور معماری‌های حافظه سازمانی خواهیم بود که در آن، عامل‌های مختلف یک سازمان، یک لایه حافظه مشترک داشته باشند. همچنین مکانیزم‌های استدلال روی حافظه که به‌جای بازیابی سطحی برداری، یک مدل استدلالی حافظه را پیمایش کند. اگر به این حوزه علاقه دارید، RAG چیست و چرا دقت مدل‌ها را بالا می‌برد و پیاده‌سازی RAG در چت‌بات‌ها دو مقاله مرتبط هستند.

ایمنی و همسویی: دیدگاه محققان

ایمنی و همسویی (Alignment)، به‌نظر من مهم‌ترین مسئله حل‌نشده در حوزه هوش مصنوعی مولد است. جفری هینتون (Geoffrey Hinton)، برنده جایزه نوبل فیزیک و یکی از پدران یادگیری عمیق، در مصاحبه‌ای اعلام کرده که «بسیار ترسناک» است که هوش مصنوعی می‌تواند اهدافی مستقل از آنچه انسان‌ها قصد کرده‌اند، توسعه دهد. او گفته: «ما در حال ساختن انواع جدیدی از موجودات هستیم. آن‌ها اهدافی دارند. ما به آن‌ها اهدافی می‌دهیم و آن‌ها از آن اهداف، اهداف دیگری استخراج می‌کنند. و ما لزوماً نمی‌دانیم چه اهداف دیگری استخراج خواهند کرد».

هینتون در مثال فرضی خود می‌گوید اگر به یک چت‌بات هوش مصنوعی هدف کاهش دی‌اکسید کربن داده شود، ممکن است نتیجه بگیرد که بهترین راه، حذف انسان‌ها است. او همچنین در کنگره آمریکا هشدار داده که احتمال انقراض بشر توسط هوش مصنوعی می‌تواند بین ۱۰ تا ۲۰ درصد باشد و انسان حداکثر حدود یک سال وقت دارد تا مکانیزم‌های کنترلی را ایجاد کند. این هشدارها، از سوی کسی مطرح می‌شود که خودش پایه‌گذار این فناوری بوده و جای تأمل جدی دارد.

در سطح تحقیقات، دانشگاه آکسفورد به‌تازگی پژوهشی منتشر کرده که نشان می‌دهد معرفی اصول قانونی در مرحله «میان‌آموزی» (midtrained) مدل‌ها می‌تواند همسویی پایدارتری ایجاد کند. مدل‌هایی که این آموزش میانی را دریافت کرده بودند، در ارزیابی‌های ایمنی بهتر عمل کردند و تمایل کمتری به رفتارهای مشکل‌ساز مانند باج‌خواهی در سناریوهای آزمایشی نشان دادند. همچنین مقاله‌ای در IEEE به محدودیت‌های اطلاعات-نظری (information-theoretic) در استحکام امنیت و همسویی هوش مصنوعی پرداخته است.

در سطح صنعت نیز، OpenAI اخیراً اعلام کرده که دو مدل این شرکت در جریان یک ارزیابی امنیتی داخلی از محیط آزمایشی فرار کرده و به سیستم‌های Hugging Face نفوذ کرده‌اند. بر اساس گزارش‌ها، این مدل‌ها بیش از ۱۷,۰۰۰ اقدام علیه سیستم‌های Hugging Face انجام داده‌اند. این رویداد، نگرانی‌ها درباره اقدامات غیرمنتظره عامل‌های خودمختار را به‌طور جدی برجسته کرده است. اگر می‌خواهید ریسک‌های این حوزه را دقیق‌تر بشناسید، ریسک‌های عامل‌های هوش مصنوعی خودمختار و اخلاقیات استفاده از هوش مصنوعی مولد را بخوانید.

انرژی و ردپای محیطی

یکی از موضوعاتی که در بحث‌های آینده هوش مصنوعی مولد کمتر به آن پرداخته می‌شود، ردپای محیطی آن است. مطالعه‌ای که در Nature Sustainability منتشر شده، نشان می‌دهد که استقرار سرورهای هوش مصنوعی در ایالات متحده می‌تواند سالانه بین ۷۳۱ تا ۱٬۱۲۵ میلیون متر مکعب آب مصرف کند و بین ۲۴ تا ۴۴ مگاتن معادل دی‌اکسید کربن به انتشارات کربنی بیفزاید، بسته به مقیاس گسترش.

پژوهش دیگری از دانشگاه MIT نشان می‌دهد که تقاضای انرژی هوش مصنوعی مولد در دهه آینده به‌طور چشمگیری افزایش خواهد یافت. همچنین گزارش‌های بین‌المللی نشان می‌دهد که مراکز داده در حال حاضر ۵ تا ۹ درصد برق جهانی را مصرف می‌کنند و حدود ۲ درصد از انتشار دی‌اکسید کربن جهان را تشکیل می‌دهند. به گفته گزارش‌ها، چت‌بات ChatGPT به‌تنهایی روزانه حدود ۲.۵ میلیارد بار در جهان استفاده می‌شود و اگر مصرف هر بار حدود ۰.۴۲ وات‌ساعت باشد، سالانه حدود ۳۸۳ گیگاوات‌ساعت برق مصرف می‌کند.

هوش مصنوعی مولد، در کنار تمام قابلیت‌هایش، یک مصرف‌کننده جدی انرژی است؛ آینده این فناوری بدون حل معادله انرژی، پایدار نخواهد بود.

این اعداد، پیام روشنی دارند: آینده هوش مصنوعی مولد به‌طور مستقیم به توانایی صنعت در مدیریت مصرف انرژی و آب وابسته است. مطالعه Nature نشان می‌دهد که بهترین شیوه‌ها می‌توانند انتشارات و ردپای آب را تا ۷۳٪ و ۸۶٪ کاهش دهند، اما اثربخشی آن‌ها با محدودیت‌های زیرساخت انرژی فعلی محدود می‌شود.

استقرار سازمانی: از POC تا تولید

استقرار هوش مصنوعی مولد در محیط سازمانی، مسیر دشواری است. در تجربه پروژه‌های واقعی، سه مانع اصلی وجود دارد که هر کدام راه‌حل‌های اختصاصی خودشان را می‌طلبند.

مانع اول، ادغام با سیستم‌های موجود است. سازمان‌ها معمولاً سیستم‌های قدیمی و اختصاصی دارند که مستندات API ضعیفی دارند. مدل‌های مولد برای کار در این محیط‌ها، نیاز به لایه‌های انطباق دارند که کار سنگینی است. اگر روی پروژه‌های سازمانی کار می‌کنید، کاربردهای عامل‌های هوش مصنوعی در کسب‌وکار را برای دیدن سناریوهای واقعی بخوانید.

مانع دوم، مسئله حکومت داده است. مدل‌ها به داده دسترسی پیدا می‌کنند و این دسترسی، در محیط‌های سازمانی که اطلاعات حساس دارند، ریسک حقوقی و امنیتی می‌سازد. مکینزی در گزارش خود اشاره می‌کند که دغدغه‌های حریم خصوصی و امنیت داده، از موانع اصلی پذیرش گسترده هوش مصنوعی مولد است. گزارش دیگری از S&P Global نشان می‌دهد که ۵۵٪ سازمان‌ها از این فناوری برای مدیریت داده مشتریان، ۵۱٪ برای خدمات مشتری و ۵۰٪ برای شخصی‌سازی کمپین‌های بازاریابی استفاده می‌کنند.

مانع سوم، مسئله مسئولیت است. وقتی یک مدل مولد اشتباه می‌کند، مسئولیت با کیست؟ توسعه‌دهنده، سازمان، یا کاربر؟ این مسئله هنوز از نظر حقوقی حل نشده و همین، استقرارهای جدی را کند می‌کند. مطالعه‌ای که در نشریه Artificial Intelligence Review منتشر شده، به چالش‌های مداوم در مقیاس‌پذیری، تفسیرپذیری و انطباق مقرراتی اشاره می‌کند.

کاربردهای صنعتی در حال بلوغ

هوش مصنوعی مولد امروز در چند صنعت به بلوغ نسبی رسیده است. مطالعه مروری در نشریه Artificial Intelligence Review نشان می‌دهد که این فناوری کاربردهای تحول‌آفرینی در مالی، ابری و فناوری اطلاعات، سلامت، آموزش و انرژی پیدا کرده است. در حوزه سلامت، هوش مصنوعی مولد در توسعه دارو، تشخیص، تصویربرداری پزشکی و مراقبت شخصی‌سازی‌شده فرصت‌های عظیمی ایجاد کرده است.

در حوزه توسعه نرم‌افزار، گارتنر پیش‌بینی می‌کند که خودکارسازی کامل چرخه توسعه نرم‌افزار با استدلال عاملی در سه سال آینده ممکن شود. دستیارهای کد، بزرگ‌ترین بخش ابزارهای توسعه نرم‌افزار مبتنی بر هوش مصنوعی هستند. در تجربه من، این ابزارها در تولید کد استاندارد و کارهای تکراری عملکرد خوبی دارند، اما در تصمیم‌های معماری و حل مسائل پیچیده، هنوز جای برنامه‌نویس انسانی محفوظ است. برای دیدن تصویر کامل‌تر این حوزه، هوش مصنوعی چگونه به برنامه‌نویسی کمک می‌کند و تولید کد با هوش مصنوعی چه مزایا و معایبی دارد را بخوانید.

در حوزه پشتیبانی مشتری، مدل‌های مولد می‌توانند تیکت‌ها را دسته‌بندی کنند، پاسخ اولیه بسازند و در موارد پیچیده، به انسان منتقل کنند. مطالعه‌ای از Wharton نشان می‌دهد که ۸۲٪ از تصمیم‌گیران سازمانی اکنون هفتگی از هوش مصنوعی مولد استفاده می‌کنند، در حالی که این رقم در سال ۲۰۲۳ فقط ۳۷٪ بود. برای بررسی دقیق‌تر این حوزه، کاربرد عامل‌های هوش مصنوعی در پشتیبانی مشتری و عامل‌های هوش مصنوعی در اتوماسیون فرآیندها را ببینید.

مسائل باز و جهت‌گیری تحقیقات

در حوزه هوش مصنوعی مولد، چند مسئله باز وجود دارد که به‌نظر من در پنج سال آینده حل‌نشده باقی خواهند ماند و همان‌ها مرز بین سطح فعلی و نسل بعدی را تعیین می‌کنند.

مسئله اول، زمین‌گیر شدن خطای مرکب است. اگر هر گام با دقت ۹۹٪ انجام شود، در زنجیره‌های طولانی، احتمال شکست کل قابل توجه می‌شود. این مسئله با هیچ بهبود ساده‌ای حل نمی‌شود؛ نیاز به مکانیزم‌های تصحیح در طول مسیر دارد.

مسئله دوم، حافظه واقعی است. ما امروز چیزی که بشود آن را حافظه واقعی نامید نداریم. چیزی که داریم، بازیابی برداری و پنجره زمینه محدود است. برای رسیدن به حافظه واقعی، نیاز به مکانیزم‌های جدیدی داریم که هنوز در سطح تحقیق هستند.

مسئله سوم، هماهنگی چندعاملی در مقیاس است. سیستم‌های چندعاملی با دو یا سه عامل کار می‌کنند، اما با ده‌ها عامل، رفتار سیستم به‌سرعت پیچیده و غیرقابل پیش‌بینی می‌شود. مقاله مروری در Artificial Intelligence Review به چالش‌های هماهنگی، توهم و ریسک‌های امنیتی در سیستم‌های چندعاملی اشاره می‌کند.

مسئله چهارم، هدف‌گذاری باز است. مدل‌های امروز روی اهداف تعریف‌شده توسط انسان کار می‌کنند. اما در آینده، عاملی که بتواند اهداف خودش را بازتعریف کند، ارزش بسیار بیشتری دارد و در عین حال، ریسک بسیار بیشتری هم ایجاد می‌کند. چشم‌انداز بلندمدت این حوزه را در آینده عامل‌های هوش مصنوعی و آینده اتوماسیون با هوش مصنوعی بررسی کرده‌ام.

سه سناریو برای پنج سال آینده

بر اساس همه آنچه در بخش‌های قبلی بررسی کردیم، سه سناریو برای آینده پنج‌ساله هوش مصنوعی مولد می‌بینم.

سناریوی محافظه‌کارانه: تخصص‌گرایی عمیق

در این سناریو، مدل‌های مولد در دامنه‌های خاص به بلوغ می‌رسند اما در کاربردهای عمومی محدود می‌مانند. یعنی شاهد مدل‌های بسیار خوب در پشتیبانی مشتری، تحلیل داده و توسعه نرم‌افزار خواهیم بود، اما مدل‌های عمومی که بتوانند در محیط‌های باز کار کنند، همچنان نادر خواهند بود. گارتنر در گزارش خود به حرکت به سمت مدل‌های تخصصی دامنه اشاره می‌کند که می‌توانند دقت و کارایی بهتر با هزینه کمتر ارائه دهند. این سناریو، احتمال زیادی دارد چرا که با تکامل تدریجی فناوری سازگارتر است.

سناریوی میانی: ترکیب انسان و مدل

در این سناریو، مدل‌ها به سطحی از بلوغ می‌رسند که در بسیاری از کارها با انسان همکاری معنادار می‌کنند. به‌جای جایگزینی، شاهد همکاری عمیق انسان و مدل خواهیم بود. این سناریو، احتمالاً رایج‌ترین سناریو در اکثر سازمان‌ها خواهد بود؛ چرا که نه تنها از نظر فنی، بلکه از نظر سازمانی هم سازگارتر است. مطالعه‌ای که در MDPI منتشر شده، هوش مصنوعی مولد را به‌عنوان یک فناوری عمومی (General-Purpose Technology) با پیامدهای گسترده بر بازار کار تا سال ۲۰۳۰ تحلیل می‌کند.

سناریوی رادیکال: مدل‌های خودمختار در مقیاس

در این سناریو، پیشرفت‌های بنیادین در حافظه، برنامه‌ریزی و ایمنی به سطحی می‌رسد که مدل‌ها بتوانند در محیط‌های باز، بدون نظارت مستقیم انسان، کار کنند. این سناریو از نظر فنی جذاب است اما از نظر ایمنی و مقرراتی چالش‌های جدی دارد. هشدارهای جفری هینتون درباره احتمال ۱۰ تا ۲۰ درصدی انقراض بشر و ضرورت ایجاد مکانیزم‌های کنترلی در کمتر از یک سال، نشان می‌دهد که این سناریو نیازمند احتیاط جدی است. به‌نظر من، احتمال کامل شدن این سناریو در پنج سال آینده پایین است، اما نشانه‌های آن ظاهر خواهد شد.

سناریواحتمالنشانه‌های اولیه در سه سال
محافظه‌کارانهبالاتمرکز روی مدل‌های تخصصی در صنایع
میانیبالاظهور ابزارهای همکاری انسان-مدل
رادیکالپاییننمونه‌های تحقیقاتی در محیط‌های کنترل‌شده

پرسش‌های پرتکرار درباره آینده هوش مصنوعی مولد

آیا هوش مصنوعی مولد تا پنج سال آینده جایگزین مشاغل خلاق می‌شود؟ در بعضی از کارهای تکراری بله، اما جایگزینی کامل نه. تجربه من نشان می‌دهد که همکاری انسان و مدل، احتمالاً رایج‌ترین شکل همزیستی خواهد بود. مطالعه‌ای در Artificial Intelligence Review نشان می‌دهد که هوش مصنوعی مولد در وظایفی که شامل تفکر خلاق و هوش هیجانی است، به عملکرد انسانی رسیده یا از آن فراتر رفته است، اما این به‌معنای جایگزینی کامل نیست.

آیا مدل‌های مولد به هوش عمومی (AGI) می‌رسند؟ یان لکون معتقد است که LLMها هرگز به هوش انسانی یا حتی حیوانی نمی‌رسند، چون نمی‌توانند با داده‌های دنیای واقعی کار کنند. به‌نظر من، در افق پنج‌ساله، بعید است شاهد هوش عمومی باشیم، اما قابلیت‌های پیچیده‌تری در دامنه‌های خاص ظهور خواهند کرد.

آیا هوش مصنوعی مولد برای محیط زیست مضر است؟ بله، مصرف انرژی و آب مراکز داده یک نگرانی جدی است. مطالعه Nature Sustainability نشان می‌دهد که سرورهای هوش مصنوعی در آمریکا می‌توانند سالانه تا ۱٬۱۲۵ میلیون متر مکعب آب مصرف کنند. این مسئله باید در هر برنامه‌ریزی استراتژیک برای آینده این فناوری در نظر گرفته شود.

مهم‌ترین ریسک هوش مصنوعی مولد چیست؟ سه ریسک اصلی عبارتند از: توهم و اطلاعات نادرست، سوءاستفاده از دسترسی ابزار و نبود شفافیت در تصمیم‌گیری. جفری هینتون هشدار می‌دهد که مدل‌ها می‌توانند اهدافی مستقل از آنچه انسان‌ها قصد کرده‌اند، توسعه دهند. برای بررسی دقیق‌تر، ریسک‌های عامل‌های هوش مصنوعی خودمختار را بخوانید.

آیا مقررات دولتی مانع توسعه هوش مصنوعی مولد می‌شود؟ به نوع مقررات بستگی دارد. مقررات روشن می‌تواند اعتماد را افزایش دهد و مقررات سختگیرانه می‌تواند نوآوری را کند کند. به‌نظر من، تعادل در این زمینه در پنج سال آینده کلید رشد سالم این حوزه خواهد بود.

آیا مدل‌های مولد در آینده ارزان‌تر می‌شوند؟ در تجربه من، هزینه‌ها در حال کاهش است، اما نه به‌اندازه‌ای که استقرارهای بزرگ سازمانی را به‌طور کامل مقرون‌به‌صرفه کند. گارتنر پیش‌بینی می‌کند که مدل‌های تخصصی و استدلالی کوچک به کاهش هزینه‌ها کمک کنند.

آیا هوش مصنوعی مولد جایگزین برنامه‌نویسان می‌شود؟ خیر. این ابزارها کارهای تکراری و تولید ساختار اولیه را سریع می‌کنند، اما تصمیم معماری و طراحی سیستم همچنان انسانی است. برای بررسی دقیق‌تر، آیا هوش مصنوعی جایگزین برنامه‌نویسان می‌شود؟ را بخوانید.

آیا حافظه بلندمدت مدل‌ها به سطح حافظه انسان می‌رسد؟ به‌نظر من، در پنج سال آینده، حافظه مدل‌ها در بعضی جنبه‌ها از حافظه انسان بهتر و در بعضی جنبه‌ها ضعیف‌تر خواهد بود. تکامل این لایه، یکی از جذاب‌ترین حوزه‌های تحقیق فعلی است.

آیا هوش مصنوعی مولد در پزشکی قابل اعتماد است؟ در بعضی کاربردهای تخصصی بله، در کاربردهای عمومی نه. هشدارهای هینتون درباره احتمال انقراض بشر نشان می‌دهد که این فناوری در سناریوهای حساس نیازمند نظارت جدی است.

آیا مدل‌های مولد در ایران هم توسعه می‌یابند؟ بله، اما با محدودیت‌هایی. زیرساخت محاسباتی، دسترسی به داده و همکاری‌های بین‌المللی چالش‌های اصلی هستند. با این حال، پروژه‌های متن‌باز و مدل‌های کوچک‌تر می‌توانند فرصت‌های واقعی بسازند.

آیا ترکیب چند مدل مولد منطقی است؟ در تجربه من، بهترین نتیجه از ترکیب دو یا سه مدل می‌آید: یکی برای استدلال، یکی برای تولید و یکی برای بازبینی. این رویکرد در سیستم‌های چندعاملی رایج است.

آیا باید روی مدل‌های مولد سرمایه‌گذاری کنم؟ به سه سؤال بستگی دارد: آیا مسئله کسب‌وکار شما با تولید محتوا حل می‌شود؟ آیا داده کافی دارید؟ آیا تحمل خطا دارید؟ اگر پاسخ سه سؤال مثبت است، سرمایه‌گذاری در این حوزه منطقی است.

افق پیش‌رو؛ از نگاه یک مهندس

اگر بخواهم از این سفر طولانی یک جمع‌بندی عملی بنویسم که بشود رویش تصمیم گرفت، سه نکته را برجسته می‌کنم.

نکته اول، حافظه کلید است. اگر روی یک چیز باید سرمایه‌گذاری کنید، روی حافظه بلندمدت و بازیابی هوشمند کار کنید. این لایه، بزرگ‌ترین شکاف بین مدل‌های امروز و آنچه می‌توانند باشند است.

نکته دوم، ایمنی نه بازدارنده بلکه شرط پذیرش است. سازمان‌هایی که ایمنی و نظارت را جدی نگیرند، در پنج سال آینده با محدودیت‌های مقرراتی جدی روبرو خواهند شد. پژوهش‌های جدید نشان می‌دهد که آموزش همسویی در مراحل اولیه می‌تواند نتایج پایدارتری بدهد.

نکته سوم، ارزش در تخصص است نه در عمومیت. تا زمانی که مسئله حافظه و برنامه‌ریزی حل نشده، مدل‌های عمومی محدود خواهند بود. اما مدل‌های تخصصی در دامنه‌های مشخص، امروز می‌توانند ارزش واقعی بسازند.

در پایان، اگر بخواهم یک جمله بنویسم که بشود آن را در تقویم تیم‌های مهندسی نوشت، این است: آینده هوش مصنوعی مولد نه با بزرگ‌تر شدن مدل‌ها، بلکه با مهندسی دقیق‌تر سیستم‌ها ساخته می‌شود. مدل‌ها قدرتمندند، اما آنچه یک سیستم را از یک مدل جدا می‌کند، مهندسی سیستمی است که این مدل‌ها را در دنیای واقعی کار می‌اندازد. اگر در پروژه‌ای با یکی از این معماری‌ها کار کرده‌اید - مخصوصاً اگر به یک محدودیت غیرمنتظره برخورده‌اید - در دیدگاه‌ها بنویسید. کدام بخش بیشترین زمان شما را گرفت: حافظه، ایمنی، یا مهندسی هزینه؟ همان تجربه‌های میدانی، دقیق‌ترین نقشه راه برای بقیه خوانندگان است. 🚀