مدلهای مولد با سرعت زیادی پیشرفت کردهاند؛ بهطوریکه شبکههای مولد تخاصمی (GANs – Generative Adversarial Networks) نقش مهمی در پیشرفتهای اولیه تولید تصویر و ویدئو، بینایی ماشین و پژوهشهای علمی ایفا کردند. در سالهای اخیر، مدلهای انتشاری (Diffusion Models) با بهرهوری محاسباتی بالا، امکانهای هوش مصنوعی مولد (Generative AI) را گسترش داده و توسعه ابزارهایی مانند انتشار پایدار (Stable Diffusion) را سرعت بخشیدهاند.
این پیشرفتها بخشی از تکامل گستردهتر هوش مصنوعی هستند؛ حوزهای که در آن سازمانها با ترکیب دادههای عظیم، مدلهای یادگیری ماشین و الگوریتمهای پیشرفته، قابلیتهای جدیدی ایجاد میکنند. در این مقاله، بررسی خواهیم کرد که مدلهای انتشاری (Diffusion Models) چگونه کار میکنند، انتشار پایدار (Stable Diffusion) چگونه تصاویر را از طریق پرامپت تولید میکند و این مدلهای هوش مصنوعی چگونه از رویکردهای مولد پیشین مانند شبکههای مولد تخاصمی (GANs) تکامل یافتهاند.
GANها، مدلهای انتشاری و انتشار پایدار (GANs, Diffusion, Stable Diffusion)
ابزارهای تولید تصویر با هوش مصنوعی مانند DALL-E، انتشار پایدار (Stable Diffusion) و Imagen بهطور گسترده در دسترس قرار گرفتهاند، اما فناوری پشت آنها همچنان پیچیده است. برای درک نحوه عملکرد انتشار پایدار (Stable Diffusion)، بررسی مسیر تکامل از شبکههای مولد تخاصمی (GANs) به مدلهای انتشاری (Diffusion Models) و فرآیند تولید تصویر در پشت این فناوریها مفید است.
الگوریتمهای مولد شامل اجزای پیچیده و بههمپیوسته بسیاری هستند، هرچند تولید تصاویر با انتشار پایدار (Stable Diffusion) از دیدگاه کاربر ممکن است ساده به نظر برسد. در ادامه، این فناوریها را یکییکی بررسی میکنیم.
یک شبکه مولد تخاصمی (GAN) از دو بخش تشکیل شده است: یک مولد و یک تمایزدهنده. مولد، تصاویر مصنوعی ایجاد کرده و آنها را در اختیار تمایزدهنده قرار میدهد؛ وظیفه تمایزدهنده این است که تشخیص دهد آیا این تصاویر شبیه به دادههای واقعی هستند یا خیر. در طول فرآیند آموزش، مولد بهصورت تکرارشونده بهبود مییابد تا خروجیهای قانعکنندهتری تولید کند، در حالی که تمایزدهنده پارامترهای خود را تنظیم میکند تا در شناسایی تصاویر مصنوعی بهتر عمل کند.
در نهایت، مولد یاد میگیرد تصاویری تولید کند که آنقدر واقعی و قانعکننده هستند که حتی یک تمایزدهنده پیشرفته ــ و در برخی موارد، چشم انسان ــ را نیز فریب دهند.
پیشبینی ویدئو (Video Prediction) یکی از امیدوارکنندهترین کاربردهای شبکههای مولد تخاصمی (GANs) است. با تحلیل فریمهای قبلی، یک شبکه میتواند آنچه را که ممکن است در آینده نزدیک رخ دهد پیشبینی کند؛ قابلیتی که پیامدهای مهمی برای سیستمهای نظارتی مدرن و پلتفرمهای نگهداری پیشبینانه دارد. شبکههای مولد تخاصمی (GANs) همچنین میتوانند با تحلیل و بازسازی تکتک پیکسلها، از بهبود تصویر و تولید تصاویر با وضوح بالاتر پشتیبانی کنند.
با این حال، شبکههای مولد تخاصمی (GANs) محدودیتهای مهمی نیز دارند. آموزش آنها دشوار و پرهزینه است و ممکن است با مشکل فروپاشی حالت (Mode Collapse) مواجه شوند؛ مشکلی که در آن شبکه بهطور مکرر تصاویر مشابهی تولید میکند. رویکرد آنها برای تبدیل مستقیم نویز تصادفی به خروجیهای باکیفیت نیز میتواند باعث ایجاد ناهماهنگیها و مصنوعات بصری (Visual Artifacts) شود.
مدلهای انتشاری (Diffusion Models) با تقسیم فرآیند تولید تصویر به مراحل کوچکتر و تکرارپذیر، برخی از این چالشها را برطرف میکنند. این فرآیند با افزودن تدریجی نویز گاوسی (Gaussian Noise) به یک تصویر آغاز میشود. بهطور دقیقتر، مدل یک زنجیره مارکوفی (Markov Chain) از گامهای زمانی ایجاد میکند که در آن تصویر از یک حالت واضح در زمان t = 0 به نویزی تقریباً غیرقابل تشخیص در زمان t = T، یعنی مرحله نهایی، منتقل میشود. تعداد گامهای زمانی و برنامه زمانبندی نویز از قبل تعیین میشوند و ممکن است از چند صد تا چند هزار مرحله متغیر باشند.
سپس مدل یاد میگیرد این فرآیند را معکوس کند. بهجای اینکه نویز کامل را در یک مرحله به یک تصویر نهایی تبدیل کند، یاد میگیرد یک تصویر نویزی را به تصویری با نویز کمتر تبدیل کند؛ بهگونهای که از یک گام زمانی به گام زمانی قبلی حرکت میکند و در حین این فرآیند، انتقالها میان این مراحل را میآموزد. پس از آموزش، مدل میتواند نویزی که بهصورت تصادفی نمونهبرداری شده است را به یک تصویر منسجم تبدیل کند.
سپس مدل یاد میگیرد این فرآیند را معکوس کند. بهجای اینکه نویز کامل را در یک مرحله به یک تصویر نهایی تبدیل کند، یاد میگیرد یک تصویر نویزی را به تصویری با نویز کمتر تبدیل کند؛ بهگونهای که از یک گام زمانی به گام زمانی قبلی حرکت کرده و انتقالهای میان آنها را یاد میگیرد. پس از آموزش، مدل میتواند نویز نمونهبرداریشده بهصورت تصادفی را به یک تصویر منسجم تبدیل کند.
مدلهای انتشاری (Diffusion Models) از یک رویکرد حذف نویز تکرارشونده استفاده میکنند. در هر گام زمانی، مدل میزان نویز موجود در تصویر فعلی را تخمین میزند، نسخهای پاکتر از تصویر را پیشبینی میکند و سپس نتیجه را تنظیم میکند تا فرآیند در گام بعدی ادامه یابد. با تولید مکرر پیشبینیها از ورودیهایی که بهتدریج نویز کمتری دارند، مدل میتواند خروجی خود را اصلاح کرده و خطاهای قبلی را برطرف کند. این فرآیند، پایه و اساس مدلهای مدرن تولید تصویر، از جمله انتشار پایدار (Stable Diffusion)، را تشکیل میدهد.
متن چگونه مدلهای انتشاری (Diffusion) و انتشار پایدار (Stable Diffusion) را هدایت میکند؟
برای اینکه تولید تصویر بهصورت هدایتشده انجام شود، انتشار پایدار (Stable Diffusion) ابتدا پرامپت را به نمایشهای برداری به نام اِمبدینگها (Embeddings) تبدیل میکند. سپس از این اِمبدینگها برای کمک به مدل در درک رابطه میان متن و عناصر بصری استفاده میشود.
این فرآیند معمولاً با استفاده از یک مدل زبانی مشابه GPT انجام میشود. اِمبدینگهایی که این مدل تولید میکند، به ورودی بصری اضافه شده و به مدل انتشاری (Diffusion Model) داده میشوند. همچنین، از آنجا که مدلهای انتشاری عمدتاً بر پایه معماریهای U-Net هستند، لایههای توجه متقاطع (Cross-Attention Layers) آنها بر توکنهای متنی منفرد تولیدشده توسط ترنسفورمر (Transformer) تمرکز میکنند.
اما این تمام ماجرا نیست. همچنین از روشی به نام هدایت بدون طبقهبند (Classifier-Free Guidance) استفاده میشود تا تأثیر درخواست متنی در بخشهای بیشتری از مدل گسترش یابد. در هر مرحله از حذف نویز (Denoising Step)، شبکه دو خروجی تولید میکند: یکی با دسترسی به متن و دیگری بدون دسترسی به متن. سپس تفاوت میان این دو نتیجه تقویت شده و دوباره به مدل بازگردانده میشود؛ این کار به الگوریتم کمک میکند تا با دقت بیشتری در جهت درخواست متنی حرکت کند.
مدلهای انتشاری (Diffusion) در مقابل انتشار پایدار (Stable Diffusion)
مدلهای انتشاری (Diffusion Models) پایه و اساس تولید تصویر با هوش مصنوعی را تشکیل میدهند، در حالی که انتشار پایدار (Stable Diffusion) یک مدل انتشاری نهفته (Latent Diffusion Model) متنباز است که توسط شرکت Stability AI ایجاد شده و تولید تصاویر با وضوح بالا را در دسترستر کرده است.
برخلاف بسیاری از مدلهای اختصاصی تولید تصویر با هوش مصنوعی که تنها از طریق رابطهای برنامهنویسی کاربردی (APIs) قابل استفاده هستند، انتشار پایدار (Stable Diffusion) را میتوان دانلود، سفارشیسازی و بهصورت محلی اجرا کرد تا نیازهای خاص را برآورده کند. همچنین این مدل در مقایسه با بسیاری از رویکردهای پیشین مبتنی بر مدلهای انتشاری، به منابع محاسباتی کمتری نیاز دارد.
DALL-E 2 که توسط شرکت OpenAI توسعه یافته است، بر بسیاری از مفاهیم و فناوریهایی بنا شده که این شرکت پیشتر توسعه داده بود. برای مثال، این مدل از اِمبدینگهای CLIP (CLIP Embeddings) استفاده میکند که توکنهای متنی را به اعداد تبدیل میکنند.
شبکه CLIP (CLIP Network) بهطور ویژه با استفاده از جفتهای دادهای تصویری و متنی آموزش داده شده است. بدون ورود به جزئیات ریاضی، میتوان گفت این شبکه یاد میگیرد اِمبدینگهای برداری یک تصویر و توضیح متنی مرتبط با آن را در یک فضای مشخص به یکدیگر نزدیک کند، در حالی که فاصله قابلتوجهی میان تصاویر و متنهای نامرتبط ایجاد میکند.
مدلهای انتشاری (Diffusion Models) در پردازش تصاویر بزرگ با مشکل مواجه هستند؛ بنابراین آنها معمولاً فقط با ورودیهای کوچک، اغلب با اندازه ۶۴×۶۴ پیکسل، کار میکنند و سپس برای رسیدن به وضوح موردنظر از سازوکارهای بزرگنمایی استفاده میکنند. هم DALL-E و هم Imagen شرکت گوگل بر این اصل تکیه دارند.
اما انتشار پایدار (Stable Diffusion) برای مقابله با ابعاد بالای دادهها، راهکار خاص خود را دارد. بهجای کار مستقیم با تصاویر، بخش خودرمزگذار (Autoencoder) آن تصاویر را به نمایشهایی با ابعاد پایینتر تبدیل میکند. همچنان نویز، گامهای زمانی و پرامپت وجود دارند، اما تمام پردازشهای معماری U-Net در یک فضای نهفته فشرده انجام میشوند. پس از آن، یک رمزگشا (Decoder) این نمایش را دوباره به تصویری با اندازه موردنیاز گسترش میدهد.
مدلهای انتشاری ویدئویی (Video Diffusion Models) چگونه ویدئو تولید میکنند؟
انتشار پایدار (Stable Diffusion) بر پایه مدلهای انتشاری (Diffusion Models) ساخته شده است؛ مدلهایی که میتوان آنها را فراتر از تولید تصویر گسترش داد تا با یادگیری روابط میان متن، تصاویر و حرکت، آثار هنری تولیدشده با هوش مصنوعی (AI Art) و محتوای ویدئویی ایجاد کنند. مدلهای ویدئویی بر همان فرآیند انتشاری مورد استفاده در تولید تصویر بنا شدهاند و مؤلفههایی را به آن اضافه میکنند که به سیستمهای هوش مصنوعی کمک میکنند حرکت و روابط زمانی (Temporal Relationships) را درک کنند.
این رویکرد در مدل Make-a-Video شرکت Meta AI بهوضوح دیده میشود. ایده کلی این است که یک مدل انتشاری آموزشدیده را که از قبل میداند چگونه متن را با محتوای بصری مرتبط کند، در نظر بگیریم و قابلیتهای پردازش ویدئو را به آن اضافه کنیم. این مدل همچنین میتواند حرکتهای واقعگرایانه را از دادههای ویدئویی بدون برچسب (Unlabeled Video Data) که از منابع مختلف جمعآوری شدهاند، یاد بگیرد.
اجزای این شبکه شامل موارد زیر هستند:
شبکه Make-a-Video پیچیده است، زیرا اجزای مختلف آن با انواع متفاوتی از دادهها آموزش داده میشوند. شبکه پیشین (Prior Network) و مدلهای ابرتفکیک فضایی (Spatial Super-Resolution Models) با استفاده از تصاویر آموزش میبینند، مدل انتشاری تبدیل متن به تصویر از جفتهای متن-تصویر استفاده میکند، و لایههای کانولوشنی و توجه (Convolution and Attention Layers) مخصوص ویدئو، از ویدئوهای بدون برچسب یاد میگیرند.
مقایسه Imagen و Make-a-Video: مدلهای ویدئویی هوش مصنوعی چه تفاوتی با یکدیگر دارند؟
Imagen و Make-a-Video از معماریهای مشابه مبتنی بر مدلهای انتشاری (Diffusion-Based Architectures) استفاده میکنند، اما در نحوه پردازش دادههای متنی، تصویری و ویدئویی در طول آموزش با یکدیگر تفاوت دارند. در Imagen، رمزگذار CLIP (CLIP Encoder) و شبکه پیشین (Prior Network) با ترنسفورمر T5-XXL جایگزین شدهاند؛ مدلی که برخلاف CLIP، تنها با دادههای متنی آموزش دیده است. مدل انتشاری پایه نیز با لایههای کانولوشنی و توجه (Convolution and Attention Layers) اضافی بهبود یافته است، اما فرآیند آموزش آن کمی متفاوت است؛ زیرا مدل بهصورت همزمان با دادههای تصویری و ویدئویی نمایش داده میشود و تصاویر را مانند ویدئوهایی با یک فریم در نظر میگیرد.
این موضوع نشان میدهد که توضیحات متنی مربوط به ویدئوها، که یافتن آنها در وب دشوار است، احتمالاً در فرآیند آموزش استفاده شدهاند و احتمال دارد از یک مجموعهداده داخلی تولیدشده توسط گوگل استخراج شده باشند. در مرحله بعد، دوباره یک شبکه نمونهبرداری بیشازحد (Supersampling Network) برای دستیابی به نرخ فریم بالاتر و دو مدل ابرتفکیک فضایی (SSR Models) داریم. اما Imagen یک گام فراتر میرود و با افزودن دو مدل بزرگنمایی (Upsampling Models) دیگر و یک مدل ابرتفکیک فضایی (SSR) اضافی، فرآیند را توسعه میدهد.
کاربردهای انتشار پایدار (Stable Diffusion)
انتشار پایدار (Stable Diffusion) یک مولد قدرتمند هوش مصنوعی (AI Generator) است که بر پایه مدلهای انتشاری نهفته تبدیل متن به تصویر ساخته شده و میتواند با استفاده از درخواستهای متنی (Text Prompts) و ورودیهای تصویری، تصاویر واقعگرایانه ایجاد کند. قابلیتهای این فناوری بسیار فراتر از هنر تولیدشده با هوش مصنوعی (AI Art) است و کاربردهای آن در صنایع مختلفی گسترش یافته که به تولید تصویر با وضوح بالا، تولید داده مصنوعی و ایجاد محتوای بصری متکی هستند.
بله، انتشار پایدار (Stable Diffusion) یک مدل هوش مصنوعی متنباز (Open-Source AI Model) است که توسط Stability AI منتشر شده و در اختیار جامعه گستردهتر هوش مصنوعی قرار گرفته است. اگرچه خود مدل را میتوان بهصورت رایگان استفاده و دانلود کرد، هزینه استفاده ممکن است به نحوه دسترسی شما به آن بستگی داشته باشد؛ برای مثال، استفاده از پلتفرمهای آنلاین انتشار پایدار (Stable Diffusion Online Platforms)، نصب محلی (Local Installation) یا ابزارهای شخص ثالث (Third-Party Tools) میتواند هزینههای متفاوتی داشته باشد.
تصاویر تولیدشده با انتشار پایدار (Stable Diffusion) میتوانند در پروژههای تجاری مورد استفاده قرار گیرند، اما حقوق استفاده از آنها به نسخه خاص مدل، پلتفرم مورد استفاده و شرایط مجوز (Licensing Terms) بستگی دارد. کسبوکارهایی که از مولد هوش مصنوعی انتشار پایدار (Stable Diffusion AI Generator) استفاده میکنند، باید پیش از استفاده از تصاویر تولیدشده در مواد بازاریابی، محصولات یا محتوای قابل مشاهده برای مشتریان، مجوز مربوطه را بررسی کنند.
اگرچه انتشار پایدار (Stable Diffusion) میتواند تصاویر واقعگرایانه ایجاد کند و از تولید تصاویر با وضوح بالا (High-Resolution Image Synthesis) پشتیبانی کند، همچنان دارای محدودیتهایی است. این مدل ممکن است جزئیات نادرست تولید کند، سوگیریهای موجود در دادههای آموزشی را بازتاب دهد یا برای ایجاد خروجی مطلوب به مهندسی دقیق درخواستهای متنی (Prompt Engineering) نیاز داشته باشد. درک قابلیتها و محدودیتهای انتشار پایدار (Stable Diffusion) هنگام بهکارگیری آن در جریانهای کاری کسبوکار (Business Workflows) ضروری است.
انتشار پایدار XL (Stable Diffusion XL) نسخه جدیدتری از انتشار پایدار (Stable Diffusion) است که با هدف بهبود کیفیت تصویر، ترکیببندی (Composition) و درک درخواستهای متنی (Prompt Understanding) در مقایسه با نسخههای قبلی طراحی شده است. مانند سایر نسخههای انتشار پایدار (Stable Diffusion)، این مدل از مدلهای انتشاری نهفته (Latent Diffusion Models) برای تولید تصاویر استفاده میکند، اما قابلیتهای پیشرفتهتری برای ایجاد تصاویر دقیقتر و واقعگرایانهتر ارائه میدهد.
برای اجرای انتشار پایدار (Stable Diffusion) بهصورت محلی، معمولاً به یک رایانه با پردازنده گرافیکی (GPU) قدرتمند و مقدار کافی حافظه ویدئویی (VRAM) نیاز دارید تا وظایف تولید تصویر را بهصورت کارآمد پردازش کند. نیازمندیهای دقیق به نسخه مدل، وضوح تصویر و رابط کاربری مورد استفاده بستگی دارد. ابزارهایی مانند رابط کاربری وب انتشار پایدار (Stable Diffusion Web UI) نصب انتشار پایدار بهصورت محلی و آزمایش تنظیمات مختلف را آسانتر میکنند.
جمعبندی
مدلهای انتشاری (Diffusion Models) با فراهم کردن امکان تولید پایدار و باکیفیت تصاویر و ویدئوها، از طریق رویکردی کارآمدتر نسبت به تکنیکهای پیشین، هوش مصنوعی مولد را متحول کردهاند. انتشار پایدار (Stable Diffusion) پردازش تصویر را به یک فضای نهفته کاهشیافته (Reduced Latent Space) منتقل میکند و به سازمانها اجازه میدهد تصاویر دقیق و جزئیاتدار ایجاد کنند، در حالی که به منابع محاسباتی کمتری نیاز دارند. در همین حال، مدلهای جدیدتر تبدیل متن به ویدئو همچنان در حال گسترش قابلیتهایی هستند که سیستمهای مبتنی بر مدلهای انتشاری میتوانند ارائه دهند.
چالش واقعی کسبوکارها دیگر این نیست که آیا هوش مصنوعی مولد میتواند نتایج چشمگیری ایجاد کند یا خیر؛ بلکه مسئله این است که چگونه میتوان این قابلیتها را به دستاوردهای ارزشمند و معنادار تبدیل کرد. یافتن موارد استفاده مناسب، یکپارچهسازی هوش مصنوعی با فرآیندهای موجود و ساخت راهکارهایی که با اهداف کسبوکار همراستا باشند، نیازمند رویکردی دقیق و سنجیده است.
با کارشناسان هوش مصنوعی ما تماس بگیرید تا بررسی کنید مدلهای انتشاری چگونه میتوانند از اهداف کسبوکار شما پشتیبانی کنند، موارد استفاده امیدوارکننده را اعتبارسنجی کنند و ایدههای هوش مصنوعی مولد را به راهکارهای عملی تبدیل کنند.
با کارشناسان هوش مصنوعی ما در تماس باشید تا بررسی کنید چگونه مدلهای انتشار(diffusion) میتوانند از اهداف کسبوکار شما پشتیبانی کنند، سناریوهای کاربردیِ نویدبخش را اعتبارسنجی نمایند و ایدههای هوش مصنوعی مولد را به راهکارهای کاربردی تبدیل کنند.


دیدگاهتان را بنویسید