المرحلة ٣ · متقدم · D9
توليد الصور والفيديو
معظم صور الذكاء الاصطناعي ومقاطعه تبدأ تشويشًا خالصًا.
١٥ درسًا · ١٧٨ دقيقةمتقدّم
عن هذا الفصل
التوليد هو عكس التدمير. أضف ضجيجًا إلى صورة بخطوات صغيرة حتى لا يبقى منها شيء، ثم درّب نموذجًا على التراجع خطوة واحدة، فتستطيع أن تبدأ من ضجيج خالص وتمشي رجوعًا إلى صورة. يبني هذا الفصل الفكرة من المرمّزات الذاتية إلى المرمّزات المتغايرة (VAEs) إلى الشبكات التوليدية التنافسية (GANs) وصولًا إلى الانتشار (diffusion)، لترى ما الذي أصلحه كل منها. وستعرف أيضًا لماذا يغيّر التوجيه (guidance) مظهر الناتج، ولماذا جعل الانتشار الكامن كل هذا ميسور التكلفة، وما الذي يجعل الفيديو متماسكًا، وما الذي لا تراه درجة منشورة.
ما ستقدر عليه، درسًا بعد درس
- ١١٠ دقائق
اضغط ثم أعد البناء
تُدرِّب مرمّزًا ذاتيًا وتقرأ ما احتفظ به عنق الزجاجة.
- ٢١١ دقيقة
التجوّل في الفضاء الكامن
تُدرّج بين نقطتين في الفضاء الكامن وتصف المسار.
- ٣١٢ دقيقة
المرمّزات الذاتية المتغايرة
تشرح لماذا يتنبأ المرمّز المتغاير بتوزيع بدل نقطة.
- ٤١٢ دقيقة
شبكتان في صراع
تصف لعبة المولّد والمميّز ونقطة توازنها.
- ٥١٢ دقيقة
لماذا تنهار الشبكات التنافسية
تتعرف على انهيار الأنماط وتذكر علاجين شائعين له.
- ٦١٢ دقيقة
تدمير الصورة عمدًا
تضيف الضجيج وفق جدول وتصف الصورة عند كل مرحلة.
- ٧١٣ دقيقة
تعلّم التراجع خطوة واحدة
تشرح ما الذي تتنبأ به الشبكة عند كل خطوة إزالة ضجيج.
- ٨١٢ دقيقة
الصعود نحو البيانات
تقرأ الدرجة (score) كاتجاه نحو صور أكثر احتمالًا.
- ٩١١ دقيقة
جداول المعاينة
تُقايِض بين عدد الخطوات والجودة وتختار معاينًا يناسب ميزانيتك.
- ١٠١٣ دقيقة
الاشتراط والتوجيه
تشرح التوجيه بلا مصنّف وتتوقع أثر رفع معامل التوجيه.
- ١١١٢ دقيقة
الانتشار في الفضاء الكامن
تشرح لماذا خفّض تشغيل الانتشار على التمثيلات الكامنة التكلفة بهذا القدر.
- ١٢١٢ دقيقة
من الكلمات إلى الصور
تتتبع كيف يوجّه مرمّز النص توليد الصورة، وأين يسيء الفهم.
- ١٣١٢ دقيقة
جعل الزمن متسقًا
تشرح ما الذي يتغير حين يجب أن تتفق اللقطات فيما بينها.
- ١٤١٢ دقيقة
تقييم صانع الصور
تقرأ رقم FID بأمانة وتسمّي ثلاثة أشياء لا يراها.
- ١٥١٢ دقيقة
ماذا تفهم هذه النماذج
تحكم من حالات الفشل على ما يمثّله النموذج حقًا وما يزيّفه.