المرحلة ٢ · متوسط · L3
المحوّل
بنية واحدة ابتلعت المجال كله.
١٣ درسًا · ١٣٤ دقيقةمتقدّم
عن هذا الفصل
في كتلة المحوّل جزءان يعملان، هما الانتباه وطبقة التغذية الأمامية، وتسويتان وعمليتا جمع تحفظان ثباتها. كدّس الكتلة فتحصل على النماذج التي تسمع عنها. يفتح هذا الفصل الكتلة، ويتتبّع التيار المتبقي عبر الكومة، ويبيّن لماذا تحمل طبقات التغذية الأمامية معظم المعاملات. ثم تعدّ معاملات نموذج حقيقي بيدك، وتدرّب محوّلًا صغيرًا على هذا الجهاز.
ما ستقدر عليه، درسًا بعد درس
- ١١٠ دقائق
تشريح كتلة واحدة
تسمّي أجزاء كتلة المحوّل وترتيبها.
- ٢١٠ دقائق
طبقة التغذية الأمامية
تشرح شكل التوسيع ثم التضييق وتحسب معاملاته.
- ٣١٠ دقائق
التسوية والوصلات المتبقية
تشرح الفرق بين التسوية القبلية والبعدية، ولماذا تتدرّب القبلية بسهولة أكبر.
- ٤١٠ دقائق
التيار المتبقي
تصف الكومة بأنها طبقات تقرأ من تيار واحد مشترك وتكتب فيه.
- ٥١٠ دقائق
المواضع في التطبيق
تحدّد أين تعمل المواضع الدوّارة في الكتلة، وكيف يُمدّ طول السياق.
- ٦١١ دقيقة
ثلاثة أشكال للمحوّل
تختار المرمّز أو مفكّك الترميز أو كليهما لمهمة معطاة.
- ٧١٠ دقائق
GPT وBERT
تقارن بين هدفَي التدريب، وما يتقنه كل نموذج.
- ٨١٠ دقائق
أين تسكن المعلومات
تلخّص الأدلة على أن طبقات التغذية الأمامية تعمل ذاكرةَ مفاتيح وقيم.
- ٩١١ دقيقة
خليط الخبراء
تشرح التوجيه، والفرق بين المعاملات الكلية والنشطة.
- ١٠٩ دقائق
من متجه إلى الرمز التالي
تتتبّع آخر متجه عبر رأس المخرجات حتى احتمال لكل رمز.
- ١١١٠ دقائق
لماذا تفوّق على الشبكة المتكررة
تشرح لماذا يتدرّب المحوّل على التوازي، ولا تستطيع الشبكة المتكررة ذلك.
- ١٢١١ دقيقة
قراءة ملف إعدادات حقيقي
تقرأ الطبقات والرؤوس والعرض والمفردات، وتعدّ معاملات النموذج بيدك.
- ١٣١٢ دقيقة
ابنِ محوّلًا صغيرًا
تجمع الأجزاء في نموذج يعمل، وتدرّبه على هذا الجهاز.