المرحلة ٣ · متقدم · R2
أوراق فارقة، معادة البناء
أربع عشرة ورقة بنت هذا المجال. وتستطيع إعادة بناء جوهر كل واحدة منها.
١٤ درسًا · ١٥٤ دقيقةبحثي
عن هذا الفصل
قراءة ورقة فارقة جيدة، وإعادة بناء فكرتها المركزية أفضل، لأنها تجبر كل افتراض مخفي على الظهور. يأخذ كل درس هنا ورقة واحدة، ويعرض المشكلة التي جعلتها ضرورية، ويعيد تركيب شكلها المحوري صورةً تستطيع تحريكها، ثم يقول بوضوح ما الذي لم يصمد منها. وحين تستحيل إعادة الإنتاج الكاملة داخل درس، تبني أصغر نسخة صادقة ونسمّي ما فُقد. وتخرج بسلسلة تمشيها من عام ١٩٥٨ إلى النماذج التي تُطلق اليوم.
ما ستقدر عليه، درسًا بعد درس
- ١١١ دقيقة
البِرسِبترون (1958)
تشغّل قاعدة تعلّم 1958، وتقول بدقة ما تستطيع فصله وما لا تستطيع.
- ٢١٢ دقيقة
تعلّم التمثيلات بالانتشار الخلفي للأخطاء (1986)
ترسل الخطأ إلى الخلف عبر طبقة وسطى وترى XOR تسقط.
- ٣١١ دقيقة
لي‑نت (1998)
تحسب ما توفره مشاركة الأوزان، وتقول ما أعلنته لي‑نت‑5 على الأرقام.
- ٤١١ دقيقة
أليكس‑نت (2012)
تقول ما الذي غيّرته أليكس‑نت فعلًا، وأين كانت أوزانها الستون مليونًا.
- ٥١٠ دقائق
ورد‑تو‑فيك (2013)
تبني متجهات الكلمات من المصاحبة وحدها، وتختبر ادعاء التناظر بأمانة.
- ٦١٠ دقائق
من تسلسل إلى تسلسل (2014)
تشرح عنق الزجاجة ذا المتجه الثابت، ولماذا أفادت قراءة المصدر معكوسًا.
- ٧١٣ دقيقة
الانتباه هو كل ما تحتاجه (2017)
تحسب رأس انتباه واحدًا بيدك، وتقول لماذا حلّت الكتلة محل التكرار.
- ٨١١ دقيقة
GPT-2 وGPT-3
تقول ما الذي تغيّر بينهما، وما الذي يفعله التعلّم داخل السياق وما لا يفعله.
- ٩١٠ دقائق
قوانين التوسّع (2020)
تلائم قانون قوى على مسح تجريه بنفسك، وتقرأ ما يعد به الأسّ.
- ١٠١٠ دقائق
شينشيلا (2022)
تقسم ميزانية تدريب واحدة بالطريقة المثلى حوسبيًا، وتقول ما الذي غيّرته.
- ١١١١ دقيقة
كليب (2021)
تبني مصفوفة مطابقة الصور والنصوص، وتقول ما يعنيه التصنيف بلا أمثلة حقًا.
- ١٢١٢ دقيقة
الانتشار بإزالة الضجيج (2020)
تتبع صورة إلى الضجيج وعودتها، وتقول ما الذي يُدرَّب النموذج على التنبؤ به.
- ١٣١١ دقيقة
إنستركت‑جي‑بي‑تي (2022)
تلائم نموذج مكافأة من المقارنات، وتقول ما الذي اشترته بيانات التفضيل البشري.
- ١٤١١ دقيقة
ديب‑سيك V2 وV3
تسعّر ذاكرة الانتباه والنموذج المتناثر، وتقول ما اشتراه كل خيار.