L9 · نماذج تُطيل التفكير
ما الذي أنبته التدريب
تصف ما تعلّمه DeepSeek-R1-Zero من المكافآت القابلة للتحقق وحدها، وما لم يُضفه ذلك التدريب.
بدأ R1-Zero من نموذج أساسي، ولم يُضبط ضبطًا دقيقًا على حلول مكتوبة قط. لم يكن لديه إلا قاعدتا الدرس السابع. وفي مسابقة رياضيات صعبة، ارتفعت درجته في المحاولة الواحدة من 15.6 إلى 71.0 بالمئة.