L4 · تدريب نموذج لغوي
DPO، والاكتفاء بالأقل
تقارن DPO بـRLHF من حيث الأجزاء المتحركة، وتقول أين تحلّ قواعد مكتوبة محل التسميات البشرية.
في 2023 أثبت فريق من جامعة ستانفورد أنه يمكن الاستغناء عن نموذج المكافأة. فالنموذج اللغوي يعطي كل رد احتمالًا أصلًا. درّبه على التفضيلات مباشرة، فيختفي المُقيِّم المنفصل.