این اسکیل چه میکند؟
Simple Preference Optimization برای همراستاسازی LLM؛ جایگزین DPO بدون مدل مرجع با عملکرد بهتر، ۶٫۴ امتیاز بیشتر در AlpacaEval 2.0.
ORIGINAL DESCRIPTION
Simple Preference Optimization for LLM alignment. Reference-free alternative to DPO with better performance (+6.4 points on AlpacaEval 2.0).
چه زمانی به کار میآید؟
در دادهٔ اصلی، کاربرد جداگانهای ثبت نشده است. توضیح بالا و صفحهٔ منبع را ببینید.