بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

simpo-training

فارسی + English

این اسکیل چه می‌کند؟

Simple Preference Optimization برای هم‌راستاسازی LLM؛ جایگزین DPO بدون مدل مرجع با عملکرد بهتر، ۶٫۴ امتیاز بیشتر در AlpacaEval 2.0.

ORIGINAL DESCRIPTION

Simple Preference Optimization for LLM alignment. Reference-free alternative to DPO with better performance (+6.4 points on AlpacaEval 2.0).

چه زمانی به کار می‌آید؟

در دادهٔ اصلی، کاربرد جداگانه‌ای ثبت نشده است. توضیح بالا و صفحهٔ منبع را ببینید.