بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

fine-tuning-with-trl

فارسی + English

این اسکیل چه می‌کند؟

fine-tune در LLM با یادگیری تقویتی TRL؛ SFT برای instruction tuning، DPO برای preference alignment، PPO/GRPO برای reward optimization و reward…

ORIGINAL DESCRIPTION

Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and reward…

چه زمانی به کار می‌آید؟

در دادهٔ اصلی، کاربرد جداگانه‌ای ثبت نشده است. توضیح بالا و صفحهٔ منبع را ببینید.

بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.