بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

verl-rl-training

فارسی + English

این اسکیل چه می‌کند؟

راهنمای آموزش LLM با RL در verl یا Volcano Engine RL.

ORIGINAL DESCRIPTION

Provides guidance for training LLMs with reinforcement learning using verl (Volcano Engine RL).

چه زمانی به کار می‌آید؟

هنگام پیاده‌سازی RLHF، GRPO، PPO یا دیگر الگوریتم RL…

WHEN TO USE

when implementing RLHF, GRPO, PPO, or other RL algorithms…

بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.