بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

openrlhf-training

فارسی + English

این اسکیل چه می‌کند؟

فریم‌ورک پربازده RLHF با شتاب Ray+vLLM.

ORIGINAL DESCRIPTION

High-performance RLHF framework with Ray+vLLM acceleration.

چه زمانی به کار می‌آید؟

برای آموزش PPO، GRPO، RLOO و DPO مدل بزرگ 7B-70B+؛ مبتنی بر Ray، vLLM و ZeRO-3؛ دو برابر…

WHEN TO USE

for PPO, GRPO, RLOO, DPO training of large models (7B-70B+). Built on Ray, vLLM, ZeRO-3. 2×…

بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.