بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

slime-rl-training

فارسی + English

این اسکیل چه می‌کند؟

راهنمای post-training مدل LLM با RL در slime، فریم‌ورک Megatron+SGLang.

ORIGINAL DESCRIPTION

Provides guidance for LLM post-training with RL using slime, a Megatron+SGLang framework.

چه زمانی به کار می‌آید؟

هنگام آموزش مدل GLM، پیاده‌سازی تولید دادهٔ سفارشی…

WHEN TO USE

when training GLM models, implementing custom data generation…

بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.

کاربردهای مرتبط

برچسب‌گذاری خودکار بر اساس نام و توضیح؛ ممکن است نیازمند اصلاح باشد.