این اسکیل چه میکند؟
راهنمای post-training مدل LLM با RL در slime، فریمورک Megatron+SGLang.
ORIGINAL DESCRIPTION
Provides guidance for LLM post-training with RL using slime, a Megatron+SGLang framework.
چه زمانی به کار میآید؟
هنگام آموزش مدل GLM، پیادهسازی تولید دادهٔ سفارشی…
WHEN TO USE
when training GLM models, implementing custom data generation…
بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.
کاربردهای مرتبط
برچسبگذاری خودکار بر اساس نام و توضیح؛ ممکن است نیازمند اصلاح باشد.