بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

grpo-rl-training

فارسی + English

این اسکیل چه می‌کند؟

راهنمای تخصصی fine-tuning با GRPO/RL و TRL برای آموزش استدلال و تسک‌های تخصصی مدل.

ORIGINAL DESCRIPTION

Expert guidance for GRPO/RL fine-tuning with TRL for reasoning and task-specific model training

چه زمانی به کار می‌آید؟

در دادهٔ اصلی، کاربرد جداگانه‌ای ثبت نشده است. توضیح بالا و صفحهٔ منبع را ببینید.