این اسکیل چه میکند؟
آموزش/fine-tune مدل زبان با TRL روی Hugging Face Jobs؛ SFT، DPO، GRPO، reward modeling و تبدیل GGUF برای local deploy؛ راهنمای dataset، hardware، برآورد هزینه و ماندگاری مدل.
Train or fine-tune language models using TRL (Transformer Reinforcement Learning) on Hugging Face Jobs infrastructure. Covers SFT, DPO, GRPO and reward modeling training methods, plus GGUF conversion for local deployment. Includes guidance on dataset preparation, hardware selection, cost estimation, and model persistence.
چه زمانی به کار میآید؟
در دادهٔ اصلی، کاربرد جداگانهای ثبت نشده است. توضیح بالا و صفحهٔ منبع را ببینید.