این اسکیل چه میکند؟
ارزیابی مدل تولید کد در HumanEval، MBPP، MultiPL-E و بیش از ۱۵ benchmark با pass@k.
ORIGINAL DESCRIPTION
Evaluates code generation models across HumanEval, MBPP, MultiPL-E, and 15+ benchmarks with pass@k metrics.
چه زمانی به کار میآید؟
هنگام benchmark مدل کد، مقایسهٔ کدنویسی…
WHEN TO USE
when benchmarking code models, comparing coding…
بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.
کاربردهای مرتبط
برچسبگذاری خودکار بر اساس نام و توضیح؛ ممکن است نیازمند اصلاح باشد.