بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

evaluating-code-models

فارسی + English

این اسکیل چه می‌کند؟

ارزیابی مدل تولید کد در HumanEval، MBPP، MultiPL-E و بیش از ۱۵ benchmark با pass@k.

ORIGINAL DESCRIPTION

Evaluates code generation models across HumanEval, MBPP, MultiPL-E, and 15+ benchmarks with pass@k metrics.

چه زمانی به کار می‌آید؟

هنگام benchmark مدل کد، مقایسهٔ کدنویسی…

WHEN TO USE

when benchmarking code models, comparing coding…

بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.

کاربردهای مرتبط

برچسب‌گذاری خودکار بر اساس نام و توضیح؛ ممکن است نیازمند اصلاح باشد.