این اسکیل چه میکند؟
ارزیابی LLM در بیش از ۶۰ benchmark دانشگاهی شامل MMLU، HumanEval، GSM8K، TruthfulQA و HellaSwag.
ORIGINAL DESCRIPTION
Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag).
چه زمانی به کار میآید؟
هنگام سنجش کیفیت مدل، مقایسه، گزارش…
WHEN TO USE
when benchmarking model quality, comparing models, reporting…
بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.