این اسکیل چه میکند؟
ارزیابی LLM در بیش از ۱۰۰ benchmark از بیش از ۱۸ harness شامل MMLU، HumanEval، GSM8K، ایمنی و VLM با اجرای چند backend.
ORIGINAL DESCRIPTION
Evaluates LLMs across 100+ benchmarks from 18+ harnesses (MMLU, HumanEval, GSM8K, safety, VLM) with multi-backend execution.
چه زمانی به کار میآید؟
وقتی… مقیاسپذیر لازم است
WHEN TO USE
when needing scalable…
بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.