بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

evaluating-llms-harness

فارسی + English

این اسکیل چه می‌کند؟

ارزیابی LLM در بیش از ۶۰ benchmark دانشگاهی شامل MMLU، HumanEval، GSM8K، TruthfulQA و HellaSwag.

ORIGINAL DESCRIPTION

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag).

چه زمانی به کار می‌آید؟

هنگام سنجش کیفیت مدل، مقایسه، گزارش…

WHEN TO USE

when benchmarking model quality, comparing models, reporting…

بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.