بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

nemo-evaluator-sdk

فارسی + English

این اسکیل چه می‌کند؟

ارزیابی LLM در بیش از ۱۰۰ benchmark از بیش از ۱۸ harness شامل MMLU، HumanEval، GSM8K، ایمنی و VLM با اجرای چند backend.

ORIGINAL DESCRIPTION

Evaluates LLMs across 100+ benchmarks from 18+ harnesses (MMLU, HumanEval, GSM8K, safety, VLM) with multi-backend execution.

چه زمانی به کار می‌آید؟

وقتی… مقیاس‌پذیر لازم است

WHEN TO USE

when needing scalable…

بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.