بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

tensorrt-llm

فارسی + English

این اسکیل چه می‌کند؟

بهینه‌سازی inference مدل LLM با NVIDIA TensorRT برای حداکثر throughput و حداقل latency.

ORIGINAL DESCRIPTION

Optimizes LLM inference with NVIDIA TensorRT for maximum throughput and lowest latency.

چه زمانی به کار می‌آید؟

برای production روی NVIDIA A100/H100، وقتی نیاز دارید…

WHEN TO USE

for production deployment on NVIDIA GPUs (A100/H100), when you need…

بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.