این اسکیل چه میکند؟
بهینهسازی inference مدل LLM با NVIDIA TensorRT برای حداکثر throughput و حداقل latency.
ORIGINAL DESCRIPTION
Optimizes LLM inference with NVIDIA TensorRT for maximum throughput and lowest latency.
چه زمانی به کار میآید؟
برای production روی NVIDIA A100/H100، وقتی نیاز دارید…
WHEN TO USE
for production deployment on NVIDIA GPUs (A100/H100), when you need…
بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.