بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

serving-llms-vllm

فارسی + English

این اسکیل چه می‌کند؟

سرویس‌دهی LLM با throughput بالا با PagedAttention و continuous batching در vLLM.

ORIGINAL DESCRIPTION

Serves LLMs with high throughput using vLLM's PagedAttention and continuous batching.

چه زمانی به کار می‌آید؟

هنگام استقرار API مدل LLM در production، بهینه‌سازی inference…

WHEN TO USE

when deploying production LLM APIs, optimizing inference…

بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.