این اسکیل چه میکند؟
کوانتیزهسازی 4-bit پس از آموزش برای LLM با حداقل افت دقت.
ORIGINAL DESCRIPTION
Post-training 4-bit quantization for LLMs with minimal accuracy loss.
چه زمانی به کار میآید؟
برای استقرار مدل بزرگ 70B یا 405B روی GPU مصرفی، وقتی به ۴ برابر… حافظه نیاز دارید
WHEN TO USE
for deploying large models (70B, 405B) on consumer GPUs, when you need 4× memory…
بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.