این اسکیل چه میکند؟
بهینهسازی attention در transformer با Flash Attention برای سرعت ۲ تا ۴ برابر و کاهش حافظه ۱۰ تا ۲۰ برابر.
ORIGINAL DESCRIPTION
Optimizes transformer attention with Flash Attention for 2-4x speedup and 10-20x memory reduction.
چه زمانی به کار میآید؟
هنگام آموزش/اجرای transformer با توالی طولانی…
WHEN TO USE
when training/running transformers with long sequences…
بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.