این اسکیل چه میکند؟
مدل ترکیبی RNN+Transformer با inference از مرتبهٔ O(n)؛ زمان خطی، context نامحدود، بدون KV cache؛ آموزش موازی مثل GPT و inference ترتیبی مثل RNN.
ORIGINAL DESCRIPTION
RNN+Transformer hybrid with O(n) inference. Linear time, infinite context, no KV cache. Train like GPT (parallel), infer like RNN (sequential).
چه زمانی به کار میآید؟
در دادهٔ اصلی، کاربرد جداگانهای ثبت نشده است. توضیح بالا و صفحهٔ منبع را ببینید.