این اسکیل چه میکند؟
فریمورک پیشآموزش بینایی-زبان که encoderهای تصویر با وزنهای ثابت را به LLMها متصل میکند.
ORIGINAL DESCRIPTION
Vision-language pre-training framework bridging frozen image encoders and LLMs.
چه زمانی به کار میآید؟
وقتی به کپشن تصویر، پرسشوپاسخ بصری، تصویر-متن… نیاز دارید.
WHEN TO USE
when you need image captioning, visual question answering, image-text…
بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.