بازگشت به نتایج جستجو

firecrawl / AGENT SKILL

blip-2-vision-language

فارسی + English

این اسکیل چه می‌کند؟

فریم‌ورک پیش‌آموزش بینایی-زبان که encoderهای تصویر با وزن‌های ثابت را به LLMها متصل می‌کند.

ORIGINAL DESCRIPTION

Vision-language pre-training framework bridging frozen image encoders and LLMs.

چه زمانی به کار می‌آید؟

وقتی به کپشن تصویر، پرسش‌وپاسخ بصری، تصویر-متن… نیاز دارید.

WHEN TO USE

when you need image captioning, visual question answering, image-text…

بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.