این اسکیل چه میکند؟
pipeline دومرحلهای مکانیابی تصویر؛ استخراج عبارت ارجاعی از جفت تصویر و caption و نگاشت آن با VLM به bounding box در مختصات پیکسل.
ORIGINAL DESCRIPTION
Two-step image grounding pipeline: extracts referring expressions from (image, caption) pairs and grounds them to pixel-space bounding boxes via a VLM.
چه زمانی به کار میآید؟
در دادهٔ اصلی، کاربرد جداگانهای ثبت نشده است. توضیح بالا و صفحهٔ منبع را ببینید.