بازگشت به نتایج جستجو

nvidia / AGENT SKILL

tao-generate-image-grounding

فارسی + English

این اسکیل چه می‌کند؟

pipeline دومرحله‌ای مکان‌یابی تصویر؛ استخراج عبارت ارجاعی از جفت تصویر و caption و نگاشت آن با VLM به bounding box در مختصات پیکسل.

ORIGINAL DESCRIPTION

Two-step image grounding pipeline: extracts referring expressions from (image, caption) pairs and grounds them to pixel-space bounding boxes via a VLM.

چه زمانی به کار می‌آید؟

در دادهٔ اصلی، کاربرد جداگانه‌ای ثبت نشده است. توضیح بالا و صفحهٔ منبع را ببینید.