این اسکیل چه میکند؟
مدل بینایی-زبان CLIP برای بازیابی تصویر-متن، طبقهبندی zero-shot، استخراج embedding، export به ONNX و استقرار TensorRT.
CLIP vision-language model for image-text retrieval, zero-shot classification, embedding extraction, ONNX export, and TensorRT deployment.
چه زمانی به کار میآید؟
هنگام fine-tuning…
when fine-tuning…
بخشی از متن اصلی با «…» قطع شده است. ادامهٔ آن حدس زده یا تکمیل نشده است.