面向视觉-语言模型的递进互提示学习
大规模预训练视觉-语言模型CLIP(contrastive language-image pretraining)可将输入图像和文本投影到公共语义空间实现跨模态对齐,且在广泛的下游任务上展现了较强的泛化能力。然而,现有的提示学习方法通常在CLIP的视...
计算机应用研究
2025年06期
立即查看 >
图书推荐
相关工具书