《Learning from Models and Data for Visual Grounding》
本论文旨在提高预训练的视觉-语言模型的视觉定位能力,解决图像描述和视觉定位之间的联系问题。论文提出了一种名为SynGround的新框架,通过从多个预训练模型中转移知识,结合数据驱动学习和知识迁移的方式来增强预训练的视觉-语言模型的视觉定位能力。论文的实验表明,通过SynGround框架的训练,可以将ALBEF在Flickr30k、RefCOCO+ Test A和RefCOCO+ Test B数据集上的指向游戏准确率从79.38%、69.35%和53.77%分别提高到87.26%、79.06%和63.67%。此外,论文还使用了开放词汇的目标检测器来生成合成图像和文本的合成边界框,并通过优化掩码-注意力一致性目标来微调预训练的视觉-语言模型。