ACM MM & ECCV 2022 | 美团视觉8篇论文揭秘内容领域的智能科技
总第545 篇
2022年 第062篇
内容生产
围绕素材解析、创意生成、展示自适应等内容生产链路,需要持续优化智能抠图、智能延拓、图像文案生成等核心功能模块。因此,在驱动视觉语义分割、跨模态生成等底层技术方向需要持续升级与创新。 ECCV | Adaptive Spatial-BCE Loss for Weakly Supervised Semantic Segmentation(基于自适应空间二元交叉熵的弱监督语义分割)论文作者 :吴桐( 北京理工大学&美团实习生 ),高广宇( 北京理工大学 ),黄君实( 美团 ),魏晓明( 美团 ),魏晓林( 美团 ),刘驰( 北京理工大学 )
论文下载 : PDF
论文作者 :费政聪( 美团 ),黄君实( 美团 ),魏晓明( 美团 ),魏晓林( 美团 )
论文下载 : PDF
论文简介 :现有的图像描述 ( Image Caption )生成方法通常从左到右逐个生成单词,并受到局部信息( 包括给定图像和历史单词 )的约束。有许多研究的目标是在解码过程中尝试利用全局上下文进行优化,例如迭代解码,然而,如何有效和高效地结合未来上下文仍有待探索。
为了应对这个问题,受到非自回归图像描述( Non-Autoregressive Image Captioning, NAIC )可以利用修改掩码操作来理解双边关系的启发,我们旨在将这一进步移植到传统的自回归图像描述模型中,同时保持推理效率,不增加额外的时间成本,如下图4所示:
具体来说,自回归和非自回归图像描述模型首先通过共享视觉编码器进行联合训练,以强制视觉编码器包含有效的未来上下文;然后,迫使自回归图像描述模型对其不一致预测词的分布校准( 类似于知识蒸馏 ),同时额外捕捉非自回归模型中跨层交换的因果变化。实验结果表明,我们提出的方法在MS COCO基准的自动指标评估和人类评估方面明显超过了最先进的基准模型。
本文方法对于智能广告文案、商品介绍生成( 如下图5 )有重大价值,有助于提升营销、曝光点击率,减少人工设计成本。对于广告营销文案的生成,产品图片给用户的第一印象来自于外观,它对用户的决策有着重要的影响。因此,图像描述生成系统必须能够充分挖掘图片视觉信息,反映产品的外观特色,从而促成消费者的点击和下单转化。本文提出的高效未来信息建模方法,有助于更细粒度、更高质量的文本生成。
内容分发
论文作者 :丁子涵( 北京航空航天大学&美团实习生 ),惠天瑞( 中国科学院信息工程研究所 ),黄君实( 美团 ),魏晓明( 美团 ),魏晓林( 美团 ),刘偲( 北京航空航天大学 )
论文下载 : PDF
论文简介 :Panoptic Narrative Grounding (PNG) 是一项新兴任务,其目标是分割由静止图像的密集叙述字幕描述的things和stuff类别的视觉对象。之前的两阶段方法首先通过现有的全景分割模型提取分割候选区域,然后进行粗粒度的区域-短语匹配以得到每个名词短语对应的分割结果。然而,两阶段方法通常有以下缺点:1)第一阶段低质量候选区域的性能限制;2)区域特征池化导致的空间细节损失;3)需为things和stuff类别分别设计的复杂策略。为了缓解这些缺点,我们提出了一种单阶段端到端像素短语匹配网络( PPMN )(如下图6),通过直接将每个短语与其对应的像素匹配并简单的组合输出全景分割。
因此,我们的模型可以从密集注释的像素-短语对而不是稀疏的区域-短语对的监督中利用足够和更精细的跨模态语义对应。此外,我们还提出了一种语言兼容像素聚合( LCPA )模块,通过多轮优化进一步增强短语特征的判别能力,该模块为每个短语选择最兼容的像素,以自适应地聚合相应的视觉上下文。大量的实验表明,我们的方法在 PNG 数据集上实现了最优的性能,该任务也为信息流场景下的像素级图像内容理解及图文对齐任务垫定了基础。
本文方法对于信息流场景下的用户评论标签挖掘有重大价值。评论数据作为用户对商家的多维度描述,承载了大量真实、多样的用户兴趣点。挖掘评论数据中的文本标签及图片定位信息,有助于我们从图文多模态角度深入理解用户兴趣,进而实现内容的精准投放。本文的方法弥补了以往粗粒度图文挖掘任务的不足,通过端到端的像素-语句级别对齐,实现了更为精准、细致的多模态内容理解能力。该能力可直接用于图像标签挖掘、跨模态以文搜图、图文多模态一致性判断等任务。 ACM MM | Concept Propagation via Attentional Knowledge Graph Reasoning for Video-Text Retrieval(基于注意力机制的知识图推理概念传播方法及其在视频文本检索任务中的应用)论文作者 :方晟( 中国科学院计算技术研究所 ),王树徽( 中国科学院计算技术研究所 ),卓君宝( 中国科学院计算技术研究所&美团实习生 ),黄庆明( 中国科学院计算技术研究所 ),马彬( 美团 ),魏晓明( 美团 ),魏晓林( 美团 )
论文下载 : PDF
论文简介 :随着短视频平台的兴起,视频数量的急剧增长使得视频文本检索技术越发关键。这个任务的主要挑战在于如何找到视频和文本间细粒度的语义关联。为了解决这个问题,本文提出了一个基于注意力的概念传播网络框架( Attentional Concept Propagation, ACP ),如下图7所示:
论文作者 :冯承健( 美团 ),钟毓杰( 美团 ),揭泽群( 美团 ),初祥祥( 美团 ),任海兵( 美团 ),魏晓林( 美团 ),谢伟迪( 上海交通大学 ),马林( 美团 )
论文下载 : PDF
论文简介 :这项工作的目标是建立一个可扩展的目标检测器,使用零手动标注将目标检测器扩展到新的/未见过的类别,如下图8所示:- 为了追求泛化性,我们提出了一个两阶段的开放词汇目标检测器,使用来自预训练视觉语言模型的文本编码器对类别无关的物体提议区域进行分类。
-
为了将RPN 提议区域的视觉潜在空间与预训练文本编码器的潜在空间配对,我们提出了区域提示( prompt )学习方法,以将文本嵌入空间与物体区域的视觉特征对齐。 - 为了扩大学习过程以检测更广泛的类别,我们通过一种新颖的自训练框架利用可用的在线资源,该框架允许在大量嘈杂的未经处理的网络图像上训练所提出的检测器。
- 为了评估我们提出的检测器,PromptDet,我们在具有挑战性的 LVIS 和MS-COCO数据集进行了广泛的实验。与现有方法相比,PromptDet使用更少的额外训练图像和零手动标注,表现出卓越的检测性能。
论文作者 :魏浩( 中国科学院计算技术研究所 ),王树徽( 中国科学院计算技术研究所 ),韩歆哲( 中国科学院计算技术研究所 ),薛哲( 北京邮电大学 ),马彬( 美团 ),魏晓明( 美团 ),魏晓林( 美团 )
论文下载 : PDF
论文简介 :图像文本匹配( Image-Text Matching )是跨模态领域的一个基础研究问题,旨在度量图像和文本之间的语义相似性。最近的工作通常使用难负样本挖掘( Hard Negative Mining )来捕获图像和文本之间的多重对应关系。不幸的是,拥有丰富信息的负样本在训练数据中非常稀少,很难在随机采样的小批次中获得。受到因果推理的启发,本文通过类比难负样本挖掘和因果效应优化来解决这一问题。本文提出了反事实匹配( Counterfactual Matching, CFM )方法( 如下图9 ),用于更加有效的匹配关系挖掘。
论文作者 :卓君宝( 中国科学院计算技术研究所&美团实习生 ),朱妍( 中国科学院计算技术研究所&美团实习生 ),崔书豪( 美团 ),王树徽( 中国科学院计算技术研究所 ),黄庆明( 中国科学院计算技术研究所 ),马彬( 美团 ),魏晓明( 美团 ),魏晓林( 美团 )
论文下载 : PDF
论文简介 :零样本视频分类旨在识别在模型训练过程中从未见过的视频类别,一般通过构建视觉特征和语义嵌入之间的映射来实现。研究表明通过挖掘视频包含的物体作为属性并结合外部知识能有效提升模型的性能。但是,从可见类别挖掘的物体属性不能有效泛化到未见类,且外部知识中属性之间的关系与视频中出现的属性关系存在较大偏差。本文提出了基于网络知识的属性构建方法和属性-类别关系挖掘方法,如下图11所示:本文方法可在需要新的类别标签时,快速实现样本冷启动,加速标签模型研发。对基于标签的短视频内容运营,媒资管理,内容分发等应用能起到重要支撑。可以通过少量示例样本快速构建视频分类模型,从存量内容池中自动挖掘高价值内容( 如:“探店种草” )匹配大众点评App“发现好去处”的产品定位,在首页信息流中为用户提供丰富的信息参考,如下图12所示:
模型量化
ACM MM | Towards Accurate Post-Training Quantization for Vision Transformer(迈向Vision Transformer的高精度后量化算法)论文作者 :丁一芙( 北京航空航天大学&美团实习生 ),秦浩桐( 北京航空航天大学 ),闫青华( 北京航空航天大学 ),柴振华( 美团 ),刘俊杰( 美团 ),魏晓林( 美团 ),刘祥龙( 北京航空航天大学 )
论文下载 : PDF
论文简介 :后量化是CNN模型压缩中较为成熟的一个研究方向,然而如何在Vision Transformer上实现无损后量化在学界依然是一个没有解决的问题。通过引入高精度的后量化算法,可以解决Transformer结构在服务端部署效率不高、显存占用过大的落地痛点,同时也为Mobile Transformer在移动端设备的落地提供更多可能性。现有的研究方法中比较代表的是华为诺亚方舟实验室的FQ-ViT,在极低比特的情况下对量化误差的评估与实际仍存在较大误差,同时对具有幂率分布的SoftMax层的处理方法有待有进一步优化。基于上述观察,我们提出了一种名为APQ-ViT ( Accurate Post-training Quantization framework for Vision Transformer )的方法( 如下图13 ):通过引入底部误差消除的逐块校准策略,基于块层面感知量化误差,减少量化对最终输出的影响,并设计了一种马太效应保持的Softmax后量化映射方法,可以达到在8 bit工业场景下基本性能无损的压缩效果,并且在更低比特( 4/6 bit) 下也能显著降低模型量化带来的精度损失。
🎈美团无人机团队技术分享:大规模、高精度激光SLAM
11月23日10:00-11:00,美团无人机团队将在清华大学-美团数字生活联合研究院学术沙龙上分享《大规模、高精度激光SLAM》主题报告,欢迎报名听课~美团科研合作