视觉语言大模型浅谈及应用
导读:
近期大语言模型的火热之势可谓是扶摇直上,它们的创新与商业化产品层出不穷。然而,你是否了解,其实视觉语言大模型同样也是时代的弄潮儿?它成功地拓宽了语言大模型的领域,将其应用到了图像和文本的多模态任务中。
业务实践中,货拉拉就有着丰富的视觉任务需求,例如车贴识别、车厢识别、司机状态识别、自动驾驶等。
传统的计算机视觉模型在应对数据标注稀少且成本高、学习迁移困难等问题时往往力不从心。但随着大模型的发展,视觉语言大模型昂首走来,预训练的视觉语言大模型甚至能在零样本推理的条件下,也在多模态任务中表现出色。
货拉拉数据科学团队举办的DS Zone(数科星球)行业交流会,有幸邀请到了同济大学的史淼晶教授,他将与我们深入解析视觉语言大模型,并探讨其在开集目标检测和手术器械分割等领域的应用。让我们一起,踏上这一场关于视觉语言大模型的知识之旅!
PART
NO.1
基础知识
第1部分
在计算机视觉领域中,目标类别检测是一类非常重要的任务。传统目标类别检测的输入通常是某场景的图片,而输出则是目标周围的边界框和类别标签。目标类别检测可以认为是一类定位和分类结合的问题,如图1所示。
图1: 在图片中识别出摩托车
这类任务的标准流程中包括了大规模训练数据,边界框标注,训练和测试集共享的类别,如图2所示。目标类别检测在许多实际应用中起着关键作用,例如自动驾驶中的车辆和行人检测、视频监控中的异常情况检测等。
随着深度学习在图像处理方面的进步,目标检测也取得了巨大的进步,代表性的目标检测模型包括R-CNN、Fast R-CNN、Faster R-CNN、YOLO、SSD等。这些模型设计了不同的目标提议和特征提取网络,大大提升了检测效果。
图2: 传统目标类别检测的标准流程
2.语义分割
语义分割是计算机视觉中一项复杂任务,需要大规模的训练数据,并需在像素级上对图片进行标注。与目标检测不同,语义分割要求分类每个像素,生成Segmentation Map,精确提取目标轮廓(如图3)。这种技术在自动驾驶和医疗影像分析等领域有关键应用。主要的语义分割网络有FCN、SegNet、PSPNet等。
图3: 语义分割的输出示例
3.视觉语言大模型
视觉语言大模型标志着自然语言处理模型向视觉和语言的融合的重要转变,为大模型的应用领域注入了新的可能性。典型的例子是OpenAI的CLIP模型,它整合了图像理解和自然语言处理,能够同时处理图像和文本信息,广泛应用于图像标注和生成等任务。CLIP模型的核心特性是将图像和文本映射到同一种表示形式,通过“粘合”图像和文本,使得模型能够进行零样本学习,处理新任务不再需要特定的训练数据,只需依赖在训练期间获取的通用知识,它的训练和推理过程如图4。这意味着CLIP模型可以根据语义内容将文本查询与相关的图像匹配,也能从图像生成描述性文本。特别的,当我们使用CLIP模型进行目标分类时,用户输入的提示(Prompt)对模型的性能影响显著,因此提示的设计有很大的优化空间,例如可以通过迭代使用其他模型来优化设计最佳提示,以更好地完成特定任务。
图4: CLIP模型的训练和推理
PART
NO.2
开集目标检测
1.基本概念
深度神经网络在计算机视觉中
需大量标注数据才能最佳运作
而此过程耗时且昂贵
为解决此问题,Zareian等人(CVPR 21)提出了开集目标检测(OVOD)的新范式。基本思路是OVOD通过训练图像-文本对获取无限的概念词汇,让模型从大量图像和相关文本数据中学习语义概念及其在视觉中的表现。然后,目标检测器可以在有限的基础类别的标注可用时,检测出新的类别。
OVOD引入了一个新方向,将语言和视觉模型融合,利用自然语言的表达能力进行更广泛、灵活的图像识别。这使得模型能在标注数据稀缺时,有效地识别和理解新的物体或概念,为计算机视觉领域带来了新的可能性。
2.提示学习
为了进一步优化这个过程,一种名为"CoOp"的方法在2022年的国际计算机视觉期刊(IJCV)上被提出。CoOp提出了一种自动化提示工程的方法,名为"上下文优化"(Context Optimization)。这种方法试图模拟提示的上下文为连续的表示,这些表示可以从一小部分数据中进行端到端的学习。
CoOp的主要创新在于,它不仅试图学习最佳的提示,还试图理解和优化这些提示的上下文。换句话说,CoOp试图理解给出特定提示的原因,以及这个提示如何影响模型的行为和输出。这种对上下文的理解和优化使得模型能够更好地理解和适应各种不同的任务,从而提高了模型的性能和泛化能力。以下是CoOp模型的基本架构示意图(见图5)。
图5: CoOp模型的基本架构
通过这种方式,CoOp在一定程度上自动化了提示工程,使得我们能够更高效地利用预训练模型的知识,同时也减少了为每个新任务手动设计提示的需要。这种方法为我们理解和利用视觉语言大模型开辟了新的途径,并且可能会为未来的计算机视觉和自然语言处理任务带来重大的改进。
3.开集目标检测(DetPro)
DetPro是一种新的开放词汇物体检测方法,其设计理念是利用视觉语言大模型的提示学习,以解决在之前文献中遇到的两个关键问题:
一是负proposal(即与目标无关的图像区域),尽管对于目标检测非常重要,但以往很难纳入提示的训练中;
二是正proposal(即与目标相关的图像区域)中的物体往往与不同程度的上下文有关。
DetPro的方法如下:首先,训练一个区域proposal网络(RPN)从基本类别的图像中提取proposal。正负proposal的定义如下:负proposal是与ground truth的交集小于阈值的那部分,而正proposal则是与某个ground truth的交集大于阈值的部分。架构如图6所示。
图6: DetPro的基本架构
对于负proposal的纳入,DetPro提出了一种背景解释方案,该方案优化负proposal的embedding(𝒇),使之远离所有其他类别的embedding(𝒕)。在实践中,我们希望任何𝒑𝒏𝒄都很小,可以简单地优化任何𝒑𝒏𝒄为𝟏/(|𝑪𝑩|) (𝐶𝐵为基类别数量)。对于负proposal的图例和损失函数见图7。
图7: 负proposal的损失函数
对于正proposal,DetPro设计了一种根据上下文级别定制的正向proposal集合K=(a-b)/t的上下文分级方案。在第𝑘组中,我们计算概率p_c,并优化正proposal p的类别c内的正损失L_p。对于正proposal的图例和损失函数见图8。
图8: 正proposal的损失函数
DetPro的主要创新包括:一种适用于负proposal纳入的背景解释方案,以及一种带有定制正proposal的上下文分级方案。通过对K组学习表示的平均集成,我们可以得到最终的目标检测结果。DetPro的完整架构和损失函数见图9。
图9: DetPro的完整架构和损失函数
在LVIS-v1数据集上,我们的DetPro相较于基准ViLD模型在物体检测上提升了+3.4 AP(平均精度),在实例分割上提升了+3.0 AP。
我们还直接在Pascal VOC测试集,COCO验证集和Object365验证集上评估了在LVIS上训练的模型,结果显示DetPro在所有三个数据集上都优于基准ViLD,这充分证明了DetPro的泛化能力。
PART 03
可提示的手术器械分割
1.简介与挑战
手术器械分割的目的是在像素级别分割医疗图像中的不同类型的手术器械。
这项任务的难度在于,手术器械的类型繁多,不同的供应商提供的器械种类各异,而且手术器械的组合也在不断变化。同时,手术器械之间的相似性也使得图像分割成为一项挑战。不同类别的器械在外观上可能非常相似,加上器械之间的细微视觉差异和复杂的成像条件,使得器械之间的界定变得模糊。再者,我们还面临着缺乏全面大规模数据集的问题。尽管有许多医疗影像数据集可供使用,但往往缺乏足够的标注数据来训练深度学习模型进行精确的手术器械分割。
然而,得益于视觉语言模型将文本和视觉信息对齐的能力,我们可以以文本提示的方式进行手术器械分割。视觉语言模型可以理解与特定手术器械相关的文本描述,然后根据这些理解来识别和分割图像中的器械。图11就是一个基于视觉语言模型的手术器械分割的应用案例。
图11: 左侧:输入图像及其真实标签;右上:使用预定义类别的常规视觉基础手术器械分割模型;右下:利用视觉语言模型实现可通过文本提示的手术器械分割
2.实验结果
实验结果(图12)也表明在手术器械分割任务上,使用可提示的视觉语言模型的性能表现远远超出传统的视觉模型。
图12: 可提示的视觉语言模型在手术器械分割任务上的实验表现
总的来说,视觉语言模型为手术器械分割提供了一种新的解决方案,能够有效应对各种挑战,提高手术器械分割的准确性,从而有助于提高手术的安全性和效率。
分享嘉宾:史淼晶
教授,博导,国家级高层次人才
教育与工作经历
2010年本科毕业于同济大学;2015年博士毕业于北京大学,期间于英国牛津大学,法国国家信息与自动化研究院(INRIA)联合培养各一年。2015-2017年英国爱丁堡大学博士后研究员;2017-2019年法国国家信息与自动化研究院研究员。2020年起历任英国伦敦国王学院(KCL)信息系终身教职助理教授,副教授(准授),并创立视觉计算实验室(VISCOM)。现任同济大学电子与信息工程学院控制科学与工程系教授,伦敦国王学院信息系客座教授。
代表性奖励与荣誉
2022年 伦敦国王学院年度表彰奖
2022年 英国高等教育学会会士(FEA)
2019年 法中委员会个人创新奖(中法各一人)
2018年 法国科创协会“40位40岁以下AI人才”
2015年 北京大学“学术十杰”
科研与项目
研究方向为计算机视觉与机器学习,研究内容包括自然图像、医学与遥感图像。当前研究兴趣包括面向通用机器视觉感知的多任务学习,小样本学习,自监督/半监督学习等。在国际重要学术期刊与会议发表论文50余篇,多数发表在计算机视觉、机器学习等领域顶会顶刊诸如CVPR、ICCV、ECCV、NeurIPS、AAAI、ACM MM、IEEE TIP。发明专利授权2项、软件著作权1项。担任IJCAI、ACM MM等多个顶会的资深程序委员及国际重要期刊编辑。
先后主持中国自然科学基金项目(NSFC),英国工程与自然科学研究理事会项目(EPSRC),欧洲研究理事会地平线项目(ERC),伦敦国王学院跨学科合作项目等,以及与英伟达(NVIDIA)公司、英国伦敦西敏区、法国国立图书馆等多个横向合作课题。项目金额累计超千万。
本文由货拉拉数据科学团队 孙崇衍 基于行业分享会内容整理