ACL 2024 Oral|我们离真正的多模态思维链推理还有多远?
AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:[email protected];[email protected]
(Multi-Domain Multi-step Multi-modal Chain-of-Thought),旨在解决上述问题,并推动多领域、多步和多模态思维链的进步。研究者们还进行了全面的评估,涉及丰富的多模态推理设置与方法。
研究者们还发现当前的多模态大模型在 上的表现存在巨大的性能缺陷,尽管它们在以前的传统多模态思维链基准上表现优异。最后,研究团队希望
能够成为一个有价值的资源,为多领域、多步和多模态思维链的研究提供开创性的基础。
榜单地址:https://lightchen233.github.io/M3CoT.github.io/leaderboard.html 论文地址:https://arxiv.org/abs/2405.16473 代码地址:https://github.com/LightChen233/M3CoT
视觉模态推理缺失样本移除:首先,为解决视觉模态推理缺失的问题, 利用自动和手动相结合的方式移除了那些无需图像即可得出答案的样本。
多步多模态样本构建:这一阶段中,为了保证基准满足多步多模态的要求, 首先自动的去除了推理路径过短的样本,随后通过手动去除和优化样本,确保每一个样本确实需要跨模态的多步推理。
多模态 CoT 领域增强:此外, 通过引入数学和常识领域的数据,将 LaTeX 代码转为图片,并利用大模型生成更多的问题、推理路径和答案,增强了基准的多样性和挑战性。
质量检查:为了保证数据集的质量, 实施了多轮人工审核和自动检测,确保数据的一致性和准确性。
单步推理任务的表现远优于多步推理任务。模型在解决多步多模态推理时性能与单步多模态推理有接近 30% 的差距,且随步骤数增加,性能递减。这表明模型在处理复杂多步骤推理时仍存在困难。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:[email protected]