多模态,彻底爆发了!
自 GPT-4 发布以来,作为具备图像对话能力的大语言模型,其在演示时所表现出来的能力,令无数人感到震撼,直接打破了人们的固有认知。
不少人开始意识到,只有当 AI 开始能够接收图像、声音、视频等各种模态信息时,它的实力才能被真正挖掘出来。
因此,多模态技术从近些年开始,也被不少科技前沿大佬视为一个热门方向和重点。近三年的顶会上,多模态论文占比增长最高超 10%,并增设了 MMNLP、ViGIL 等多模态研讨会与 workshop。
可以说,如今的多模态还处在大爆发早期。在后 GPT 时代,多模态极有可能是科研与工程领域最大的机会。
打铁还需自身硬。想要在多模态领域拥有 “技术壁垒”,同学们需要更多的知识储备与实战练习。
为了让大家能够能好的学习与掌握多模态技术,今天在这里分享下 195 篇多模态论文、3 节多模态基础与 2 节 Kaggle 全程实战课、以及 272 页《多模态深度学习》综述书 PDF。相信看完后,你对多模态的技术认知会有质的飞跃,欢迎大家扫码领取。
《通关多模态基础与实战》课程大纲
多模态生成
-Image caption、 Image generation
-Video caption、Video generation
多模态深度学习
- 多模态任务:视觉语言问答、多模态情感分析、对话系统...
- 多模态技术:GAN、VAE、CLIP...
多模态 Paper 精读
-CLIP— 多模态领域鸿蒙之钟巨作
Kaggle 实战:Shopee 商品匹配大赛
- 赛题介绍与 Baseline 讲解
- 图像特征提取与图像检索
- 文本特征提取与文本检索
- 商品多模态匹配
- 信息检索比赛复盘
- 模型融合与集成
Kaggle 实战:宠物预测大赛
- 赛题介绍与 Baseline 讲解
-CV 相关理论介绍及其代码讲解
- 调参技巧与数据增强设计
- 多模态特征聚合理论介绍
-CV 和其他模态数据讲解
- 比赛总结复盘
《多模态深度学习》PDF
2023 年最新发布,概述了多模态深度学习中使用的 SOTA 方法,以克服来自非结构化数据和组合不同模态输入的挑战。
该书内容涵盖广泛且通俗易懂,无论作为深入学习还是知识扩展都是一本极好的书籍。共 272 页,可以扫描下方二维码下载。