想了解什么是AI智能创作,你不能错过这场直播
在上半场的直播分享中,我们聊了多模态内容理解,下半场则将聚焦“ 多模态理解与创作 ”。 多模态智能创作是目前人工智能领域受到学界和工业界共同关注的研究和实践方向之一。它是在多模态内容理解的基础上,帮助人们进行多种形式的创作,如创意生成、素材匹配、智能配乐、特效玩法、形象驱动、一键成片等。它也涵盖了近来伴随元宇宙概念而大火的数字人技术等多模态人机交互技术。
在小红书,每天有无数的用户在这里分享和记录自己的生活,共创多元、真实、美好、有用的社区生态。多媒体技术和智能创作可以帮助分享者更高效地进行内容创作,记录美好,表达态度。因此,小红书技术团队一直都在面对各种智能创作中颇具挑战性的问题,包括如何让理解更精细,让创作更有个性化、多样性、表现力、便捷性等等。借由这场直播,我们也会向大家介绍小红书在多模态内容理解上的一些进展,以及在智能创作中应用、挑战和有趣的问题。
在这场多位业界大咖和小红书资深专家带来的技术分享中,有这些热点议题不容错过——
-
如何提升多模态检索效率
-
具有语义表达能力的多模态语音合成手势方法
-
三维数字化的最新趋势:基于神经表示的建模与渲染
-
如何实现真实感三维人体重建,无标记人体运动捕捉,以及实时单目三维场景重建?
-
什么是表象最优传输及信息瓶颈解表达生成模型?
-
怎样通过2D还原3D,并把2D和3D进行融合?
-
基于大量数据驱动的个性化智能配乐和音乐生成
更多详细议程👇
朱霖潮: 《多模态检索、定位与生成的方法》 导师简介:朱霖潮,悉尼科技大学讲师(助理教授)。分别于浙江大学和悉尼科技大学获得学士与博士学位。曾在卡内基梅隆大学,facebook研究院,谷歌研究院等大学和企业从事访问研究。曾获得美国国家标准总局TRECVID LOC 2016比赛冠军,以及THUMOS 2015动作识别、EPIC-Kitchens 2019/2020比赛冠军。2021年获Google Research Scholar奖(在机器感知领域仅有七个获奖者)。长期关注视频行为理解、模型迁移、多模态学习等。
内容大纲:
报告将从三个方面展开讨论多模态视频理解:
-
讨论视频文本检索的效率问题,并介绍两类提升视频检索效率的思路。
-
基于自然语言处理的视频定位技术,指出当前模型在基于新描述的视频定位下存在泛化性不足的问题,并提出使用细粒度分级视频理解的策略,提升视频内容的结构化解析能力。
-
具有语义表达能力的多模态语音合成手势方法,该方法可有效地挖掘语义线索并生成语义手势。
相关论文:
-
SEEG: Semantic Energized Co-speech Gesture Generation, CVPR 2022
-
CenterCLIP: Token Clustering for Efficient Text-Video Retrieval, SIGIR 2022
-
T2VLAD: Global-Local Sequence Alignment for Text-Video Retrieval, CVPR 2021
周晓巍,浙江大学“百人计划”研究员、博士生导师,国家级青年人才项目入选者。研究方向主要包括三维视觉及其在混合现实、机器人等领域的应用。代表作包括NeuralBody, NeuralRecon, DeepSnake, PVNet, LoFTR等,多次入选CVPR最佳论文候选(<0.5%),并被麻省理工科技评论等知名媒体报道。曾获得“陆增镛CAD&CG高科技奖”一等奖,中国计算机学会CAD&CG图形开源贡献奖。担任计算机视觉顶级期刊IJCV编委、顶级会议CVPR21/ICCV21领域主席。
内容大纲:
-
现有三维数字化技术一般依赖于复杂的采集设备与采集流程,因此仅限于专业应用而无法普惠大众。
-
如何实现低成本、便捷、自动化的三维数字化是近年来视觉与图形领域的研究热点。
-
三维数字化的最新趋势:基于神经表示的建模与渲染
-
挑战:基于少量相机重建三维人体模型
-
本课题组在该方向上的一系列工作主要包括:高真实感三维人体重建、无标记人体运动捕捉、实时单目三维场景重建等,最后简要地探讨该领域的未来发展方向。
相关论文:
-
High-Quality Streamable Free-Viewpoint Video, SIGGRAPH 2015
-
SMPL: A Skinned Multi-Person Linear Model. In SIGGRAPH Asia, 2016
-
Expressive Body Capture: Hands, Face, and Body from a Single Image. CVPR, 2019.
赫然,中国科学院自动化研究所研究员,中国科学院自动化研究所获模式识别与智能系统专业博士学位,在权威国际期刊IEEE TPAMI、TIP、TNNLS、TKDE、MIT NECO,权威国际会议AAAI, CVPR等上发表论文60余篇。现担任Elsevier国际期刊Neurocomputing和IET image processing的编委。
内容大纲:
视觉内容生成是指使用深度生成模型等智能化技术对图像视频数据进行修改、编辑和替换,进而创造出从内容或表观纹理上完全不同的视觉数据。视觉内容生成是机器学习和计算机视觉等领域的重要研究内容之一,被广泛应用于媒体内容创作和影视娱乐。本报告从多模态角度出发,介绍基于文本、语音等不同模态的视觉内容生成,以及表象最优传输和信息瓶颈解表达等生成模型。
张德兵: 多模态技术在智能创作中的应用和挑战 导师简介:
张德兵,小红书智能算法组负责人。本科毕业于浙大丘成桐数学英才班,曾任格灵深瞳首席科学家,快手多模态智能创作负责人,在技术研究和业务落地方向都具有丰富的经验, 曾发表顶级学术论文十余篇,带领团队获得包括国际权威人脸识别竞赛FRVT世界冠军在内的多项学术竞赛冠军,并推动CV、多模态等技术在安防、零售、体育等TO B场景和短视频、广告等C端场景的多项业务落地。长期关注CV/NLP/音频/多模态/智能创作等相关技术。
内容大纲:
本次分享主要介绍小红书在多模态内容理解上的一些进展和在智能创作中的一些应用、挑战和有趣的问题。主要包括:
-
如何基于普通视频去进行像素级别的检测分割深度估计
-
如何通过2D还原3D,并把2D和3D进行融合
-
基于视频内容的特效一键生成
-
基于大量数据驱动的个性化智能配乐和音乐生成等
最后也会跟大家一起讨论智能创作中的挑战性问题,如何让理解更精细,让创作更有个性化、多样性、表现力、便捷性。
小助手微信
我们将在微信群内发布 直播链接、嘉宾演讲精华和抽奖活动, 可提问互动,问题有机会被嘉宾pick解答哦 。关注【小红书技术团队】,解锁更多意想不到的丰富内容。
直播中我们将开启专属简历通道
点击【 阅读原文 】查看JD