AI视觉GPT时刻!Meta新模型一键“分割世界”,网友直呼太疯狂了
过去,三维建模一直面临着数据匮乏的问题。与文本、图像等丰富的资料相比,真实世界的3D数据少得可怜,大多数模型只能处理孤立的合成资产,或者在简单背景下重建单个高分辨率物体。这让3D重建在现实场景中显得力不从心。
SAM 3D Objects的出现,则打破了这一局限。通过强大的数据注释引擎,它在大规模自然图像上实现了3D物体的精细标注:近百万张图像,生成超过314万个网格模型。
这一过程结合了“众包+专家”模式。普通数据标注者对模型生成的多个选项进行评分,最难的部分交给资深3D艺术家处理。
SAM 3D Objects还借鉴了大型语言模型的训练理念,将合成数据学习重新定义为“三维预训练”,再通过后续阶段的微调,让模型在真实图像上发挥出色。
这种方法不仅提升了模型的鲁棒性和输出质量,也反过来让数据生成更高效,实现了数据引擎与模型训练的正向循环。
为了验证成果,团队还与艺术家合作建立了SAM 3D艺术家对象数据集(SA-3DAO),这是首个专门用于评估物理世界图像中单幅3D重建能力的数据集。相比现有基准,这个数据集的图像和物体更具挑战性。
性能方面,SAM 3D Objects在一对一的人类偏好测试中,以5:1的优势战胜现有领先模型。同时,结合扩散捷径和优化算法,它能在几秒钟内完成全纹理3D重建,让几乎实时的三维应用成为可能,比如为机器人提供即时视觉感知。
它不仅可以重建物体的形状、纹理和姿态,还能让用户自由操控摄像机,从不同角度观察场景。这意味着即使面对小物体、遮挡或间接视角,SAM 3D Objects也能从日常照片中提取出三维细节。
当然,这一模型仍有提升空间。当前模型的输出分辨率有限,复杂物体的细节还可能出现缺失;同时,物体布局预测仍以单个物体为主,对多物体的物理交互推理尚未实现。
未来,通过提高分辨率和加入多物体联合推理,SAM 3D Objects有望在真实世界场景中实现更精细、更自然的三维重建。
SAM 3D Body的核心是一种名为Meta Momentum Human Rig(MHR)的开源3D网格格式,它将人体的骨骼结构与软组织形状分离,从而提高了模型输出的可解释性。
模型采用Transformer Encoder-Decoder架构,图像编码器能够捕捉身体各部位的高分辨率细节,而网格解码器则支持基于提示的三维网格预测。这种设计让用户不仅能获得精确的三维人体模型,还能在交互中灵活调整和微调结果。
在数据方面,SAM 3D Body研究团队整合了数十亿张图像、多机位高质量视频以及专业合成数据,通过自动化数据引擎筛选出罕见姿势、遮挡或复杂服装等高价值图像,形成约800万张高质量训练样本。
这样的数据策略让模型在面对多样化场景时仍然保持强大的鲁棒性,同时结合基于提示的多步细化训练,使三维预测与二维视觉证据对齐得更加精确。
发布的基准结果显示,SAM 3D Body在多个三维人体基准测试中取得了显著优势,准确性和稳健性均领先于以往模型。
此外,团队还开放了MHR模型,这一参数化人体模型在商业许可下可供使用,使Meta的技术如Codec Avatars等得以落地应用。
SAM 3D Body主要针对单人处理,尚未支持多人或人与物体的交互预测,这限制了对相对位置和物理互动的准确推理。此外,其手部姿势的估计在精确度上仍落后于专门的手部姿势估计方法。
未来,SAM 3D Body计划将人与物体、环境互动纳入训练,同时提升手部姿势重建精度,使模型在真实场景中更全面、更自然。