ICASSP 2026|Sparse-Up:高精三维几何生成技术与应用前沿
01
背景
02
技术路线
基于我们在稀疏体素几何生成算法上的成功实践,并放眼业界整体技术演进,当前AI3D生成技术主要沿袭两条清晰的技术路线并行发展:
以微软TRELLIS系列为代表的基于体素表征的几何生成路线。该框架以稀疏体素为几何与纹理载体,利用二维法线和深度图驱动监督过程。其优势在于建模上限极高,尤其擅长还原薄片和复杂细节;但瓶颈在于高分辨率下的训练算力消耗极大,稳定性较差,容易产生几何幻觉和杂乱的拓扑结构。
图1 稀疏体素技术方案
以腾讯Hunyuan3D系列为代表的基于点云和3DShape2VecSet的几何生成路线。该方案主要利用点云表征进行生成,并仅使用空间点的SDF值进行监督。其优势主要在于分辨率仅与数据和MC网格分辨率有关,与训练过程无关,这意味着在有限的显存下,依然能实现极高精度的几何生成;同时,该架构展现出强大的Scaling Law潜力,模型表现随数据、算力和序列长度的增长而持续增强。但其短板在于:对复杂细节的敏感度不足,在还原极致精细的物体结构时略显乏力。
图2 VecSet技术方案
03
论文解读
技术现状与创新点
当前的3D生成技术主要遵循两种架构,但在电商应用场景中均存在明显局限:以Hunyuan3D为代表的两阶段方法侧重几何序列与多视图扩散,因缺乏显式几何约束,易出现接缝与错位,难以满足商品高还原度需求。以TRELLIS为代表的基于稀疏体素的方法虽能捕捉局部特征,但受限于显存开销,在高分辨率下难以兼顾细节质量。由于电商场景对于商品生成的还原度与一致性要求更高,因此我们的方法将基于稀疏体素,并致力于突破体素分辨率限制,实现高保真建模。
针对电商常见品类的冗余分析发现,传统体素上采样中约70%为偏离表面的冗余点,这是限制分辨率提升的计算瓶颈。为此,我们提出两项核心优化:
表面锚定上采样:弃用传统八叉树分裂,设计可学习映射方案,将上采样点精确约束于真实表面。结合与 Texture-VAE 对称的端到端架构,在消除冗余的同时显著提升体素表示的保真度。
视域分区渲染:针对高分辨率导致的网格点激增问题,提出以图像块为单位的筛选策略。仅允许当前视域内的体素参与渲染与反向传播,实现局部化梯度更新,大幅降低显存占用。
方法
模型整体架构图
Sparse-Up是一个基于图像输入、直接输出带纹理与几何Mesh的端到端3D生成框架,如图3所示。为攻克高分辨率下的显存瓶颈,我们引入了可学习表面锚定以消除冗余体素,并采用视域分块机制实现局部渲染与内存优化,从而在保证视角一致性的前提下实现高保真建模。
图3 Sparse-Up架构图
可学习的表面锚定上采样
为了实现高分辨率重建,我们在解码器中集成了两个上采样模块。针对传统上采样在处理大平面商品(如家居家具)时易产生大量离表面冗余点、导致表面质量下降且内存消耗激增的问题,我们引入了基于 Transformer 的掩码生成器(Mask Generator)来指导冗余消除。
该组件在每个上采样模块中显式预测映射掩码,将冗余点精准转换为表面对应点,从而引导解码器在保留精细表面细节的同时消除冗余。如下图4所示。其中(a)代表低分辨率体素形状,(b)代表不经过处理的直接上采样之后的高分辨率体素形状,(c)代表对(b)进行去冗余之后的高分辨率体素形状。实验表明,该方法有效消除了约 70% 的冗余体素。这不仅显著提升了重建表面的空间分辨率与保真度,还通过大幅降低内存占用,使更高分辨率的端到端训练成为可能。
图4 不同稀疏体素采样结果
视域分块机制
为了在保持高渲染质量的同时有效抑制显存占用,我们提出了视域分区策略,通过局部化渲染与更新优化计算效率。
图块分区与剔除:将图像划分为统一大小且边缘重叠的图块。边缘重叠设计有效避免了接缝处的连续性伪影,确保商品边缘的无缝展示。训练时随机采样图块以提升模型泛化能力,并执行剔除操作,仅保留落在该图块相机视锥体内的体素,从而大幅减少渲染冗余。
局部化渲染与更新:仅利用图块内的体素进行局部化渲染。损失计算与梯度反向传播仅在当前图块对应的体素 Token 内执行。这种将全局渲染分解为局部片段的方法,显著降低了计算负载与内存需求,使高质量渲染在有限硬件资源下成为可能。
实验效果
实验设置
数据集:整合 Objavarse (XL)、ABO 和 3D-FUTURE,并加入京东自有电商(家具、家电等)数据,共计 120k 高质量样本进行训练。针对 Objavarse (XL),取 TRELLIS 与 Step1X-3D 过滤结果的交集。测试集采用 Toys4K 及自建电商商品测试集。
基线方法:在不同体素分辨率下将 Texture-VAE 与 TRELLIS 进行对比。生成效果与 TRELLIS、Hunyuan3D 2.1 及 Step1X-3D 等开源 SOTA 方法进行基准比较。
评估指标:采用 PSNR、LPIPS、SSIM 衡量重建精度,并利用 FID、KID 评估生成的分布质量。
VAE重建效果评估
我们在不同体素分辨率下对纹理变分自编码器(VAE)的重建质量进行了比较分析,实验在原始TRELLIS-64、Ours-256和Ours-512上进行。如下表1所示,随着体素分辨率的逐步提高,纹理重建质量呈现出显著的正向增长趋势。在512分辨率条件下,纹理重建效果达到最优水平。
表1 VAE重建结果对比
结合下图中的定性结果,我们进一步发现高分辨率体素化能够更准确地捕捉纹理的细节特征:纹理细节更加丰富和真实,重建图像与原始图像之间的差距显著减小。这一结果有力地证明了高分辨率体素在提高纹理重建质量中的关键作用。
图5 高分辨率体素细节还原能力对比
端到端生成效果评估
除了上述纹理VAE的重建评估,我们还验证了其作为生成任务基础重建模型的有效性。下表中FID与KID得定量结果证实了我们生成结果的有效性,并大幅优于其它开源sota方法。
表2 端到端生成结果对比
下图6展示了不同模型的3D生成可视化结果,结果表明我们的方法生成的纹理保留了精细细节,并且与真实图像高度一致,证明了我们方法的通用性。
图6 行业主流算法对比结果
显存优化的消融实验
我们在80GB H100上详细测试了生成的掩码(在上采样过程中去除冗余点)和视域分区训练在不同分辨率下的GPU显存消耗。相关结果如下表3所示。实验结果表明,去冗余上采样策略和视域分区策略都能显著降低训练过程中的GPU内存消耗,凸显了我们提出的策略在处理高分辨率数据时的效率和优势。
表3 显存消融实验结果
图7 团队论文在 ICASSP 2026国际会议现场展出
04
应用效果与落地
基于前述高精度三维几何生成技术,我们对新老版本算法进行了系统性对比与评估。实验结果表明,新算法在商品几何重建任务上实现了全方位、显著的性能跃升,如图8所示。具体而言,新算法在重建精度、模型完整性等核心指标上均大幅超越老版。例如,在复杂结构商品(带复杂结构的家具、具有精细褶皱的服饰)的重建中,新算法能更准确地还原几何细节与表面特征,有效解决了遮挡区域信息缺失等传统难题,重建模型的几何保真度与视觉真实感得到显著增强。
图8 新算法效果提升对比
目前,该技术已在京东“妙搭”产品中成功落地并规模化应用,覆盖家居家电、日用、工业等多种品类。通过集成新算法,妙搭能够为用户提供更精准、更逼真的商品三维模型,显著提升了商品交互体验的真实感与沉浸感。这不仅优化了用户购物决策效率,也为平台商家提供了高效、低成本的三维内容生成解决方案,有力支撑了业务增长与用户体验升级。
图9 应用自研算法生产的多品类3D模型资产的立影效果
05
总结与展望
本文系统性地介绍了一种突破体素分辨率限制、在降低训练消耗的同时实现高保真建模的三维几何生成新方法。实验表明,该方法在商品几何重建任务上相较于前代算法有显著提升,并已在京东“妙搭”等产品中成功落地。
尽管 AI3D 技术在近年来取得了显著突破,但在实际应用中仍然面临一些技术挑战。由于 3D 内容本身具有的复杂特性,包括多变的几何拓扑结构、精细的材质纹理表现等。当前的生成质量与专业设计师人工建模仍存在一些差距。这些挑战既源于 3D 数据本身的复杂性,也与训练数据和算力的稀缺性、算法架构的局限性密切相关。为此,我们将持续构建行业级 3D 数据集、研发新一代生成架构以及持续拓展商品品类覆盖等系统性创新,不断提升 AI3D 生成精度,致力于将技术突破转化为实际应用价值,推动 AI3D 技术达到工业级标准并实现价值最大化。
— END —
SIGIR 2026|语义 ID 也能“因材施教”:让生成式检索兼顾精准与泛化
ICML 2026|RTPrune:受两阶段阅读启发、面向 DeepSeek-OCR 高效推理的词元剪枝
WWW 2026 | 频谱解耦与增强:让多模态大模型学会“去噪提纯”
关注「京东零售技术」,了解更多~