计图开源:单张图像重建可驱动可重光照三维人手方法FLASHand

2026/07/28 Tutorial

计图开源:单张图像重建可驱动可重光照三维人手方法FLASHand

近日,中国科学院计算技术研究所陈益强研究员、高林研究员团队和英国卡迪夫大学来煜坤教授合作提出了一种单张图像输入重建可驱动可重光照三维人手的工作FLASHand [1] (效果如图1所示),该工作已被计算机图形学顶会ACM SIGGRAPH 2026录用,并基于国产深度学习框架计图(Jittor)[2]开源。该方法仅需输入一张彩色人手图像,即可通过单次前向推理,快速生成一个高质量、可驱动、可重光照的三维人手。

FLASHand重建、新视角合成与重光照效果

Part 1
背景

高真实感三维人手重建一直是计算机视觉与图形学中的重要任务。人手不仅结构复杂、关节自由度高,还存在大量自遮挡和细微纹理变化。已有的高质量人手重建方法通常依赖密集观测。例如HARP [3]UHM [4]等方法借助多视角图像或视频序列,通过时序或多视角一致性来恢复细节。这类方法效果出色,但往往需要采集多视角图像或视频,并且需逐对象优化。

相比之下,单张彩色图像重建对普通用户来说更加友好。近年来,HaMeR [5]WiLoR [6]等方法在人手几何估计上取得了显著进展,但它们聚焦于网格形状与姿态恢复,不处理纹理重建。少数方法尝试从单图预测纹理,例如AMVUR [7]通过预测网格顶点颜色恢复人手外观,但该表示也把环境光照烘焙进了纹理,导致难以实现重光照。

为了解决上述问题,FLASHand将单视图人手重建重新建模为一个由几何先验引导的前馈式逆渲染问题,基于高斯网[8]表示,解耦几何与纹理、材质属性,结合高斯泼溅的延迟渲染技术[9]实现了高质量的重建。

Part 2
FLASHand的算法原理
为了从单张图像中生成可驱动和重光照的三维人手,FLASHand 设计了三个模块,基于网格绑定的解耦二维高斯人手表示、前馈式人手属性生成器,以及可重光照高斯延迟渲染管线。FLASHand方法结构如图2所示。

2 FLASHand方法结构图

基于网格绑定的解耦二维高斯人手表示

人手是一个具有明确拓扑结构的可变形对象,如果高斯点没有位置约束,驱动时容易出现伪影等瑕疵导致不真实。为了解决这一问题,FLASHand参考高斯网[8]的设计思路,以NIMBLE参数化人手模型作为几何先验,将二维高斯锚定到NIMBLE规范人手网格的表面。每个高斯都绑定在网格三角面上,并继承局部表面方向与拓扑结构。这样一来,高斯不再松散的分布在空间中,而是紧贴人手表面。此外,FLASHand没有让高斯点直接存储最终颜色,而是保存物理渲染所需的材质属性,包括反照率、粗糙度、环境遮蔽和法线等,解耦了纹理和材质属性,从而实现高质量的重光照。这一表示的另一好处是可以通过网格变形驱动高斯变形实现实时的人手驱动。

前馈式人手属性生成器

如何利用有限的二维信息重建完整的三维人手,是单目重建的难点。为此,FLASHand提出了基于Transformer架构的前馈式人手属性生成器。具体来说,将规范空间里的NIMBLE人手参数化模型的三维信息,和使用WiLoR[6]估计图像中人手姿态和形状后投影的对应位置的二维信息联合,作为Transformer的查询特征(Query),并利用交叉注意力模块,将通过DINO v3提取的图像特征作为键(Key)和值(Value)实现三维信息与二维信息的有效融合,预测查询位置高斯点的几何和外观属性。

可重光照高斯延迟渲染管线

为了实现真实的重光照效果,FLASHand采用了高斯泼溅延迟渲染管线[9]。首先将高斯的几何与外观属性栅格化到屏幕空间中,形成包含位置、法线、反照率、粗糙度等信息的中间缓冲图;随后结合环境光照贴图,基于Cook-Torrance 反射模型的近似计算完成最终着色。

这种设计的好处是,光照计算发生在像素空间,而不是直接把光照混进高斯颜色里。因此,当需要重光照时,只需替换环境贴图,人手材质仍能保持一致,皮肤高光和阴影也会随新环境自然变化。

Part 3
结果展示

FLASHand在合成数据集、HO3Dv3MOW真实人手数据集上进行了系统评估。对比方法包括单图重建方法AMVUR[7],以及面向视频重建的HARP [3]UHM [4]。定性结果如图3所示。

重建和新视角合成上的视觉对比

可以看到,AMVUR由于通过预测网格顶点颜色来重建纹理,结果容易出现低频模糊的问题。HARPUHM虽然在视频场景中表现强,但当它们适配到单图输入时,容易过拟合可见区域,在遮挡区域和新视角下出现缺失纹理或几何伪影等问题。相比之下,FLASHand通过大规模数据学习到的生成先验和解耦材质属性,能够在遮挡区域生成更合理的几何与外观。

新姿态合成与重光照结果

从图4可以看到,FLASHand在新姿态和新光照下保持了较好的结构稳定性与外观一致性。手指关节变形自然,重光照结果能够随环境贴图产生合理的明暗和高光变化。

Part 4
结语

FLASHand将单张人手图像转化为可驱动和重光照的高真实感三维人手,为轻量化数字人手资产创建提供了一条新的路径,意味着更低的采集门槛、更快的资产生成速度,以及更自然的实时交互体验。目前,该工作已被ACM SIGGRAPH 2026正式录用。该项目的计图代码已在Github上开源:

https://github.com/IGLICT/FLASHand

计图(Jittor)是清华大学开源的自主深度学习框架,完全基于动态编译,采用元算子融合和统一计算图的新技术,并支持国产硬件。元算子易于使用,便于算子的开发和优化,而统一计算图则是融合了静态计算图和动态计算图的诸多优点,在易于使用的同时提供高性能的优化。计图官网为:

https://cg.cs.tsinghua.edu.cn/jittor/

参考文献

  1. Ling-Xiao Zhang, Lin Gao, Wei-Hong He, Yu-Xuan Yang, Yunbing Xing, Yu-Kun Lai, Yiqiang Chen. FLASHand: Feed-forward reLightable and Animatable Single-view Hand Reconstruction. ACM SIGGRAPH 2026.

  2. Shi-Min Hu, Dun Liang, Guo-Ye Yang, Guo-Wei Yang, and Wen-Yang Zhou. Jittor: a novel deep learning framework with meta-operators and unified graph execution. Science China Information Sciences, 2020, 63(12), 222103.

  3. Korrawe Karunratanakul, Sergey Prokudin, Otmar Hilliges, Siyu Tang. HARP: Personalized Hand Reconstruction from a Monocular RGB Video, CVPR 2023, 12802-12813.

  4. Gyeongsik Moon, Weipeng Xu, Rohan Joshi, Chenglei Wu, Takaaki Shiratori. Authentic Hand Avatar from a Phone Scan via Universal Hand Model. CVPR 2024,2029-2038.

  5. Georgios Pavlakos, Dandan Shan, Ilija Radosavovic, Angjoo Kanazawa, David Fouhey, Jitendra Malik. Reconstructing Hands in 3D with Transformers. CVPR 2024, 9826-9836.

  6. Rolandos Potamias, Alexandros, Jinglei Zhang, Jiankang Deng, Stefanos Zafeiriou. WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild. CVPR 2025, 12242-12254.

  7. Zheheng Jiang , Hossein Rahmani, Sue Black, Bryan M. Williams. A Probabilistic Attention Model with Occlusion-aware Texture Regression for 3D Hand Reconstruction from a Single RGB Image. CVPR 2023, 758-767.

  8. Lin Gao, Jie Yang, Bo-Tao Zhang, Jia-Mu Sun, Yu-Jie Yuan, Hongbo Fu, Yu-Kun Lai. Mesh-based Gaussian Splatting for Real-time Large-scale Deformation. ACM Transactions on Graphics (TOG), 2024, 43 (6): 1-17.

  9. Tong Wu, Jia-Mu Sun, Yu-Kun Lai, Yuewen Ma, Leif Kobbelt, Lin Gao. DeferredGS: Decoupled and Relightable Gaussian Splatting with Deferred Shading. IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025, 47 (8): 6307-6319.

CGAI往期回顾
  1. Computational Visual Media第12卷第3期导读
  2. 诚邀投稿,CVM2027@新加坡期待您的参与!
  3. AI驱动的三维CAD模型生成综述|CVMJ Spotlight
  4. CVMJ最新影响因子8.3,列计算机学科软件工程类第4
  5. SIGGRAPH 2026:清华联合腾讯、惠灵顿维多利亚大学提出 Pixal3D,实现像素级对齐的图像到 3D 生成

    可通过下方二维码,关注清华大学图形学实验室,了解图形学、人工智能、深度学习框架、CVMJ期刊和CVM会议的相关资讯。

    图片

    Search

      Table of Contents