计图高斯库新添实时线稿驱动人脸生成与编辑功能
近日,山东工商学院李波教授团队、中国科学院计算技术研究所高林研究员团队和新南威尔士大学张方略副教授联合提出了一种基于线稿驱动的实时人脸生成和编辑方法SketchFaceGS[1],相关论文已被 CVPR 2026 正式录用,并入选Highlight。该方法构建了一个基于3D高斯泼溅(3DGS)、支持实时线稿驱动的三维人脸生成与编辑框架。无需耗时的逐个对象优化,通过单次前向推理,它就能将用户随手画的2D线稿,实时转化为照片级真实感的三维高斯人脸模型,并且支持稳定、自然的实时局部编辑。
想要打造专属的逼真3D数字人脸,却被Maya、Blender 等复杂的三维建模软件“劝退”?想为已建好的三维人脸换个发型或微调脸型,却发现“牵一发而动全身”,难以实现精准的局部控制?试想一下,如果只需像在纸上画简笔画一样寥寥数笔,就能实时生成并修改一个极其逼真、支持全自由视角观看的三维高斯数字人脸,这听起来是否如同科幻电影中的场景?如今,SketchFaceGS的出现,让这种直觉式的创作体验成为现实。
这一突破性进展极大地降低了 3D 数字人内容创作的门槛,让没有任何三维建模经验的零基础用户,也能轻松化身为“3D捏脸大师”。接下来,让我们先睹为快,看看SketchFaceGS 带来的惊艳演示效果:
图1 基于线稿的三维人脸实时生成效果
图2 基于线稿的三维人脸实时编辑效果
然而,将这一极具表现力的交互模态向三维空间拓展时,面临着严峻的跨维度生成挑战。尽管学术界在三维人脸可控生成(如基于3D GAN 的解耦编辑工作[8],以及NeRFFaceEditing[9]等)和线稿驱动的三维通用生成(如 SketchDream[10])上取得了显著进展,但在面对数字人脸创作对高保真渲染与实时交互的严苛要求时,现有技术仍存在瓶颈。作为该领域的先驱性探索,SketchFaceNeRF[11]验证了线稿直接驱动三维人脸编辑的潜力,但依然暴露出两大局限:一是二维线稿天生稀疏且缺乏深度与外观线索,推导具备密集几何与真实质感的三维模型时存在极大的信息不对等;二是每次局部修改均需进行耗时的逐实例优化,这种机制不仅极易引发误差累积与人物身份的偏移,更无法满足创作者高自由度的实时交互需求。
为了解决这一实时交互与生成质量难以兼顾的难题,研究团队将目光转向了具备原生高分辨率实时渲染能力与显式空间几何特性的3D高斯泼溅表示[12],提出了前馈式实时线稿驱动框架——SketchFaceGS。该方法利用线稿进行直观交互,并通过端到端网络架构避免了耗时的逐实例级优化,有效建立了稀疏2D笔触与密集3D高斯属性之间的映射关系,最终实现了兼具高保真度、多视角一致性与低延迟交互的三维人脸生成与编辑。

几何与外观解耦的交叉注意力机制与模态对齐
将稀疏的线稿直接映射为三维人脸是一个极具挑战性的问题。为此,SketchFaceGS首先在粗生成阶段采用了并行解耦的交叉注意力架构,分别从输入的线稿和参考图像中提取独立的几何与外观特征。具体而言,网络首先利用 DINOv2编码器提取输入图像的深层特征。随后,这些特征作为交叉注意力机制的键和值,与一组可学习的、对应于FLAME标准头部模板顶点的查询向量和全局身份向量进行交互运算,从而精准预测出每个顶点的几何与外观属性以及全局身份特征。接着,利用重心插值将这些顶点特征投影到规范的UV空间中,获得密集的UV特征图。
然而,考虑到输入的线稿与参考图像本身人物属性的差异,极易在特征空间导致显著的结构冲突。为解决这一问题,研究团队引入了基于AdaIN的对齐网络。该网络利用外观特征图来调制几何特征图,从而实现两种模态的精准对齐,最终生成一张兼具几何一致性与色彩连贯性的初始UV 特征图。
3D GAN先验驱动的UV特征增强
上一个阶段生成的UV图虽然构建了基础的几何与外观属性,但缺乏能够支撑高分辨率渲染的照片级纹理细节。为此,研究团队在精细生成阶段引入了强大的预训练 3D GAN(GGHead[13])作为生成先验,并设计了一个空间调制 U-Net 网络。在输入粗糙的 UV特征图后,该网络可将其转化为多尺度的空间调制参数与一个全局潜变量。随后,这个潜变量会与提取的全局身份特征进行融合,并通过多层感知机(MLP)投影到 StyleGAN 的潜空间中,生成具有身份感知的预测潜编码。
基于这一设计,生成网络将全局身份特征与局部空间调制相结合,逐层为模型补充高频纹理与真实细节。生成网络最终输出的完整 UV图直接构成了高斯球的核心属性参数,从而实现了对高保真3D 人脸的显式建模。
UV掩码融合与逐层特征交融
在对生成的三维人脸进行局部编辑(如添加胡须、修改五官)时,系统面临的核心挑战是如何在精准修改目标区域的同时,保持未编辑区域的整体结构不变,从而维持人物身份属性的稳定。与以往在三维空间中简单合并两组高斯球(该做法易产生明显的空间接缝与几何伪影)不同,SketchFaceGS结合反投影技术精确生成了编辑区域的 UV 掩码,并创新性地提出了一种在生成器多尺度特征空间中进行逐层特征融合的策略。
具体而言,SketchFaceGS首先通过计算线稿差异与形态学膨胀,提取用户在 2D 屏幕上的编辑区域掩码。随后,利用光线投射将该掩码反向投影至3D 空间,筛选出对这些像素具有显著视觉贡献的高斯球,进而借助与 UV 空间的显式映射关系,生成精确的二值UV 掩码。在生成器前向推理的过程中,模型会在重采样后的UV 掩码引导下,将未编辑区域的原始特征与编辑区域的新生特征进行逐层融合。该策略有效消除了空间拼接产生的边界接缝与几何伪影,在确保非编辑区域与人物身份属性高度稳定的同时,实现了自然且多视角一致的三维局部编辑。
得益于前馈式网络与三维生成先验的有效结合,SketchFaceGS在视觉保真度、渲染效率及编辑稳定性上,均优于现有前沿方法。此外,该工作提供了直观的交互界面,同时拓展了其在下游任务中的应用潜力。

图4 线稿驱动生成与部分基线方法的对比结果
如图4的视觉对比所示,在三维人脸生成方面,相比于已有的生成方案(如S3D[14]、Nano-LAM[15] 等),SketchFaceGS克服了几何不一致与“卡通化、过度平滑”等固有缺陷。从生成结果可以看出,该方法不仅较为准确地还原了线稿的结构意图,还赋予了模型建模极其丰富的高频纹理细节的能力,实现了照片级的真实感渲染。

图5 不同参考图和线稿输入下的三维结果
图5进一步展示了系统在面对多样化的线稿与参考图像组合时的三维生成结果。SketchFaceGS能够精准地响应两种模态的输入条件,在各种输入组合下,生成的三维高斯人脸在跨视角渲染中均保持了稳定的三维几何一致性。

图6 线稿驱动编辑与部分基线方法的对比结果
如图6所示, 在交互编辑方面,与基于 ControlNet 的先进 2D 编辑基线 MagicQuill[16] 或者二维编辑后再升维的技术路线Nano-LAM 相比,SketchFaceGS凭借前馈架构的推理优势,在跨视角渲染中保持了几何连贯性,有效解决了线稿保真度低与身份丢失问题。
同时,相比于 SketchFaceNeRF 后优化过程带来的高达10秒的编辑延迟,SketchFaceGS 的单次端到端编辑仅需约 0.3 秒,并支持高达 240 FPS 的渲染帧率,有效保证了编辑过程中的连贯性与即时反馈。

图7 局部线稿编辑下的三维结果
图7展示了该方法在不同局部区域的编辑结果。SketchFaceGS不仅精准捕捉并高度还原了线稿编辑设定的结构变动,有效避免了对非编辑区域的干扰,更在实时的前向推理中,输出了具备跨视角连贯性与高保真度的结果。

图8 细粒度外观控制
借助精确的局部特征融合与解耦能力,如图8所示,SketchFaceGS 在下游任务中展现出了较高的自由度。由于生成管线中几何与外观实现了深度解耦,用户可以保留目标脸型,同时无缝转移其他参考图的特定区域颜色特征(例如一键替换发色)。更进一步,该框架甚至支持在面部自然地添加趣味的自定义图案(如面部纹身),且这些图案能够完美贴合三维面部曲率,展现出极强的细粒度外观控制能力。
借助这一交互框架,创作者无需再面对繁杂的3D建模软件界面,也告别了传统神经渲染动辄数分钟的优化等待。这种兼顾了交互效率与高保真度的方案,为进一步的游戏角色定制、影视概念推演以及数字人资产的快速迭代,提供了一种极具潜力的落地思路。为了推动社区的发展,该项目的计图代码已在GitHub上开源:
https://github.com/gogoneural/SketchFaceGS_jittor
该工作的开源进一步丰富了计图高斯库在三维几何建模与可控编辑领域的应用。计图高斯库(JGaussian)是由中国科学院计算技术研究所高林团队与清华大学计图团队联合发布,为社区提供了基于计图的统一算法接口与高效训练框架,极大降低了3DGS 方法的开发复用门槛。 计图高斯库开源地址:
https://github.com/IGLICT/JGaussian
计图(Jittor)是清华大学开源的自主深度学习框架,完全基于动态编译,采用元算子融合和统一计算图的新技术,并支持国产硬件。元算子易于使用,便于算子的开发和优化,而统一计算图则是融合了静态计算图和动态计算图的诸多优点,在易于使用的同时提供高性能的优化。计图官网为:
https://cg.cs.tsinghua.edu.cn/jittor/
参考文献
Bo Li, Jiahao Kang, Yubo Ma, Feng-Lin Liu, Bin Liu, Fang-Lue Zhang, Lin Gao, SketchFaceGS: Real-Time Sketch-Driven Face Editing and Generation with Gaussian Splatting, CVPR 2026.
Tao Chen, Ming-Ming Cheng, Ping Tan, Ariel Shamir, and Shi-Min Hu, Sketch2Photo: internet image montage, ACM Transactions on Graphics, 2009, Vol. 28, No. 5, Article No. 124,1–10.
Phillip Isola, Jun-Yan Zhu, Tinghui Zhou, Alexei A. Efros, Image-to-Image Translation with Conditional Adversarial Networks, CVPR 2017, 5967-5976.
Youngjoo Jo, Jongyoul Park, SC-FEGAN: Face Editing Generative Adversarial Network With User’s Sketch and Color, ICCV 2019, 1745-1753.
Shu-Yu Chen, Wanchao Su, Lin Gao, Shihong Xia, and Hongbo Fu. 2020, DeepFaceDrawing: deep generation of face images from sketches, ACM Transactions on Graphics, 2020, Vol. 39, No. 4, Article 72, 1-16.
Shu-Yu Chen, Feng-Lin Liu, Yu-Kun Lai, Paul L. Rosin, Chunpeng Li, Hongbo Fu, and Lin Gao, DeepFaceEditing: deep face generation and editing with disentangled geometry and appearance control, ACM Transactions on Graphics, 2021, Vol. 40, No. 4, Article 90, 1-15.
Lvmin Zhang, Anyi Rao, Maneesh Agrawala, Adding Conditional Control to Text-to-Image Diffusion Models, ICCV 2023, 3813-3824.
Kaiwen Jiang, Shu-Yu Chen, Feng-Lin Liu, Hongbo Fu, Lin Gao, Towards High-Quality and Disentangled Face Editing in a 3D GAN, IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025, Vol. 47, No. 4, 2533-2544.
Kaiwen Jiang, Shu-Yu Chen, Feng-Lin Liu, Hongbo Fu, and Lin Gao, NeRFFaceEditing: Disentangled Face Editing in Neural Radiance Fields, ACM SIGGRAPH Asia 2022 conference paper, Article 31, 1–9.
Feng-Lin Liu, Hongbo Fu, Yu-Kun Lai, and Lin Gao, SketchDream: Sketch-based Text-To-3D Generation and Editing, ACM Transactions on Graphics, 2024, Vol. 43, No. 4, Article 44, 1-13.
Lin Gao, Feng-Lin Liu, Shu-Yu Chen, Kaiwen Jiang, Chun-Peng Li, Yu-Kun Lai, and Hongbo Fu, SketchFaceNeRF: Sketch-based Facial Generation and Editing in Neural Radiance Fields, ACM Transactions on Graphics, 2023, Vol. 42, No. 4, Article 159, 1-17.
Bernhard Kerbl, Georgios Kopanas, Thomas Leimkuehler, and George Drettakis, 3D Gaussian Splatting for Real-Time Radiance Field Rendering, ACM Transactions on Graphics, Vol. 42, No. 4, Article 139, 1-14.
Tobias Kirschstein, Simon Giebenhain, Jiapeng Tang, Markos Georgopoulos, and Matthias Nießner, GGHead: Fast and Generalizable 3D Gaussian Heads, ACM SIGGRAPH Asia 2024 conference Papers, Article 126, 1–11.
Hail Song, Wonsik Shin, Naeun Lee, Soomin Chung, Nojun Kwak, Woontack Woo, S3D: Sketch-driven 3D model generation, arXiv preprint arXiv:2505.04185 (2025).
Yisheng He, Xiaodong Gu, Xiaodan Ye, Chao Xu, Zhengyi Zhao, Yuan Dong, Weihao Yuan, Zilong Dong, and Liefeng Bo, LAM: Large Avatar Model for One-shot Animatable Gaussian Head, ACM SIGGRAPH 2025 Conference Papers, Article 27, 1–13.
Zichen Liu, Yue Yu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Wen Wang, Zhiheng Liu, Qifeng Chen, Yujun Shen, MagicQuill: An Intelligent Interactive Image Editing System, CVPR 2025, 13072-13082.
Asiagraphics第37期Webinar将于4月28日线上举办 计图开源!具身装箱算法测试基准JPack发布 第六届“计图”人工智能算法挑战赛启动 Computational Visual Media第12卷第2期导读 ICLR 2026 | 下载破35万!清华&腾讯发布MLLMs全栈套件Bee:含首个大规模多模态推理数据集
可通过下方二维码,关注清华大学图形学实验室,了解图形学、人工智能、深度学习框架、CVMJ期刊和CVM会议的相关资讯。
