计图开源:面向微结构均质化计算的高保真可微神经求解器GMT
山东大学吕琳教授团队与香港大学、微软亚洲研究院的学者合作,提出了一种面向微结构均质化计算的几何多重网格Transformer求解器GMT(Geometric Multigrid Transformer)[1]:神经网络不再直接替代传统求解器,而是为几何多重网格提供高质量的多层初始解,再由一次数值V-cycle 完成误差校正。在512³分辨率、六个弹性载荷工况并匹配10⁻⁵相对残差的等精度测试中,GMT用时2.378秒,相比GPU-GMG的389.29秒实现约160倍加速;与此同时,它仍保持求解器级精度,并能泛化到多类未见晶格拓扑。
该论文已在ACM SIGGRAPH 2026报告,并发表于ACM Transactions on Graphics的2026年第4期,基于计图框架的代码已开源。

图1 GMT:一种面向微结构均质化计算的几何多重网格 Transformer 求解器
微结构设计的基本思想,是在材料成分不变的前提下,通过调控内部几何拓扑来获得目标宏观性能,如轻量化、高比强度、高比刚度或高热导率。航空航天轻量化构件、吸能结构、热交换器等,均建立在这一原理之上。然而,从设计出一种几何构型,到定量评估其等效宏观性能,中间必须跨越一个计算代价高昂的环节——均质化计算。
以周期性晶格单元为例,研究者需要在代表性体元上求解一系列偏微分方程,进而得到等效弹性张量、等效热导率等宏观物性。其中,线弹性问题通常需要求解多个独立载荷工况,稳态热传导问题则需针对不同温度梯度方向分别求解。
随着结构分辨率提升、杆件变细、几何拓扑趋于复杂,离散后的线性系统规模会迅速增长。共轭梯度、几何多重网格法(GMG)、代数多重网格(AMG)等传统方法虽然能保证数值精度,但在大规模、高通量的设计任务中仍然耗时显著[2,3]。
近年来,深度学习开始被用于直接预测等效物性或位移场、温度场[4,5]。然而,纯数据驱动模型仍面临三个关键挑战:
- 精度不足:神经网络倾向于优先拟合低频模式,难以稳定恢复局部高频误差;
- 物理约束难以严格满足:周期边界、材料对称性与方程残差往往无法被精确保证;
- 泛化能力受限:面对未见晶格拓扑、复杂细杆结构或非周期几何时,预测可能发生明显漂移。
GMT的目标正是解决这一矛盾:既发挥神经网络的速度,又保留数值求解器的可靠性。
几何多重网格的 V-cycle 通过预平滑、残差限制、粗网格求解、延拓和后平滑逐层消除误差。它的优势在于,不同频率的误差可以在不同网格层级上得到有效处理;但标准流程通常在各层级从零初始化,因此一次V-cycle 往往不足以达到目标残差,需要重复执行多个循环。
GMT的核心问题不是“能否让网络直接给出最终答案”,而是:能否让网络预测更好的多层初始解,使GMG 不必反复从零开始,并把多个 V-cycle 压缩为一次?GMT给出的答案是:同时预测最细层物理场和多层残差校正量。网络负责快速建立在全局上更准确、在频谱上更合理的初始状态;GMG 则保留原有平滑、限制、延拓和校正操作,负责消除剩余局部误差。神经预测与数值迭代由此不再是前后拼接的两个模块,而是在同一多层结构中协同工作。
GMT的核心理念可以概括为:让Transformer的网络结构与GMG的求解层级对齐。
GMT的输入是体素化微结构,输出包括最细层初始场以及各粗层级的修正量。求解时,预测结果被注入对应的GMG 层级,随后执行一次可微 V-cycle:预平滑去除高频误差,残差传向粗网格处理低频误差,再通过延拓逐层修正细网格解。最终物理场不仅来自网络预测,也经过了明确的数值方程校正(见图2)。

图2 GMT核心架构:左侧网络预测多层初值,右侧EBE-GMG在相同层级上执行数值校正。
GMT以Point Transformer V3(PTv3)[6]为骨干,并将其重构为与GMG架构对齐的U-Net式层级。网络下采样对应从细网格向粗网格传递信息,上采样对应从粗网格向细网格恢复并修正解。与普通体素池化不同,GMT使用由多重网格结构决定的池化和反池化关系,使网络中的特征流动与求解器中的误差传播保持一致。Transformer模块则用于建模局部几何变化对远距离物理响应的影响。
直接将三维节点排列为一维序列,会产生邻域被切断和方向偏置。GMT采用三种循环坐标置换下的Morton视图,让不同序列提供互补邻域,从而减少序列化带来的盲区并更好地保持空间各向同性。与此同时,分辨率感知的旋转相对位置编码Ra-RoPE使周期边界两侧在每个网格层级获得一致相位,显式表达“边界两端在物理上相连”这一关系。
为适应高分辨率微结构,GMT仅在活跃体素和节点上构建稀疏层级,减少空白区域的存储与计算开销;数值部分采用EBE-GMG(Element-by-Element Geometric Multigrid),在单元层面执行运算,避免显式构造和存储完整全局稀疏矩阵。该实现更适合GPU并行,也使网络预测和V-cycle可以作为一个可微整体参与后续优化。
GMT不依赖为每个训练样本预先生成高精度物理场标签,而是以离散方程残差作为主要训练信号,并加入规范约束,直接优化预测解对线性系统的满足程度。训练集包含50,000 个周期微结构,覆盖三周期极小曲面(TPMS)、参数化壳晶格(PSL)和桁架类结构(Truss)。这种设置降低了标注成本,也让训练目标与最终求解精度保持一致。
论文在三维线弹性和稳态热传导任务上评估了GMT,并与AMGCL、AmgX、GPU-PCG、GMG以及多类神经网络方法进行对比。
在高分辨率条件下,GMT的总推理与修正时间约为 2.38 秒。相比之下,AmgX、GMG、GPU-PCG和AMGCL的耗时分别约为441.52秒、389.29 秒、623.27 秒和 1138.52 秒。GMT相比主流GPU求解器实现了超过160倍的加速 (见表1)。
表1 与传统数值方法的求解效率对比

更重要的是,GMT并不是单纯追求速度。论文结果表明,GMT可以达到约10-5量级的相对残差,并将等效物性误差控制在工程计算可接受的范围内。相较于直接预测结果的纯神经代理模型,GMT通过后续数值修正获得了更可靠的物理一致性 (见表2)。
表2 在多个数据集下与其他方法的求解精度对比

在结构泛化方面,研究团队测试了TPMS、PSL、Truss、L-BOM、Sto-MS等多类晶格拓扑。结果显示,GMT能够在不针对每一种几何结构重新训练的条件下保持稳定表现,并可扩展到未见结构和非周期设置。
消融结果进一步说明,各项设计都直接影响最终残差。将Transformer换成CNN后,残差由2.44×10⁻⁵ 恶化到7.70×10⁻⁴;只预测最细层而不提供多层修正时,残差为7.14×10⁻⁴;使用普通 PTv3注意力、普通RoPE或体素池化时,残差分别为7.21×10⁻⁴、7.41×10⁻⁴和1.01×10⁻³ (见表3)。只有同时采用 Transformer、多层耦合、均质化感知注意力、Ra-RoPE与GMG Pooling,才能稳定达到求解器级精度。
表3 消融实验:不同主干网络和数值求解器的对比

当高精度均质化计算从数百秒缩短到数秒后,微结构设计流程将发生明显变化。
一方面,GMT可以用于生成式设计中的实时筛选:生成模型一次产生大量候选晶格后,GMT能够快速评估其力学或热学性能,将原本需要长时间离线计算的筛选步骤压缩到更接近交互式的速度,在20480个候选结构中,将筛选时间从11小时降低至4.8分钟(见图3)。

图3 GMT在生成式设计中的实时筛选示意图
另一方面,GMT也适用于大规模多尺度仿真。对于由大量不同微结构单元构成的宏观结构,快速获得每个单元的等效物性,是开展整体仿真、支撑材料发现与结构优化的基础,该宏观结构由3,204个周期单元组成,细尺度节点总数超过2.2*10^8,仿真时间从1.5小时降低至40秒(见图4)。

图4 GMT用于大规模多尺度仿真示意图
此外,GMT还可用于晶格结构的逆均质化设计和大规模多目标性能评估。在逆均质化任务中(图5),GMT将拓扑优化的单次迭代时间由140ms缩短至90ms;在30万个晶格结构的Pareto前沿构建任务中(图6),GMT可联合评估刚度、导热率和体积分数,帮助设计者从大规模候选空间中高效识别不同性能权衡下的优选微结构。

图5 GMT整体流程可微,可用于晶格结构逆均质化设计

图6 GMT用于30万数据集的多物理Pareto前沿构建任务,仿真时间由330小时缩短至3小时
GMT展示了一条值得关注的神经数值计算路线:网络不再只是传统求解器之前的快速猜测器,也不直接取代数值方法,而是学习求解器在不同层级上应如何初始化;多重网格则保留严格的误差传播和校正机制。通过这种结构对齐,GMT把系统送入近收敛区间,再用一次V-cycle完成求解,实现了“神经网络速度”和“求解器级精度”的统一。
对于微结构均质化而言,这意味着高精度物性评估可以从设计流程中的计算瓶颈,转变为可被频繁调用的基础能力;对于更广泛的科学计算而言,它也提示了一种更稳健的方向:让学习模型理解并增强成熟数值算法的内部结构,而不是只学习输入到输出的表面映射。
该项目的计图代码已在Github上开源:
https://github.com/xing-yuu/GMT/tree/jittor
计图(Jittor)是清华大学开源的自主深度学习框架[7],完全基于动态编译,采用元算子融合和统一计算图的新技术,并支持国产硬件。元算子易于使用,便于算子的开发和优化,而统一计算图则是融合了静态计算图和动态计算图的诸多优点,在易于使用的同时提供高性能的优化。计图官网为:
https://cg.cs.tsinghua.edu.cn/jittor/
参考文献
Yu Xing, Yang Liu, Tianyang Xue, and Lin Lu, GMT: A Geometric Multigrid Transformer Solver for Microstructure Homogenization, ACM Transactions on Graphics, 2026, Vol. 45, No. 4, Article No.: 122, 1-15.
Di Zhang, Xiaoya Zhai, Ligang Liu, and Xiao-Ming Fu, An optimized, easy-to-use, open-source GPU solver for large-scale inverse homogenization problems, Structural and Multidisciplinary Optimization, 2023, Vol. 66, article no. 207.
Naumov, M., Arsaev, M., Castonguay, P., Cohen, J., etal., AmgX: A library for GPU accelerated algebraic multigrid and preconditioned iterative methods, SIAM Journal on Scientific Computing, 2015, Vol. 37, No. 5, S602-S626.
Chengping Rao and Yang Liu, Three-dimensional convolutional neural network (3D-CNN) for heterogeneous material homogenization, Computational Materials Science, 2020, Vol. 184, 109850.
Liangchao Zhu, Xuwei Wang, Weidong Zhong, and Ming Li, Learning microstructure–property mapping via label-free 3D convolutional neural network, The Visual Computer, 2024, Vol. 40, No. 10, 7025–7044.
Xiaoyang Wu, Li Jiang, Peng-Shuai Wang, Zhijian Liu, Xihui Liu, Yu Qiao, Wanli Ouyang, Tong He, andHengshuang Zhao, Point transformer v3: Simpler faster stronger, CVPR 2024, 4840-4851.
Shi-Min Hu, Dun Liang, Guo-Ye Yang, Guo-Wei Yang, and Wen-Yang Zhou, Jittor: A Novel Deep Learning Framework with Meta-Operators and Unified Graph Execution, Science China Information Sciences, 2020, Vol. 63, No. 12, article no. 222103.
Computational Visual Media第12卷第3期导读 诚邀投稿,CVM2027@新加坡期待您的参与! AI驱动的三维CAD模型生成综述|CVMJ Spotlight 计图开源:基于交互距离感知的文本驱动双人动作生成方法 SIGGRAPH 2026:清华联合腾讯、惠灵顿维多利亚大学提出 Pixal3D,实现像素级对齐的图像到 3D 生成
