计图开源:基于交互距离感知的文本驱动双人动作生成方法

2026/06/19 Tutorial

计图开源:基于交互距离感知的文本驱动双人动作生成方法

近期,北京航空航天大学汪淼团队与惠灵顿维多利亚大学合作,提出了一种面向文本驱动双人交互动作生成的新方法InterDist[1]。现有方法通常着重学习两个人动作之间的时序关联,却较少显式描述双方身体部位之间的空间距离,因而容易出现“动作语义基本正确,但两个人离得太近或太远”的问题。InterDist 将双人交互解耦为两条独立的单人动作序列和一条交互距离序列,在离散空间中联合建模“人怎么动”与“人之间相隔多远”,从而生成语义更准确、空间关系更合理的双人动作。该论文已在IEEE TVCG的2026年第三期上发表,并且基于计图框架的代码已开源。

图1 InterDist支持文本到双人动作生成、反应动作生成、动作补全和长动作生成

Part1

问题和背景

文本驱动三维人体动作生成旨在将自然语言转化为连续三维动作,已从单人动作逐步拓展到握手、拥抱、格斗、共舞等双人交互场景。相比单人动作,双人交互不仅要求个体动作符合语义,还需准确建模双方的相对位置、身体朝向和关键关节接触关系。

现有方法多通过交叉注意力、因果建模或双分支结构隐式学习人物间关联,缺乏对交互距离的显式建模,因而难以区分动作模式相似但空间约束不同的交互行为。InterDist 针对这一问题,将双人交互分解为两个人各自的归一化动作序列以及双方关节间的动态距离序列,显式建立文本、动作与距离之间的对应关系。由此,模型不仅能理解交互“做什么”,还能学习“在哪里做”以及“双方应保持多远”,从而生成语义一致且空间关系合理的双人动作。

Part2

方法概述

InterDist是一个在离散状态空间中运行的掩码生成模型,整体包含两个阶段:第一阶段构建距离感知的动作与距离tokenizer,第二阶段利用条件双向掩码Transformer,从文本预测两条动作token序列和一条交互距离token 序列。InterDist的整体框架如图2所示,其中第一阶段旨在联合量化动作与距离,第二阶段则根据文本并行预测三类离散token。

图 2 InterDist 整体框架

2.1 距离感知的动作与距离量化

InterDist 首先将原始双人动作M1M2归一化为两条独立的单人动作序列,并额外计算两人关节间随时间变化的距离矩阵,形成交互距离序列。随后,模型分别用动作编码器和距离编码器提取时空特征,并通过向量量化码本将其离散化为动作token和距离token。解码时,动作 token 与距离token共同参与重建,通过自注意力和共享交叉注意力恢复原始双人动作。该设计将“个体姿态建模”和“交互空间关系建模”解耦,使动作与距离各自拥有独立表示,同时又能在解码阶段协同生成空间关系更合理的双人交互动作。

2.2 条件双向掩码 Transformer

完成离散量化后,InterDist使用CLIP编码输入文本,获得句子级特征和词级特征,并以此为条件预测两个人的动作 token以及交互距离token。此外,InterDist采用双向掩码建模。推理开始时,待生成位置均被设置为 `[MASK]`;模型在每轮迭代中并行预测所有被掩码token,再根据置信度重新掩码并修正不确定结果。

2.3 文本条件注入模块

为了让生成动作更准确地响应自然语言,InterDist 在 Transformer 中引入了文本条件注入模块。句子级文本特征通过多层感知机生成缩放与平移参数,并利用AdaLN调制动作和距离特征;词级特征则通过交叉注意力提供更细粒度的语义约束,如图3所示。

此外,模型为两条动作序列和距离序列加入可学习的身份token,使网络能够区分不同模态;三类token在通道维度拼接后进行联合学习,从而以较低计算开销建立文本与双人交互之间的映射。

图 3 文本条件注入模块

2.4 基于混合专家的跨模态交互模块

在分别获得动作与距离特征后,模型仍需回答一个关键问题:两个人的动作变化应当如何影响彼此,以及如何与交互距离保持一致?

InterDist为此设计了基于混合专家机制的跨模态交互模块。模块包含动作专家、距离专家和路由网络。对于任意一类token,路由网络会计算来自其他模态专家的权重,再通过加权聚合与交叉注意力注入相关信息。例如,第一个人的动作特征会同时参考第二个人的动作和双方距离,距离特征也会根据两个人当前的动作状态进行更新。

相比直接拼接特征或堆叠多层交叉注意力,该模块能以更紧凑的结构捕获“角色1动作—角色2动作—角色间关节交互距离”之间的依赖关系。

图 4 基于动作专家、距离专家和路由网络的跨模态交互模块

Part 3

结果展示

研究团队在 InterHuman 和 Inter-X两个双人动作基准上对InterDist 进行了评测。实验采用R-Precision衡量文本与动作的匹配程度,FID 衡量生成动作与真实动作分布之间的差异,并使用MM-Dist、Diversity和 Multimodality等指标评价语义距离与生成多样性。

在InterHuman 测试集上,InterDist 的 R-Precision Top-1、Top-2 和 Top-3 分别达到0.494、0.653 和 0.732,均优于对比方法;在Inter-X 测试集上,Top-1 R-Precision从此前最佳结果 0.412 提升至0.511,FID 从0.385降低至0.245。

表1 数据集评估指标数据表

定性结果进一步表明,InterDist能够更好地保持双人动作中的空间关系。在“相互鞠躬”示例中,部分方法会出现角色朝向或站位错误;在“一人挥拳、另一人后仰躲避”示例中,部分方法会生成距离过近、动作交叠或因果关系不清的结果。InterDist生成的动作在关键交互时刻具有更合理的身体距离,也更贴合文本描述。

图 5 InterDist与三种方法的的定性对比

在推理效率方面,InterDist在InterHuman测试集上的平均推理时间约为0.47秒, 同时取得0.494的Top-1 R-Precision。作为对比,InterMask、TIMotion和InterGen的平均推理时间分别约为 0.81 秒、0.78 秒和 1.43 秒。并行掩码预测、较低维度的token表示以及紧凑的跨模态交互结构共同提升了推理速度。

图 6 推理速度、文本动作匹配性能与模型参数量对比

除了常规的文本到双人动作生成,InterDist的二维动作量化与掩码机制还支持三类扩展应用:

  1. 反应动作生成:给定文本生成第一个人的动作,再以该动作为条件生成另一个人的合理反应;

  2. 动作补全与编辑:掩码指定时间段的token,并通过新的编辑文本生成自然的中间动作;

  3. 长动作生成:组合不同文本生成的动作片段,预测片段之间的过渡token,形成连贯的长序列交互。

图 7 反应动作生成、动作补全和长动作生成示例

Part 4

计图开源

该项目的计图代码已在Github上开源:

https://github.com/Jiaqi-zhang/InterDist

计图(Jittor)是清华大学开源的自主深度学习框架[5],完全基于动态编译,采用元算子融合和统一计算图的新技术,并支持国产硬件。元算子易于使用,便于算子的开发和优化,而统一计算图则是融合了静态计算图和动态计算图的诸多优点,在易于使用的同时提供高性能的优化。计图官网为:

https://cg.cs.tsinghua.edu.cn/jittor/

参考文献

  1. Jia-Qi Zhang, Jia-Jun Wang, Fang-Lue Zhang, Miao Wang, Generating Distance-Aware Human-to-Human Interaction Motions From Text Guidance, IEEE Transactions on Visualization and Computer Graphics, 2026, Vol. 32,  No. 3, 2615-2627.

  2. Han Liang, Wenqian Zhang, Wenxuan Li, Jingyi Yu & Lan Xu, Intergen: Diffusion-based multi-human motion generation under complex interactions, International Journal of Computer Vision, 2024, 132(9), 3463-3483.

  3. Muhammad Gohar Javed, chuan guo, Li cheng, Xingyu Li, Intermask: 3d human interaction generation via collaborative masked modeling, ICLR 2025.

  4. Yabiao Wang, Shuo Wang, Jiangning Zhang, Ke Fan, Jiafu Wu, Zhucun Xue, Yong Liu, Timotion: Temporal and interactive framework for efficient human-human motion generation, CVPR 2025,  7169-7178.

  5. Shi-Min Hu, Dun Liang, Guo-Ye Yang, Guo-Wei Yang, and Wen-Yang Zhou, Jittor: A Novel Deep Learning Framework with Meta-Operators and Unified Graph Execution, Science China Information Science, 2020, Vol. 63, No. 12, article no. 222103. 

CGAI往期回顾
  1. CVMJ最新影响因子8.3,列计算机学科软件工程类第4
  2. 超级智能体Agivar开放下载|会学习、会操作的桌面 AI 助手来了!
  3. Scopus发布2025年度影响因子, CVMJ以28.6 排名1/131
  4. 第六届“计图”人工智能算法挑战赛启动
  5. ICLR 2026 | 下载破35万!清华&腾讯发布MLLMs全栈套件Bee:含首个大规模多模态推理数据集

    可通过下方二维码,关注清华大学图形学实验室,了解图形学、人工智能、深度学习框架、CVMJ期刊和CVM会议的相关资讯。

    图片

    Search

      Table of Contents