近日,东北林业大学计算机与人工智能学院罗辉副教授团队的研究成果《Manifold-Aligned VQ Convolutional Adapters for Parameter-Efficient Cross-Lingual Speech-Driven 3D Facial Animation》被SCA 2026(ACM SIGGRAPH/Eurographics Symposium on Computer Animation)正式录用。SCA是计算机动画(Computer Animation)领域国际顶级学术会议之一,也是SIGGRAPH体系下最具影响力的动画研究会议之一,在数字人、虚拟角色动画、计算机图形学等方向具有重要国际影响力。
聚焦跨语言数字人难题:让虚拟角色真正“说好不同语言”
近年来,随着数字人、虚拟主播、智能客服以及元宇宙技术的快速发展,语音驱动三维人脸动画(Speech-driven 3D Facial Animation)成为数字人生成的重要研究方向。该技术能够根据输入语音自动生成逼真的嘴唇、面部表情和头部运动,实现更加自然的人机交互体验。
然而,目前主流模型大多依赖英语数据进行训练,当直接应用于中文、日语等其他语言时,常常出现口型不同步、表情僵硬、动作不自然等问题。这是因为不同语言具有不同的发音方式和口部运动规律,导致模型学习到的人脸运动分布难以适应新的语言环境。
传统解决方案通常需要重新微调整个模型,不仅训练成本高,而且容易破坏模型原有能力,对于实际部署大规模多语言数字人系统存在较大挑战。
针对这一问题,研究团队提出了一种全新的跨语言适配框架——Manifold-Aligned VQ Convolutional Adapter,以极少量参数实现高效语言迁移,为多语言数字人的快速部署提供了新的解决方案。

MAVQ框架:用“小插件”实现“大能力”
研究团队发现,不同语言之间的差异,本质上来源于人脸运动空间中的分布偏移。依托英文数据训练的传统模型学习得到的运动编码更适合英语,而面对中文等语言时,无法准确覆盖新的发音动作,因此生成效果明显下降。
基于这一观察,团队提出了流形对齐(Manifold Alignment)思想,将跨语言适配看作是在已有运动空间上的局部几何校正,而不是重新学习整个模型。
在具体实现上,研究团队设计了轻量级的卷积适配器(Convolutional Adapter),仅插入到模型关键模块中,对已有运动特征进行局部修正,而主体网络参数全部保持冻结。
相比传统线性Adapter,该方法利用一维卷积能够捕获连续时间上的运动变化规律,不仅关注当前口型,还能够学习嘴唇运动的速度和变化趋势,更符合真实人脸发音过程中的动态特征,从而有效提升跨语言口型生成质量。
更重要的是,该方法仅需更新0.46%~1.26%的模型参数,即可完成跨语言迁移,大幅降低训练成本和部署开销。
构建中文三维语音人脸数据集,推动多语言数字人研究
针对中文三维语音数据资源匮乏的问题,研究团队基于浙江大学视觉智能与模式分析(VIPA)研究组的CMLR中文唇语识别数据集,进一步构建了CMLR-3D中文语音驱动三维人脸数据集。
该数据集基于高质量中文视频重建得到,包含大量中文发音对应的三维人脸运动序列,并统一转换为标准FLAME三维人脸模型,为跨语言数字人研究提供了新的数据基础,也为后续相关研究提供了重要支撑。
多项实验验证:极少参数即可显著提升跨语言动画质量
研究团队在当前主流语音驱动三维人脸动画模型CodeTalker和ARTalk上进行了大量实验验证。
实验结果表明,在几乎冻结全部模型参数的情况下,MAVQ框架依然能够稳定提升跨语言生成效果。

与原始模型相比:
(1)、CodeTalker跨语言口型误差降低约17.8%,音视频同步能力提升约40.7%;
(2)、ARTalk口型误差降低约9.7%,音视频同步性能提升约19.6%;
(3)、在用户主观评价实验中,生成的人脸动作自然度和真实感均获得明显提升。
值得关注的是,相较于传统全参数微调方式,研究团队提出的方法不仅效果更优,而且仅需训练不到2%的参数,在模型规模不断扩大的背景下展现出极高的应用价值。
进一步分析发现,该方法并未改变模型原有知识,而是通过调整已有运动编码的选择方式,实现不同语言口型动作的精准匹配,从而保持了模型原有生成能力,同时具备更好的跨语言适应性。
为多语言数字人与智能交互提供新的技术路线
随着AIGC、数字人和智能体技术快速发展,多语言交互已经成为数字内容生成的重要需求。如何让数字人能够自然流畅地使用不同语言表达,已成为学术界和产业界共同关注的问题。
该研究提出的流形对齐卷积适配框架,以参数高效微调为核心思想,在保证模型原有能力的基础上,实现了跨语言三维人脸动画的快速适配,为未来多语言数字人、虚拟主播、智能客服以及跨文化人机交互提供了一条更加高效、可扩展的技术路径。
未来,研究团队将进一步探索更广泛的跨语言&风格迁移方法,并拓展到更多语言和更丰富的人脸控制任务,为构建更加智能、自然的数字人系统提供理论基础与技术支撑。