Persona-Gestor 个性化姿态合成系统

基于原始语音音频的端到端生成模型,通过自动模糊特征推理实现个性化 3D 全身姿态生成,在 Trinity、ZEGGS 和 BEAT 数据集上达到 SOTA 性能。

角色姿态合成模型研究与实验验证协作者

2024年 · 姿态合成 · 语音驱动 · 模糊推理 · AdaLN · 扩散模型

项目概述

Persona-Gestor 是一个创新的端到端生成模型,仅从原始语音音频即可生成高度个性化的 3D 全身姿态。该系统通过模糊特征提取器和 AdaLN 变换器扩散架构,解决了传统方法需要复杂多模态处理的限制。

核心技术

模糊特征推理

  • 首创模糊特征推理策略,自动推断隐式连续特征
  • 无需风格标签或额外输入,显著提升系统可用性
  • 将多种输入特征统一为潜在特征表示

AdaLN 变换器扩散架构

  • 结合自适应层归一化变换器与扩散模型
  • 增强姿态-语音交互建模能力
  • 在所有标记上应用统一函数,确保姿态自然度和同步性

实验验证

多数据集评估

  • Trinity 数据集: 生成与语音一致的全身体姿态序列
  • ZEGGS 数据集: 支持 19 种音频风格,产生广泛动作风格
  • BEAT 数据集: 验证对 30 个说话者的个性化姿态生成能力

对比实验结果

消融实验结果

性能表现

  • 主观客观评估均优于当前最先进方法
  • 生成姿态具有高可信度、语音适当性和个性化
  • 对真实环境音频和噪声干扰表现出卓越鲁棒性

学术贡献

论文发表

  • IEEE TVCG: 《Speech-driven Personalized Gesture Synthetics: Harnessing Automatic Fuzzy Feature Inference》
  • Electronics: 《DiT-Gesture: A Speech-Only Approach to Stylized Gesture Generation》

技术创新

  1. 首次将模糊特征推理应用于语音驱动姿态生成
  2. 提出 AdaLN 变换器扩散架构优化姿态-语音交互
  3. 在多个基准数据集上验证方法优越性