Persona-Gestor 个性化姿态合成系统
基于原始语音音频的端到端生成模型,通过自动模糊特征推理实现个性化 3D 全身姿态生成,在 Trinity、ZEGGS 和 BEAT 数据集上达到 SOTA 性能。
姿态合成模型研究与实验验证协作者
项目概述
Persona-Gestor 是一个创新的端到端生成模型,仅从原始语音音频即可生成高度个性化的 3D 全身姿态。该系统通过模糊特征提取器和 AdaLN 变换器扩散架构,解决了传统方法需要复杂多模态处理的限制。
核心技术
模糊特征推理
- 首创模糊特征推理策略,自动推断隐式连续特征
- 无需风格标签或额外输入,显著提升系统可用性
- 将多种输入特征统一为潜在特征表示
AdaLN 变换器扩散架构
- 结合自适应层归一化变换器与扩散模型
- 增强姿态-语音交互建模能力
- 在所有标记上应用统一函数,确保姿态自然度和同步性
实验验证
多数据集评估
- Trinity 数据集: 生成与语音一致的全身体姿态序列
- ZEGGS 数据集: 支持 19 种音频风格,产生广泛动作风格
- BEAT 数据集: 验证对 30 个说话者的个性化姿态生成能力
对比实验结果
消融实验结果
性能表现
- 主观客观评估均优于当前最先进方法
- 生成姿态具有高可信度、语音适当性和个性化
- 对真实环境音频和噪声干扰表现出卓越鲁棒性
学术贡献
论文发表
- IEEE TVCG: 《Speech-driven Personalized Gesture Synthetics: Harnessing Automatic Fuzzy Feature Inference》
- Electronics: 《DiT-Gesture: A Speech-Only Approach to Stylized Gesture Generation》
技术创新
- 首次将模糊特征推理应用于语音驱动姿态生成
- 提出 AdaLN 变换器扩散架构优化姿态-语音交互
- 在多个基准数据集上验证方法优越性