当前位置:首页 >> 学术资讯 >> 科研信息

清华大学深圳国际研究生院吴志勇团队合作在表现力语音合成的自动风格控制和篇章情感分析上取得系列进展

2024/03/29

语音合成旨在让机器根据给定的文本生成对应内容的语音。表现力语音合成(Expressive Speech Synthesis)致力于为语音合成提供更丰富的情感波动和风格变化,以提高合成语音的拟人度和感染力,在有声读物、虚拟主播、虚拟人等场景下有着广泛的应用价值,因而受到了越来越多研究者的关注。

近日,清华大学深圳国际研究生院吴志勇团队在表现力语音合成的自动风格控制和篇章情感分析上连续取得研究进展。

在表现力语音合成的自动风格控制上,研究团队引入去噪扩散概率模型(Denoising Diffusion Probabilistic Model,DDPM)来构建一种生成式的语音韵律预测方法。该预测方法以语音合成系统的输入文本作为预测条件,训练DDPM以迭代去噪的形式从白噪声中采样得到目标特征,作为预测的语音韵律表征,并提供给语音合成框架作为语音风格的控制信息,从而生成具有特定风格的合成语音。

图1.模型的总体框架(a)、训练流程(b)与推理流程(c)

相较于传统的基于预测误差优化的确定性预测方法,团队提出的方法避免了对目标韵律表征分布做简化假设,有效提升了对于人类语音风格真实分布的拟合效果,改善了现有方法预测结果存在的过平滑问题,显著增强了合成语音的表现力。基于生成采样形式的预测流程,该方法具有为相同文本提供多样的语音风格信息的能力,进一步提高了表现力语音合成系统输出结果与真人表达习惯的相似性。

图2. 模型生成结果的表现力评分结果与分布拟合效果

图3.模型在同样一句文本上采样得到的多样化生成结果

在表现力语音合成的篇章情感分析上,研究团队设计了一种基于篇章级多尺度情感分析模型的情感分析方法。该分析方法从篇章、句子、词语、发音音素四个层级出发对输入篇章文本进行情感分析,并分别使用全局风格表征向量(Global Style Embedding,GSE)、局部韵律表征序列(Local Prosody Embedding,LPE)作为输出,以从篇章整体情感基调和局部情感起伏变化两个尺度建模语音的风格元素。

图4. 篇章级情感分析模型总体工作流程

与传统缺乏篇章级上下文的情感分析模型相比,团队提出的方法能有效利用不同尺度的文本信息,改善了合成语音的停顿、韵律自然度。篇章上下文信息的引入,使得合成语音具有更好的全局一致性,大幅提升了合成语音在主观听感上的整体连续性。

图5.篇章级情感分析模型合成结果主观评分

表现力语音合成自动风格控制方面的研究成果,近日以“基于去噪扩散概率模型的多样化高表现力语音韵律预测”(Diverse and Expressive Speech Prosody Prediction with Denoising Diffusion Probabilistic Model)为题,被“国际语音通讯学会2023年会”(The 24th Annual Conference of the International Speech Communication Association) 录用,并获得最佳学生论文奖。

获奖证书

清华大学深圳国际研究生院2020级硕士生李翔为该文章第一作者,通讯作者为清华大学深圳国际研究生院吴志勇副研究员,论文共同作者还包括腾讯AI Lab刘颂湘博士、林永業先生、翁超博士和香港中文大学系统工程与工程管理学系蒙美玲教授。该研究成果得到了国家自然科学基金委员会、深圳市科技创新委员会、深圳腾讯计算机系统有限公司等部门和单位的支持。

表现力语音合成的篇章情感分析上的研究成果,近日以“基于篇章级多尺度韵律模型的细粒度情感分析方法”(A Discourse-Level Multi-Scale Prosodic Model for Fine-Grained Emotion Analysis)为题,被“2023中国多媒体大会”(China Multimedia 2023) 录用,并获得最佳论文奖。

获奖证书

清华大学计算机科学与技术系2020级硕士生魏宪豪为该文章第一作者,通讯作者为清华大学计算机科学与技术系贾珈教授,论文共同作者还包括清华大学深圳国际研究生院2020级硕士生李翔、清华大学深圳国际研究生院吴志勇副研究员、清华大学美术学院2020级硕士生王紫伊。


版权声明:
文章来源清华大学新闻,分享只为学术交流,如涉及侵权问题请联系我们,我们将及时修改或删除。

相关学术资讯
近期会议

2026年智慧交通与检测技术国际会议(ITDT 2026)(2026-03-25)

2026年第六届智能机器人系统国际会议(ISoIRS 2026)(2026-03-27)

2026年人工智能教育技术与数据科学国际学术会议(AIETDS 2026)(2026-03-27)

2026年IEEE第八届软件工程和计算机科学国际会议(CSECS 2026)(2026-04-17)

第十五届春季国际工程与技术大会 (SCET 2026)(2026-04-17)

2026年金融科技、创新与信息技术国际会议(2026-04-18)

2026年多尺度人工智能国际会议(MAI 2026)(2026-04-24)

第三届机器学习与智能计算国际学术会议(MLIC 2026)(2026-04-24)

2026 空天信息与产业创新国际学术研讨会暨第二届中国——塞尔维亚空天技术与产业应用研讨会(ISA3I 2026)(2026-04-24)

数字化教育系统与计算机科学国际学术会议(2026-04-24)

2026交互设计、模型工程与自然语言处理国际会议(IDMELP 2026)(2026-3-29)

2026年物联网,大数据与信息工程国际会议(ITBDIE 2026)(2026-3-28)

2026年计算机工程与电子信息国际会议(ICEICE 2026)(2026-4-28)

2026年人工智能、人机交互与产品设计国际会议(ICAIHCIPD 2026)(2026-4-28)

2026物联网、网络安全与软件技术国际会议(ICITCS 2026)(2026-4-27)

2026年密码学、数据安全与通信技术国际会议(CDSCT 2026)(2026-3-27)

2026算法、微芯片与分布式处理国际会议(ICAMDP 2026)(2026-4-28)

2026年信息管理与大数据国际会议(IACBDIM 2026)(2026-6-28)

2026年医学、医疗器械与系统生物学国际会议(MMDSB 2026)(2026-3-28)

2026年水动力学、船舶工程与海洋资源国际会议(ICHSEMR 2026)(2026-5-29)

小贴士:学术会议云是学术会议查询检索的第三方门户网站。它是会议组织发布会议信息、众多学术爱好者参加会议、找会议的双向交流平台。它可提供国内外学术会议信息预报、分类检索、在线报名、论文征集、资料发布以及了解学术资讯,查找会服机构等服务,支持PC、微信、APP,三媒联动。
综合推荐区

学术科研网址导航,430+站,定制学术书签

2026年第五届云计算、计算机视觉和图像处理.

2026年动力学与机械工程国际学术研讨会 (.

2026年IEEE第八届软件工程和计算机科学.

2026年第八届计算机图形学、图像与可视化国.

第八届信息科学、电气与自动化工程国际学术会议.

第三届机器学习与智能计算国际学术会议(MLI.

第六届自动化控制、算法与智能仿生国际学术会议.

2026 年第三届计算,机器学习与数据科学国.

第十三届先进制造技术与材料工程国际学术会议 .

第二届人工智能与产品设计国际学术会议 (AI.

2026年多尺度人工智能国际会议(MAI 2.

2026年量子计算与人工智能国际学术会议(I.

2026年第六届计算机视觉与模式分析国际学术.

第七届机械仪表与自动化国际学术会议(ICMI.

2026年第四届亚洲机器学习、算法与神经网络.

2026年第四届亚洲计算机视觉、图像处理与模.

2026年人工智能与数据挖掘国际学术会议(A.

2026年IEEE第七届计算,网络与物联网国.

2026年第五届网络、通信与信息技术国际会议.

2026年智能机器人与控制技术国际会议(CI.

2026年传感器技术、自动化与智能制造国际会.

2026年智能系统与计算国际会议 (ICIS.

2026年电子, 通信与计算机科学国际会议 .

2026年IEEE第三届先进机器人, 自动化.

2026年第七届控制, 机器人与智能系统国际.