结合数据平衡和注意力机制的CNN+LSTM的自然语音情感识别①
2021-05-21张石清赵小明
计算机系统应用 2021年5期
陈 港,张石清,赵小明,
1(浙江理工大学 机械与自动控制学院,杭州 310018)
2(台州学院 智能信息处理研究所,台州 318000)
人类的语言不仅包含了丰富的文本信息,同时也携带着包含人们情绪表达的音频信息,如语音的高低、强弱、抑扬顿挫等变化.如何让计算机从语音信号中自动识别出说话人的情感状态,即所谓的“语音情感识别”方面的研究,已成为人工智能、模式识别、情感计算等领域中的一个热点研究课题.该研究旨在让计算机通过分析说话人的语音信号对用户的情感信息进行获取、识别和响应,从而实现用户与计算机之间的交互更加和谐与自然.该研究在智能人机交互、电话客服中心、机器人等方面具有重要的应用价值.
目前,在语音情感识别领域中,大量的前期工作[1-4]主要是针对模拟情感而进行的,因为这种模拟情感数据库的建立相对自然情感而言,要容易得多.近年来,针对实际环境下的自然语音情感识别方面的研究备受研究者的关注,因为它更接近实际,而且比模拟情感的识别要困难得多.
语音情感特征提取,是语音情感识别中的一个关键步骤,其目的是从情感语音信号中提取能够反映说话人情感表达信息的特征参数.目前,大量语音情感识别文献[5-10]采用手工设计的特征用于情感识别,如韵律特征(基频、振幅、发音持续时间)、音质特征(共振峰、频谱能量分布、谐波噪声比),谱特征(梅尔频率倒谱系数(Mel Frequency Cepstrum Coefficient,MFCC))等.近年来,也出现了一些……
登录APP查看全文
