基于CNN的时频域语音情感识别的分析与对比
2021-11-16段俊毅赵建峰
内蒙古师范大学学报(自然科学汉文版) 2021年6期
段俊毅, 赵建峰
(1.中国铁塔内蒙古分公司,内蒙古 呼和浩特 010021; 2.北京航空航天大学 杭州创新研究院,浙江 杭州 310000)
情感是一种特殊、强烈的心理活动,可通过多种行为、动作向外表现,如面部表情、语言、肢体动作等[1]。语音情感识别是情感识别研究的一个基本问题。语音信号包含的信息主要有语言信息和副语言信息,语言信息指话语的语境或意义,副语言信息指语音中的情感等隐含信息[2]。为了辨析个体的真实情感状态,可从语音信号中提取合适的副语言特征,进行语音情感识别。
利用深度网络,从语音信号中提取深度情感特征,可形成语音情感特征的层次化表征。通过深度网络,对信号进行特征学习及抽象建模,极大变革了语音信号处理领域,从而提升中国铁塔10096客户服务质量。这些学习到的深度特征一般由多种线性和非线性变换组成,形成原始数据的层次化抽象,在实验中的表现明显优于手工特征。
传统语音情感特征是典型的低级特征,将其输入到深度网络提取高级情感特征,不仅可识别语音情感,也可简化深度网络的设计和训练。本文提出利用卷积神经网络(CNN)从MFCCs和LFCCs中提取情感特征,实现对情感信息的高级抽象建模。同时设计了一维CNN从语音片段中提取特征,并进行语音情感识别。实验表明,从手工特征中学习深度特征的方法不仅可以获得更高的识别精度,还可通过简化网络构建而减少网络参数。
1 相关研究
在传统语音情感识别领域,Milton等[3]在提取MFCCs特征后,使用三阶段支持向量机分类器实现了情感分类。……
登录APP查看全文
