基于AA-LSTM网络的语音情感识别研究
2021-11-17张会云黄鹤鸣黄志东
计算机仿真 2021年3期
张会云,黄鹤鸣*,李 伟,黄志东
(1.青海师范大学计算机学院,青海 西宁 810008;2.藏文信息处理教育部重点实验室,青海 西宁 810008;3.青海省藏文信息处理与机器翻译重点实验室,青海 西宁 810008)
1 引言
语音包含丰富的语言、副语言和非语言信息[1],这些信息对人机交互具有非常重要的意义。仅理解语言信息并不足以使计算机能够完全理解说话者的意图。为了使计算机类同人类,语音识别系统需要能够处理非语言信息,尤其是说话者的情感状态[2]。因此,语音情感识别(Speech Emotion Recognition,SER)受到越来越多研究者的广泛关注[3-4]。
情感语音包括语义内容和情感特征,大量SER研究主要集中于寻找最能表示情感的不同语音特征[1]。文献[5-6]提出了关于情感的各种短期特征和长期特征,但仍不清楚哪些特征更能提供情感方面的信息。传统方法是提取大量统计特征,并使用机器学习算法分类。很明显,特征提取包括两个阶段。首先,从短帧中提取情感声学特征,即低级描述符;其次,每个低级描述符用不同统计聚合函数表示成特征向量,表达了句子级不同低级描述符的时间变化和轮廓[5]。常用的低级描述符和高级统计函数如表1所示[6]。

表1 常用的低级描述符与高级统计函数
2 相关工作
人类通过潜意识识别情感,为了实现更好的人机交互,需要考虑语音中的情感。由于人类情感界限模糊,因此,识别情感具有很大的挑战性。首先,很难确定语音片段的开始和结束;其次,每个语音片段通常表示不同情感[5-7]。……
登录APP查看全文
