融合图像显著性的声波动方程情感识别模型
2021-10-27郑纯军
数据采集与处理 2021年5期
贾 宁,郑纯军
(大连东软信息学院软件学院,大连116023)
引 言
随着语音学领域及相关技术的日趋成熟,人们逐渐意识到语音中传达的信息远超出了文本中拟表达的内容[1]。作为区分智慧和智能的基本特征,情感是语音交互不可或缺的一部分,正确的检测语音中的情感表达具有深远的应用价值和实际意义。作为语音学的新兴研究方向之一,语音情感识别(Speech emotion recognition,SER)旨在实现语音信号至说话者情感表达的映射关系,帮助机器模拟情感理解、情感监测和反馈等过程,从而带来人机交互方式的变革。
现有的情感识别研究可分为单模态和多模态[2]等方向。前者专注于原始音频信号,后者需融合音频信号、词汇信息和视觉信息。由此可见,上述两种研究方法均涉及了原始音频信号的研究,它是情感识别方向的关键所在,也是大量研究人员的工作重心。
在SER的研究中,许多成熟的语音分析和分类技术用于提取有效的情感信息。随着深度学习技术的发展,利用神经网络模型解决SER问题已成为流行的情感识别解决方案。常见的深度学习模型[3]有卷积神经网络(Convolutional neural network,CNN)[4-5]、循环神经网络(Recurrent neural network,RNN)[6]等,此外,多通道技术和注意力机制也常用来实现SER。Yao等[7]对比3种不同的深度学习模型的性能,指出深度融合显著性区域的重要性,但仅针对于传统的空气介质环境下的语料库。
RNN作为常见的深层神经网络之一,被广泛应用于自然语言处理和时间序列有关的任务中[8-9]。例如,Tzinis和Potamianos[10]利用RNN研究局部特征和全局特征,并对比在不同音素级别下的SER性能。……
登录APP查看全文
