APP下载

融合图像显著性的声波动方程情感识别模型

2021-10-27郑纯军

数据采集与处理 2021年5期
关键词:信号情感模型

贾 宁,郑纯军

(大连东软信息学院软件学院,大连116023)

引 言

随着语音学领域及相关技术的日趋成熟,人们逐渐意识到语音中传达的信息远超出了文本中拟表达的内容[1]。作为区分智慧和智能的基本特征,情感是语音交互不可或缺的一部分,正确的检测语音中的情感表达具有深远的应用价值和实际意义。作为语音学的新兴研究方向之一,语音情感识别(Speech emotion recognition,SER)旨在实现语音信号至说话者情感表达的映射关系,帮助机器模拟情感理解、情感监测和反馈等过程,从而带来人机交互方式的变革。

现有的情感识别研究可分为单模态和多模态[2]等方向。前者专注于原始音频信号,后者需融合音频信号、词汇信息和视觉信息。由此可见,上述两种研究方法均涉及了原始音频信号的研究,它是情感识别方向的关键所在,也是大量研究人员的工作重心。

在SER的研究中,许多成熟的语音分析和分类技术用于提取有效的情感信息。随着深度学习技术的发展,利用神经网络模型解决SER问题已成为流行的情感识别解决方案。常见的深度学习模型[3]有卷积神经网络(Convolutional neural network,CNN)[4-5]、循环神经网络(Recurrent neural network,RNN)[6]等,此外,多通道技术和注意力机制也常用来实现SER。Yao等[7]对比3种不同的深度学习模型的性能,指出深度融合显著性区域的重要性,但仅针对于传统的空气介质环境下的语料库。

RNN作为常见的深层神经网络之一,被广泛应用于自然语言处理和时间序列有关的任务中[8-9]。例如,Tzinis和Potamianos[10]利用RNN研究局部特征和全局特征,并对比在不同音素级别下的SER性能。……

登录APP查看全文

猜你喜欢

信号情感模型
一半模型
信号
如何在情感中自我成长,保持独立
完形填空二则
重尾非线性自回归模型自加权M-估计的渐近分布
失落的情感
情感
如何在情感中自我成长,保持独立
基于FPGA的多功能信号发生器的设计
3D打印中的模型分割与打包