基于语音和视频图像的多模态情感识别研究
2021-12-12王传昱李为相陈震环
计算机工程与应用 2021年23期
王传昱,李为相,陈震环
南京工业大学 电气工程与控制科学学院,南京 211816
识别情感一般有两种方式,一是检测生理信号(如心率、脑电、体温等),另一种是检测情感行为(如面部特征、语言特征、姿态等)[1]。按照准确性排序,目前应用于情感检测的单模态主要有生理参数(脑电图)、脸部表情、语音、肢体动作;按照采集难度和实用性排序,则为语音、脸部表情、肢体动作、生理参数(脑电图)[2]。其中肢体动作因为其准确性较低、实用性一般,通常作为其他模态的辅助识别方式;而生理参数的识别准确率虽然很高,但是由于采集需要配备专业设备,采集难度高,实用性一般,在实际场景中很少使用。而语音和人脸表情的采集难度中等,识别准确率较高,是当前研究的热门。丁名都等[3]将卷积神经网络(CNN)和方向梯度直方图(HOG)方法结合研究,提取更多的表情特征,在高兴情感上取得了90%的识别准确率;兰凌强等[4]提出基于联合策略(FRN+BN)识别人脸表情,在CK+数据集上提升了5.6%的识别准确率;李田港等[5]将KNN、SVM、BPNN分类方法进行集成,提高了语音情感识别率。随着融合算法研究的深入,多模态情感识别取得了快速的发展[6]。多模态融合能够提升识别率,且具有更好的鲁棒性[7-8]。目前常见的多模态情感检测方法主要有生理信号+情感行为组合,不同情感行为之间的组合。人脸表情和语音这两个模态由于在视频中直接可提取,所以具有数据采集方便、特征明显、精度高等优点,是实际应用中最广泛的情绪识别方法。……
登录APP查看全文
