一种融合视觉和听觉信息的双模态情感识别算法
2021-03-25范习健杨绪兵业巧林
南京大学学报(自然科学版) 2021年2期
范习健,杨绪兵,张 礼,业巧林,业 宁
(南京林业大学信息科学技术学院,南京,210037)
情感在日常生活中扮演重要角色,不同的情感状态影响人们的学习、记忆和决策等,对不同情感的识别在远程教育、医疗、辅助驾驶以及人机交互领域均有广阔的应用前景,因此近年来受到研究者的高度关注,成为研究的热点[1-2].然而,情感识别依然是一项挑战性的任务,因为情感的持续时间长短不一且不同个人表达和感知情绪的方式各异,有效地提升情感识别的鲁棒性和准确性是研究者追求的目标[3].
语音信号和面部表情是人们表达情感的主要途径,也被认为是情感表达的两个主要模态,即听觉模态和视觉模态.大部分情感识别的研究都集中于单独利用两个模态中的一个,即单模态,但是单模态情感识别存在信息不全面、容易受噪声干扰等缺点[4].近年来,越来越多的研究者尝试综合运用两个模态的信息进行情感分析和判断,语音模态信息和视觉模态信息既能互相关联又能互相补充,可以为情感判断提供更加准确可靠的信息,提高情感识别性能.大多主流的基于听觉和视觉双模态的方法分别提取手工的(hand⁃crafted)声学和面部表情特征来进行信息融合,获得语音表情联合特征再进行情感分类.听觉模态的声学特征有梅尔倒谱系数、对数频率能量系数、线性预测系数等[5],视觉模态的手工特征主要有Gabar[6],LBP[7],HOG[8]等.随着深度学习技术的出现[9],研究者也用先……
登录APP查看全文
