基于深度学习的对话重叠语音片段检测
2021-02-25魏金太
中北大学学报(自然科学版) 2021年1期
魏金太,高 穹
(1.河南林业职业学院 信息与艺术设计系,河南 洛阳 471002;2.中国洛阳电子装备试验中心,河南 洛阳 471003)
0 引 言
重叠语音是指在给定时刻同时说话的情况,即双重对话的讲话者多于一个.讲话者说出某些事情时,其他参与者可能表现出非竞争性承认(例如“嗯”)或反应(例如“笑”),也可能竞争性地打断他们的错误判断等[1],这在自发对话中是非常常见的.虽然重叠的频率和持续时间可能因情况而异,但在正常的自发对话期间,重叠是频繁且简短的(大多小于1 s,如图1所示),因此提高了语音的手动注释成本,对语音的自动检测提出了挑战.
在自发对话的场景中,双重对话的存在对大多数自动语音技术是不利的[2].说话人聚类系统的目标是在谈话中确定谁在说话,如果在重叠期间错过了其他发言人,则会受到惩罚,这种惩罚已成为这类系统中存在的主要错误,使得重叠言语情况成为说话人聚类识别系统的致命弱点[3].许多语音技术(如自动语音识别)依赖于由聚类识别系统产生的说话者语音分段类别[4-6].因此,以往大多数对真实语音中说话人分割聚类的尝试都是在说话人聚类识别中进行的,最常见的是针对零(即静音)、一个或多于一个同时活动的讲话者进行逐帧分类,并且已经在GMM-HMM框架[7]中得到解决,同时设计不同组合的声学特征.在早期的深度学习中,采用DNN降低其交叉相关特征进行降维[8],或者使用基于LSTM的回归器[9],该回归器在串联设置……
登录APP查看全文
