APP下载

基于DS 证据理论多特征融合模型的说话人分割聚类研究

2023-08-21令晓明郭亚龙

科技创新与应用 2023年23期
关键词:特征融合信号

项 羽,令晓明,2,郭亚龙

( 1.兰州交通大学 光电技术与智能控制教育部重点实验室,兰州 730070;2.兰州交通大学 国家绿色镀膜技术与装备工程技术研究中心,兰州 730070)

说话人分割聚类( Speaker Diarization)是语音处理的一个研究方向, 主要是作为一种前端处理技术在语音处理领域使用。 是将一段连续的语音数据按不同说话人分割成片段, 并给每段语音片段标注上说话人的身份信息,以解决“ 谁在什么时候说”的问题[1]。 说话人分割聚类在众多领域都有着广泛的应用,如在录音软件中,可以通过说话人分割聚类技术将录音音频的说话人及其说话时长标注出来, 将其作为特征可以快速从众多音频中找到特定音频;在会议场景中,结合说话人分割聚类技术和语音识别技术可以生成一份包含发言人身份信息的会议记录,便于参会人员回顾会议内容;作为语音领域的前端处理技术,还可以提升后续语音处理系统的性能,如语音识别系统在说话人发生变化的时间点重置语音识别模型可以提高语音识别的准确率。

最初的说话人分割方法是基于能量的[2],这种方法是假设在两人对话话语之间存在一个静默区域, 通过设定能量阈值检测说话人转换点, 但是实际场景存在抢话现象导致分割结果并不理想。 目前比较主流的分割方法有2 种,分别是基于距离和基于模型的分割方法。 基于距离的分割方法不需要说话人的先验信息,但需划定门限,鲁棒性较差。 常……

登录APP查看全文

猜你喜欢

特征融合信号
村企党建联建融合共赢
融合菜
信号
从创新出发,与高考数列相遇、融合
完形填空二则
《融合》
如何表达“特征”
不忠诚的四个特征
基于FPGA的多功能信号发生器的设计
基于LabVIEW的力加载信号采集与PID控制