APP下载

利用密集卷积神经网络的语音变换欺骗检测

2021-09-02苏卓艺朱铮宇

西安电子科技大学学报 2021年4期
关键词:特征检测方法

王 泳,苏卓艺,朱铮宇,2

(1.广东技术师范大学 网络空间安全学院,广东 广州 510665;2.华南理工大学 音频、语音与视觉处理实验室,广东 广州 510641)

语音欺骗可以分为两类[1]:① 假冒欺骗,即利用某种手段产生或获得被假冒的目标人物的语音,从而令识别系统误判该语音为被假冒人所说,主要包括语音转换(Voice Conversion,VC)、语音合成(Speech Synthesis,SS)和语音重播等操作;② 隐藏欺骗,即通过变换说话人的声音(没有模仿任何目标人物)令识别系统无法判断该说话人的身份,此类操作一般也统称为语音变换(Voice Transformation,VT)欺骗。已有研究[2-3]表明,两类欺骗均可轻易骗过目前的说话人识别(Automatic Speaker Recognition,ASR)系统,对社会安全构成威胁。

目前相关的安全研究主要集中在假冒欺骗的检测上[4-21],而对VT欺骗的检测研究则相对非常不足。文献[22-24]提出利用梅尔频率倒谱系数特征和支持向量机分类器的VT检测算法,跨数据库的识别率低于90%,且该方法计算量非常大。LIANG等人提出一种基于卷积神经网络(Convolutional Neural Network,CNN)[25]的VT检测方法,但准确率小于95%,表明实际应用中仍需要改进。

事实上,假冒欺骗通常需要大量的目标说话人的语音信息,实现成本相对较高;而隐藏欺骗不需要任何额外的信息,且已有成熟的算法产生自然度极高的欺骗语音,已集成在众多的音频、语音处理工具中,相较假冒欺骗更多地运用在各种欺诈案件之中。因此,研究VT隐藏欺骗的检测具有重要的理论和实用价值。另一方面,目前已有的检测方法一般采用人工设计特征和分类识别结合的传统机器学习方法,特征设计比较困难且不稳定,影响检测效果。……

登录APP查看全文

猜你喜欢

特征检测方法
如何表达“特征”
不忠诚的四个特征
小波变换在PCB缺陷检测中的应用
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼
线性代数的应用特征