语音合成及伪造、鉴伪技术综述①
2022-08-04王林元
计算机系统应用 2022年7期
杨 帅,乔 凯,陈 健,王林元,闫 镔
(中国人民解放军战略支援部队信息工程大学,郑州 450001)
1 引言
语音作为人类接受外界信息的重要来源,在日常交流活动中扮演了不可替代的角色. 特别是近些年来随着电话、电脑、智能手机等信息设备的普及,人们对于丰富多彩的语音服务例如语音通话、语音助手、短视频配音等需求量越来越大. 随着网络语音资源的爆发式产出和算力水平的显著跃升,人工智能在语音处理技术方面大放异彩,有效地满足了社会需求; 但同时,一些不法分子利用现代语音技术进行电信诈骗或其他违法活动,引起了人们的担忧和广泛关注.
语音伪造技术一般包含文本到语音(text-to-speech,TTS)和语音转换(voice conversion,VC)两种形式. 文本到语音是指从文本中生成自然语音[1],通常不具有欺骗性,常被用于手机中的语音助理、导航语音以及智能音响等. 语音转换是指将源人物语音的特定信息转换为目标人物语音,同时保证其他属性不改变[2]. 语音转换常涉及频谱和韵律两个方面的转换,并且依赖大量的目标语音数据. 将TTS 和VC 结合,可以从文字中生成具有某人声音特点的语音,具有极强的欺骗性.
语音伪造技术的发展满足现实应用需求的同时,也带来很多潜在的威胁. 个性化语音生成增强了软件对用户的吸引力,如美团的提示音、高德地图的导航语音; 短视频平台的文字朗读功能方便了用户短视频的制作; 延续风格的影视配音作品可以带给观……
登录APP查看全文
