APP下载

语音合成及伪造、鉴伪技术综述①

2022-08-04王林元

计算机系统应用 2022年7期
关键词:特征文本方法

杨 帅,乔 凯,陈 健,王林元,闫 镔

(中国人民解放军战略支援部队信息工程大学,郑州 450001)

1 引言

语音作为人类接受外界信息的重要来源,在日常交流活动中扮演了不可替代的角色. 特别是近些年来随着电话、电脑、智能手机等信息设备的普及,人们对于丰富多彩的语音服务例如语音通话、语音助手、短视频配音等需求量越来越大. 随着网络语音资源的爆发式产出和算力水平的显著跃升,人工智能在语音处理技术方面大放异彩,有效地满足了社会需求; 但同时,一些不法分子利用现代语音技术进行电信诈骗或其他违法活动,引起了人们的担忧和广泛关注.

语音伪造技术一般包含文本到语音(text-to-speech,TTS)和语音转换(voice conversion,VC)两种形式. 文本到语音是指从文本中生成自然语音[1],通常不具有欺骗性,常被用于手机中的语音助理、导航语音以及智能音响等. 语音转换是指将源人物语音的特定信息转换为目标人物语音,同时保证其他属性不改变[2]. 语音转换常涉及频谱和韵律两个方面的转换,并且依赖大量的目标语音数据. 将TTS 和VC 结合,可以从文字中生成具有某人声音特点的语音,具有极强的欺骗性.

语音伪造技术的发展满足现实应用需求的同时,也带来很多潜在的威胁. 个性化语音生成增强了软件对用户的吸引力,如美团的提示音、高德地图的导航语音; 短视频平台的文字朗读功能方便了用户短视频的制作; 延续风格的影视配音作品可以带给观……

登录APP查看全文

猜你喜欢

特征文本方法
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
用对方法才能瘦
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
四大方法 教你不再“坐以待病”!
捕鱼
如何快速走进文本
线性代数的应用特征