基于计算听觉场分析的单声道的双人语音浊音分离*
2021-10-09张二华张丽娜
计算机与数字工程 2021年4期
关键词:方法
唐 伟 张二华 张丽娜
(南京理工大学计算机科学与工程学院 南京 210094)
1 引言
在某些多于一人说话的单声道混合语音分离场景,仅依靠将单人的语音信号从背景噪声中分离出来的技术是不能满足现实需求的,还需要研究准确将单人语音从多人说话的混合语音中提取出来的方法,本文尝试利用单人纯净语音各次谐波的频率采样点位置从双人语音的频谱中分离单人语音,为之后研究从单声道双人语音中分离清晰单人语音的方式提供分离效果对比的标准。
将单人语音从单声道的含噪语音中分离出来,主要依靠语音信号的特征是随时间变化的,但在一段较短的时间间隔内,语音信号保持平稳:在浊音段表现出周期信号的特征,在清音段表现出随机噪声的特征。由于浊音具有显著的谐波结构,同时在汉语中,仅依靠浊音就能辨别大多数汉语语音的语义,故本文只研究浊音的分离。
如何进行准确的单声道语音分离[1]是一个相当复杂的问题,在嘈杂的环境中,人能够有效地倾听感兴趣的声音,甚至只用一只耳朵也能很好地辨别并专注于某个人的声音,排除噪声的干扰[2]。1953年,英国科学家E.Cherry将该现象称为“鸡尾酒会”问题[3]。尽管目前人们对鸡尾酒会问题的机理还没有完全了解清楚,但通过一些听觉实验[4],揭示了听觉感知的一些线索。1990年,加拿大麦吉尔大学的Bregman提出了听觉场景分析(auditory scene analysis,ASA)理论[5],ASA理论将听觉感知声音的过程分为两个阶段,第一阶段是分段,将混合语音分解为一系列的听觉片段,每个听觉片段来自于同一个声源,每一个听觉片段都代表了一个重要的听觉事件。……
登录APP查看全文
