APP下载

基于特征融合和改进卷积神经网络的环境音识别

2021-02-27李志华韩灿灿

计算机与现代化 2021年2期
关键词:特征融合模型

徐 睿,李志华,韩灿灿

(河海大学能源与电气学院,江苏 南京 211100)

0 引 言

听觉是人类感知周边环境的主要手段之一,因此,想要达成使计算机有类人的感知能力这个目标,准确地通过声音来判别周围情况是一项极其关键的任务。根据声源的不同属性,音频可分为语音、音乐和环境音[1]。与另外2种声音不同的是,环境音的结构更加复杂;同时,语音和音乐都有特定的含义,如语音是由音素组成,而环境声音并不具有类似的特定含义。近年来,环境音的识别(ESC)得到了越来越多的关注,它已被成功应用在音频监控系统[2]、城市声音的降噪[3]等方面。环境音识别被重视不仅因为其广泛的应用,更是因为其复杂的结构。将针对语音或音乐开发的系统应用在ESC上,会由于无法提取足够具有代表性的特征,导致效率低下,因此,研究适用于环境音分类的高效识别模型是必然趋势。

环境声音识别的2个关键部分是音频特征的提取和分类算法的选择。一些研究人员将人工设计的音频特征(如MFCC特征,过零率等)与传统机器学习算法相结合,并在特定场景下取得一定的成果。Yu等人[4]提取MFCC作为特征,结合随机森林算法,完成了声音事件检测任务。随着深度学习技术的发展,神经网络已被证明比传统的分类器在解决复杂分类问题上更有效。其中,卷积神经网络(CNN)被广泛应用在音频领域中,如语音识别[5-6]、音乐分类[7-8]、环境声音分类[9-10]。它能捕获时域和频域特征,解决传统机器学习算法的不足,因此被认为是音频识别中最合适的模型。……

登录APP查看全文

猜你喜欢

特征融合模型
一半模型
村企党建联建融合共赢
融合菜
从创新出发,与高考数列相遇、融合
《融合》
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
不忠诚的四个特征
3D打印中的模型分割与打包
线性代数的应用特征