一种基于卷积神经网络的环境声音分类方法*
2021-05-21敏邓伟赵
电子器件 2021年2期
关键词:分类
朱 敏邓 伟赵 力
(1.常州信息职业技术学院电子工程学院,江苏常州 213164;2.东南大学网络空间安全学院,江苏南京 210096)
近年来,自动环境声音分类问题越来越受到科研人员的广泛关注。目前其应用范围包括情境感知计算[1]和监控[2]、智能声学传感器网络实现的噪声缓解[3]。
目前已经有多种方法应用于环境声音分类的问题,包括矩阵分解[4-6],字典学习[7-8],小波滤波器组[8-9]以及深度神经网络[10-11],还有很多与环境声音分类类似的研究[12-14]。根据许多研究结果,深度卷积神经网络原则上非常适合环境声音分类的问题[15]:首先,其能够捕获跨时间和频率的能量信息;其次,通过使用具有小的感受野的卷积核,神经网络能够学习识别代表不同声音类的时域-频域模式[16]。然而,卷积神经网络在环境声音分类中的应用还受到很大的限制。例如,Piczak K J[11]提出CNN 结构获得的结果没有明显的提升。
具有较好分类效果的深度神经网络尤其依赖于训练集的数据量。CNN 模型应用于环境声音分类效果有限的一方面原因可能是具有标记的环境声音数据集较小。虽然近年来不同的研究机构已经发布了几个新的数据集[17-18],但它们仍然比其他领域(比如图像分类[19])可用于研究的数据集小得多。
数据增强是上述问题的一个可行方案,即将一个或多个数据转换应用于具有标记的训练数据集合,用以产生额外的训练数据[19-21]。数据增强的关键点在于标记数据的变形不改变其语义含义,使其仍属于已有的标签。……
登录APP查看全文
