基于数据增广的声学场景分类
2021-03-05马成男李关防张文武
李 源,马成男,李关防,王 强,张文武
(1. 海装重大专项装备项目管理中心,北京 100071;2. 江苏自动化研究所,江苏 连云港 222061)
声音中携带了大量与人类日常生活息息相关的环境信息,通过这些信息人们可以准确感知自己所处的声音场景。声学场景分类(Acoustic Scene Classification,ASC)[1]是利用机器模型对声音信号自动进行分析并识别所处的环境内容。声学场景分类的应用广泛,如安全监控、助听器设备、智能家居以及智能控制设备等。由于音频数据中往往存在复杂的噪声,早期传统的分类器,使用K近邻模型以及隐马尔可夫模型等进行建模分类,效果并不理想,随着神经网络的发展,以及声学场景和事件检测及分类竞赛(Detection and Classification of Acoustic Scenes and Events,DCASE)[2]的提出,极大地促进了该领域的发展。
相比于计算机视觉领域,声音信号的采集和标注相对困难,面对神经网络对大规模标注数据的需求,多种数据增广技术源源不断地提出,在一定程度缓解了这一问题。声学领域的数据增广大多是基于声谱图进行的,例如:Time stretch[3]、Pitch shift[3]、SpecAugment[4]、Mixup[5]等,但不同数据增广技术对声学场景的分类结果影响研究相对较少。笔者统计了近两年DCASE大赛上各种数据增广技术出现的比例发现,Mixup增广出现在半数以上方案中,SpecAugment增广出现比例紧随其后,此外,在计算机视觉领域,Cutmix[6]增广成为近年应用比例较高的技术之一。
1 音频特征及降维分布
在音频分类任务中,通常需要对目标音频信号进行有效特征提取,以便模型进行高效分类,音频信号特征提取的一般流……
