基于并行胶囊网络的声学场景分类*
2023-12-13杨立东赵飞焱
杨立东,赵飞焱
(内蒙古科技大学信息工程学院,内蒙古 包头 014010)
0 引 言
在拥有海量大数据和广泛应用云计算的人工智能(artificial intelligence,AI)时代[1],各个行业朝着网络化、智能化的方向发展,其中,计算机每天需要处理数以万计的音频数据,对所获音频数据分析和处理所涉及到的声学场景分类(acoustic scene classification,ASC)是其中不可或缺的任务[2],同时也是极具挑战性的难题。声学场景分类作为场景理解(scene understanding)的重要环节,主要任务是通过识别音频特征并将其归类到特定的环境类型[3],因为各类环境存在噪声干扰,所以声学场景分类任务很难研究出具有高精度且泛化能力强的分类器。
随着神经网络的兴起,在图像识别[4]、目标检测[5]、音视频识别[6]以及声学场景分类[2]等方向广泛应用并取得了一定的效果。其中卷积神经网络(convolutional neural network,CNN)[7]和循环神经网络(recurrent neural network,RNN)[8]是其中最具代表性的网络,CNN 可以通过卷积强化图像中的关键信息,进行特征提取,但是在提取特征时忽略了特征间的空间关系(spatial relationship)以及姿态信息(pose information);RNN是一种擅长处理和预测序列数据的网络模型,尤其是数据对时序有一定依赖性的时候,常被用于语音识别、文本分类、机器翻译、信息检索、声学场景分类等依赖时序的任务中。但是RNN却常难以训练[9],训练次数过多后,多数情况下梯度会趋向于消失,也有较少情况存在梯度爆炸的问题。
本文提出了并行胶囊网络(paralleling neural network with capsule,Caps-PNN)的声学场景分类模型,该模型由胶囊网络(capsuleNet)与双向门控循环单元(bidirectional gated recurrent unit,Bi-GRU)[10]并行组成,既可以利用CapsuleNet提取音频中CNN不能提取的姿态信息和特征间的空间信息,同时也可以利用Bi-GRU 解决传统RNN 长期依赖问题,更好地提取音频的时序性特征。……
