乐器识别中频谱特征与聚合策略性能评估
2021-09-10赵庆磊邵峰晶孙仁诚隋毅
赵庆磊 邵峰晶 孙仁诚 隋毅










摘要:乐器识别领域中,传统降采样或全局映射方法得到的特征对输入表达不够准确且判别能力不足。为此借鉴图像领域聚合局部特征的思想,提出一种结合频谱特征和图像领域特征聚合策略的方法。考虑涉及中国传统乐器的研究较少,建立了包含12种中国传统乐器的独奏音乐数据集。为适应频谱图输入,对ResNet34的变体网络模型进行了修改,在建立的数据集上分别针对乐器识别和验证任务对不同特征和聚合策略的9种组合模型进行了性能对比。实验结果表明,基于短时幅度谱和GhostVLAD的组合模型,在乐器识别任务中达到93.3%的准确率,优于其他模型,且收敛速度最快。
关键词:中国传统乐器;乐器识别;卷积神经网络;特征聚合策略;性能评估
中图分类号:J62;TP183
文献标志码:A
收稿日期:2020-12-04
基金项目:
国家自然科学基金青年基金(批准号:41706198)资助。
通信作者:
孙仁诚,男,博士,教授,主要研究方向为大数据分析。E-mail: qdsunstar@163.com
随着深度学习理论的发展,深度学习方法在图像、音频、视频等处理和分析中得到广泛应用。乐器识别(musical instrument recognition,MIR)作为音乐信息检索和音乐数据分析的一部分,是获得音乐信号高级信息的关键任务[1]。准确的乐器识别可以使许多相关任务受益。例如,获得乐器类型可以辅助生成音乐播放列表,声音场景分类,体育音频分类等[2-4]。在过去的几十年里,乐器识别任务的问题之一就是为给定的识别任务选择最佳的特征。何蓉等[5-6]通过对音乐文件使用短时傅里叶转换和梅尔变换生成对应频谱图,对音乐中的乐器等信息进行识别,分别搭建出了符合用户偏好的音乐推荐系统和基于频谱图的音乐流派分类模型。……