结合多尺度时频调制与多线性主成分分析的乐器识别
2018-05-21于凤芹
王 飞,于凤芹
(江南大学 物联网工程学院,江苏 无锡 214100)
0 引言
乐器识别作为音乐信息检索(Music Information Retrieval, MIR)的一部分,可用于对音乐的自动标注、音乐分类、音乐情感识别[1]。
已有乐器识别模型基于四大特征:倒谱特征、时域频域特征、稀疏特征、概率特征。文献[2]使用改进的梅尔倒谱系数(Mel-Frequency Cepstral Coefficient, MFCC)特征结合主成分分析(Principle Component Analysis, PCA)降维进一步提高乐器识别准确率,但MFCC对乐音谐波特征描述不足且对无明显共振峰的打击乐器识别较差。文献[3]从时域、频域对乐器提取特征从而获得稳定的识别,但乐器音色并非只是时域或频域的[4]。此外,特征的组合依赖训练集,不同的训练集拥有不同的最佳特征。文献[5]利用稀疏倒谱编码对单、多声部乐器识别比现有方法更精确;文献[6]首次使用稀疏过滤进行单声部乐器识别,但稀疏特征忽略了时域信息。概率特征是乐器识别的另一研究方向:文献[7]提出一种可在单声道多声部音乐中同时识别乐器类型和估计音阶的概率混合模型;文献[8]对多声部音乐的频谱结构提出不变最大高斯包络(Uniform MAx Gaussian Envelope, UMAGE);文献[9]针对乐器二分类问题利用概率潜在模型(Probabilistic Latent Component Analysis, PLCA)对乐器的声谱进行建模,但它们需先验启奏时间与乐器数量的前提假设。
从听觉角度看,人耳处理声音信号的本质是耳蜗将声信号频率分解转换成听觉表示,随后传入初级听觉系统进行多尺度时频调制[10]。耳蜗输出的听觉表示称为听觉谱图(Auditory Spectrum, AS)[11],听觉谱图包含乐器时频信息。利用多尺度时频调制对听觉谱图进行时间与频率维度的多分辨率滤波分解以获取乐音时频变化信息,这些时频变化信息是乐器音色的表示,利用这些表示可进行乐器识别。……
