一种新型的特征平滑处理的民乐音符起始点检测算法
2021-09-23马连航阮林萍汪万涛
马连航,王 军,阮林萍,汪万涛,文 亮,杨 帆,赵 罡
(1.中电海康集团有限公司,浙江 杭州 311100;2.北京调皮猴科技有限公司,北京 101102)
1 研究背景
音符起始点是音乐特征信息中最基础的特征,其检测任务是基于内容的音乐信息检索(Music Information Retrieval,MIR)领域的关键环节和基础性课题,也是高级音乐分析任务(如基频估计、节奏分析、节拍跟踪等)的前提[1-2].换言之,音符起始点检测的准确度和精度极大程度地决定了后续高级特征检测和处理的准确度上限.目前较为成熟的音符起始点检测算法大多借鉴了语音端点检测方法[3],并在此基础上加以改进,得到适用于音乐信号的检测方法.

图1 一个音符的时域信息描述:起始点、上升、过渡和衰减[2]Fig.1 Temporal description of a note:onset,attack,transient and decay
从信号处理的角度来看,音符起始点(Onset)是指音乐中某一音符开始的时间,其起始阶段能量突然上升(Attack),经过一段过渡期(Transient)后能量逐渐衰减(Decay),如图1所示[2].传统的音符起始点检测算法直接或间接地以信号谱分析为基础进行设计,需要通过如短时傅里叶变换(Short-Time Fourier Transform,STFT)、常数Q变换(Constant Q Transform,CQT)[4]和小波变换(Wavelet Transform,WT)[5]等信号变换方法实现音频信号从时域到频域的转变;Bello等[6]利用信号变换输出的时谱图,提取幅度谱和相位谱作为声学特征;Böck等[7-8]为了得到更符合人耳听觉特性的声学特征,使用Mel变换及滤波后的能量谱作为声学特征,并有效地提高了检测精度.为了加强算法对音乐信号非平稳部分的自适应能力,Shao等[9]提出了基于匹配追踪的稀疏分解算法,该算法在MIREX 2013数据集上表现效果……
