APP下载

一种基于倒排索引的音频检索方法

2012-07-25张雪源贺前华李艳雄叶婉玲

电子与信息学报 2012年11期
关键词:特征方法

张雪源 贺前华 李艳雄 叶婉玲

(华南理工大学电子与信息学院 广州 510640)

1 引言

随着多媒体信息爆炸式的增长,如何从海量的、未经手工标注的多媒体数据库中快速、准确地搜索到最理想的内容逐渐成为当前学术研究的热点。音频信息作为多媒体数据的重要组成部分,有时甚至是唯一的形式(如广播、音乐和电话录音等),其索引和检索算法受到了越来越多的关注[1]。

音频的检索方法可分为两种:一种基于语义,另一种基于相似度。基于语义的检索方法利用先验模型对音频数据进行语义索引,其索引内容多为音效类型、音频场景类型[2,3]。检索时依据用户提交的音效语义描述、场景语义描述进行基于文本的检索。这种方法实现了多媒体内容的自动标注和检索,并且依靠语音识别系统实现了语音文档检索。但由于音频内容十分复杂、多变,文字在描述音频内容上不够精细,如“枪声”这一音效类型忽略了枪声的强弱、密集程度以及枪的类型等重要信息,因此难以跨越的“语义鸿沟”严重影响了这种方法的效果。此外,这一类方法需要预先定义音效、场景类型,检索时只能从事先定义好的类型中选择检索条目。近年来越来越多的研究开始关注基于相似度的检索算法[4,5]。该方法直接利用音频检索音频,不需要进行音效、场景识别,也不需要提前定义和训练模型。用户提交一段现有的或者自己制作的音频作为查询,检索系统从数据库中寻找与之最为相似的片段。……

登录APP查看全文

猜你喜欢

特征方法
如何表达“特征”
不忠诚的四个特征
学习方法
用对方法才能瘦
四大方法 教你不再“坐以待病”!
赚钱方法
捕鱼
线性代数的应用特征