一种多模态融合的网络视频相关性度量方法
2016-06-02温有福贾彩燕陈智能
智能系统学报 2016年3期
温有福,贾彩燕,陈智能
(1.北京交通大学 交通数据分析与数据挖掘北京市重点实验室,北京 100044; 2. 中国科学院自动化研究所 数字内容技术与服务研究中心,北京 100190)
一种多模态融合的网络视频相关性度量方法
温有福1,2,贾彩燕1,陈智能2
(1.北京交通大学 交通数据分析与数据挖掘北京市重点实验室,北京 100044; 2. 中国科学院自动化研究所 数字内容技术与服务研究中心,北京 100190)
摘要:随着网络和多媒体技术的发展,视频分享网站中的网络视频数量呈爆炸式增长。海量视频库中的高精度视频检索、分类、标注等任务成为亟待解决的研究问题。视频间的相关性度量是这些问题所面临的一个共性基础技术。本文从视频视觉内容,视频标题和标签文本,以及视频上传时间、类别、作者3种人与视频交互产生的社会特征等多源异构信息出发,提出一种新颖的多模态融合的网络视频相关性度量方法,并将所获相关性应用到大规模视频检索任务中。YouTube数据上的实验结果显示:相对于传统单一文本特征、单一视觉特征的检索方案,以及文本和视觉特征相融合的检索方案,文本视觉和用户社会特征多模态融合方法表现出更好的性能。
关键词:网络视频; 海量视频;社会特征; 交互;多源异构信息;多模态信息融合; 相关性度量; 视频检索
视频是集图像、声音和文字信息于一体的多源信息载体,其丰富直观的表达形式非常契合人类接受信息的方式。随着网络和多媒体技术的快速发展,在线视频服务正在以不可阻挡之势在互联网平台上蓬勃发展。……
登录APP查看全文
