基于梯度向量的复杂场景文本定位*
2012-07-13杨高波朱宁波
湖南大学学报(自然科学版) 2012年3期
杨高波,吴 潇,朱宁波
(湖南大学 信息科学与工程学院,湖南 长沙 410082)
视频包含的文本可提供重要的语义信息,视频文本的检测、定位和识别是实现基于内容的视频检索的基础.视频包含的文本可分为场景文本和人工文本2类[1].由于视频内容的复杂性和文本本身的不确定性,视频的字符文本检测和定位面临很多挑战[2].
现有的视频文本检测方法大致可分为3类:基于边缘和梯度的方法、基于连通域的方法和基于纹理的方法[1].第1类方法利用文本区域和背景之间的对比度,当背景比较复杂,例如包含树枝、栏杆等,存在较多的强边缘时,字符定位的效果不理想.第2类方法假定属于同一连通区域的文本像素具有相同的特征,检测算法相对简单,但是对于复杂背景或者同时包含人工文本与场景文本的视频,检测效果不够理想[3-4].第3类方法认为视频文本具有特殊的结构且表现出不同的纹理特性,利用Gabor滤波器、DCT纹理能量或者小波变换等计算图像纹理特征,再借助神经网络或者支持向量机进行文本区和非文本区的分类[5-7].该类方法对于文本像素和非文本像素之间的纹理差异有较高的要求,通用性不够强.
在基于梯度文本检测基础上,本文提出一种复杂场景下视频字符文本检测与定位方法.它综合运用运动矢量和字符的方向性特征,并利用视频文本的时间域特点进行文本区域的跟踪.
1 算法原理概述
字符笔画主要集中在0°和90°方向……
登录APP查看全文