视频帧中改进的字幕检测定位方法
2011-04-13唐思源王晓琴
科技传播 2011年5期
唐思源, 苗 玥,王晓琴
包头医学院计算机科学与技术系,内蒙古 包头 014060
0 引言
图像中的文本包含丰富﹑明确的信息。如果这些文本能被自动地提取出来,则对图像高层语义的自动理解﹑索引和检索是非常有价值的。图像中的文本提取可概括为两个步骤:1)文本定位[1]。即找出图像中文本所在的位置或刚好包围文本的矩形区域;2)文本识别[2]。对定位出的文本区域进行二值化﹑增强处理,再送入光学字符识别系统(OCR)中进行字符识别。文本定位是文本识别的前提,是文本提取的关键,本文主要提出了一种文本定位技术的改进方法。
1 视频字幕的特点
图像中文字可以分为人工文本和场景文本[1]。人工文本是指通过图像处理工具对图像进行编辑,人工加在图像上的文本。场景文本是指拍摄场景中所包含的文字。它是场景的一部分,随场景一同被拍摄到图像中,如广告牌﹑车牌等。场景文字的方向﹑大小没有限制,颜色千变万化,图像的光照情况与场景所在的环境有很大关系;而且由于摄影机的投影变换关系,图像中的文字有可能会发生移动﹑旋转﹑缩放等变形,定位难度较大,所以本文主要是针对人工文本进行定位。
2 文本区域的检测
字幕要被正确识别就必须和背景有区分,也就是需要呈现一定的边缘特征和强度带,所以通过对视频帧边缘强度进行分析来检测字幕是一个有效的办法。本文的方法如下:我们处理的都是灰度图像,如果是彩色图像,先转换成灰度图像。……
登录APP查看全文
