文本线局部极值区域两阶段场景文本序列识别
2018-08-15董引娣赵晓祎
计算机与生活 2018年8期
董引娣,赵晓祎
1.重庆城市管理职业学院 信息工程学院,重庆 401331
2.中国人民解放军后勤工程学院 训练部,重庆 401331
1 引言
场景文字定位与识别是非常有价值的研究方向,可帮助视障人士进行语言翻译和写作,同时可用于大型图像和视频数据库文本内容自动索引(例如谷歌街景、Flickr等)。不同于传统印刷文档的OCR(optical character recognition),现有场景文本识别方法在识别精度上无法满足应用需要,最近的ICDAR 2015大赛获奖算法也只能达到70%的识别精度,并且要求场景文本不存在透视变形或明显噪声[1]。
文本定位过程在算法中占有非常大的计算复杂度,因为对应于大小为N像素的图像会产生2N个子集。现有算法一般采用两种处理方式:
(1)借鉴其他对象的检测问题,利用滑动窗口方法对个别字符或整个词进行定位。这种方法已得到成功应用,例如文献[2]提出基于树结构模型的端到端场景文本识别;文献[3]提出集成多个字符建议的鲁棒场景文本提取方法;文献[4]提出基于窗口特征识别的鲁棒的自然场景图像文本检测方法等。这类方法的优点是对噪声和模糊性具有很强的鲁棒性,因为对于窗口兴趣区域的特征进行了充分的开发利用[5]。主要缺点是需要评估的矩形数量迅速增长时,须找到具有不同规模、方向、旋转和扭曲的文本,导致定位精度降低。
(2)使用图像的局部属性(如颜色、强度或笔划宽度)将单个字符定位为连接组件的方法。这种方法逐渐得到流行,例如文献[6]提出基于强度跟踪的多方位场景文本检测,设计了动态规划检测方法的统一框架;……
登录APP查看全文