APP下载

嵌入注意力机制的自然场景文本检测方法

2021-12-21杨锶齐易尧华汤梓伟王新宇

计算机工程与应用 2021年24期
关键词:特征文本区域

杨锶齐,易尧华,汤梓伟,王新宇

武汉大学 印刷与包装系,武汉430079

自然场景图像含有丰富的文本信息,准确检测到图像中的文本信息有助于正确理解图像内容。传统文本检测方法主要基于连通域分析[1]和纹理特征分析[2],人工痕迹较重、适用范围较窄。近年来,基于深度学习的自然场景文本检测[3-4]方法发展迅速,广泛应用于图像/视频检索[5]、智能导航无人驾驶[6]等领域,并成为当下研究热点之一。自然场景文本检测方法主要存在以下三方面挑战:(1)图像文本形式多样,具有不同颜色、字体、大小、形状;(2)自然场景图像背景复杂,存在类文本目标如栅栏或窗户等;(3)自然场景图像中文本上存在光照不均匀、噪声等干扰因素。

为了应对上述挑战,大量基于深度学习的自然场景文本检测方法被提出。其中,基于Faster R-CNN[7]的自然场景文本检测方法检测速度快、精度高、具有较好的稳定性。此类方法利用CNN网络进行特征提取,通过预设数量固定、尺度不同、长宽比不同的anchor,生成包含文本的感兴趣区域(ROIs),最后进行回归和分类计算,得到文本检测结果。在此基础上,Tian等[8]提出CTPN自然场景文本检测方法。首先,由RPN提取固定宽度为16像素的子文本区域,再将子文本区域的特征送入循环神经网络得到一系列子文本信息,最后合并得到最终文本检测结果。Prasad等[9]以Faster R-CNN为基础,串联文字载体目标检测网络与文本检测网络,利用文字载体信息辅助定位文字,文本检测效果达到先进水平。此外,在anchor的研究中,Liao等[10]提出的自然场景文本检测方法TextBoxes,为适合文本检测,重新设计anchor的长宽比为1、2、3、5、7、10提高了文本检测的召回率。……

登录APP查看全文

猜你喜欢

特征文本区域
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
关于四色猜想
分区域
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
基于严重区域的多PCC点暂降频次估计
如何快速走进文本
线性代数的应用特征