一种基于双通道残差的场景文本检测方法∗
2021-06-28刘建云李海山
舰船电子工程 2021年6期
刘建云 李海山 李 恒
(武汉数字工程研究所 武汉 430000)
1 引言
场景文本检测在深度学习领域可被视为计算机视觉中物体检测任务的特定物体检测,也就是说将文本作为一种特定的物体来检测。基于深度学习的文本检测方法按照网络输出的数据分为基于边框回归的方法和基于语义分割的方法。基于边框回归的文本检测方法,如 CTPN[1]、SegLink[2]等,其检测效果严重依赖于锚框或者锚点的选择,导致模型中超参数的数量增加,降低了模型的泛化能力。而 PSENet[3]、DBNet[4]等网络采用语义分割的方法根据图片生成二值图,然后根据二值图生成文本框,因而检测结果更加鲁棒。为了提高检测算法对于自然场景图像中任意形状文本的鲁棒性和检测精度,本文提出了一个以ResNet[5]为基础网络,同时利用特征金字塔(Feature Pyramid Networks,FPN[6])进行特征融合,最后利用双通道残差网络进行语义分割的检测算法。该方法不仅保证了深度学习模型的精度和推理速度,同时通过语义分割网络提高网络模型的泛化能力。
2 本文方案
2.1 基于双通道残差的语义分割网络
本文提出的语义分割网络如图1所示,一共分为上下两个通道,通道中的网络进行残差连接,故而命名为双通道残差。网络的特征输入为经过特征融合网络得到的特征图,输出为通道数为1的概率图,其表示的是每个像素点处于文本区域的概率。由于通道2的网络层数小于通道1,因而通道2相当于是通道1残差连接,加上图1中的1、2、3这三个残差连接,整个语义分割网络中共有4个残差连接。……
登录APP查看全文
