基于深度学习的场景文本检测与识别①
2021-09-10宫法明刘芳华李厥瑾宫文娟
计算机系统应用 2021年8期
宫法明,刘芳华,李厥瑾,宫文娟
1(中国石油大学(华东) 计算机科学与技术学院,青岛 266580)
2(山东电子职业技术学院 教务处,济南 250200)
近年来,在场景图像中浏览文本,因为其广泛的实际应用,如图像/视频理解、视觉搜索、自动驾驶、盲辅助等,成为一个活跃的研究领域.场景文本检测作为场景文本读取的关键组成部分,对每个文本实例的边界框或区域进行定位仍然是一项具有挑战性的任务,因为场景文本往往具有各种尺度和形状,包含水平文本、多取向文本和弯曲文本.基于分割的场景文本检测由于其在像素级上的预测结果,可以描述各种形状的文本,因此近年来受到了广泛的关注.然而,大多数基于分割的方法需要复杂的后处理,在推理过程中造成了相当大的时间开销.
针对文本识别问题,传统的文本识别方法[1-3]适应性差、需要分离训练目标,导致麻烦的预分割和后处理阶段.在计算机行业飞速发展的今天,自动处理算法逐渐成熟,文本检测和识别算法[4-7]的准确度都大大提升.近年来出现的CTC[8](Connectionist Temporal Classification)和注意力显著缓解了这种训练问题,但这两种识别模型算法实现很复杂,可能会导致训练成本增高并降低了识别准确率.
本文的贡献在于提出了一种复杂场景下文本检测和识别的新方法,记为TDRNet (Text Detection and Recognition Net).在原本检测和识别网络的基础上加以改进,采用更高效的特征提取网络,在文本区域检测网络中加入可微二值化进行优化,大大简化了后处理过……
登录APP查看全文
