基于卷积神经网络的竖排版繁体中文图像文本化研究
2021-04-02魏志浩李万清张林达袁友伟
智能物联技术 2021年5期
李 华,魏志浩,刘 俊,李万清,张林达,袁友伟,何 宏
(杭州电子科技大学,浙江 杭州 310018)
0 引言
中文图像文本化是指,通过光学字符识别技术(OCR,Optical Character Recognition)[1]将光学文字图像识别转化为电子文本形式。 目前,古籍多以图像的形式储存, 且市面上对简体中文的OCR 非常普遍,但对于繁体中文的OCR 较为缺乏。繁体中文图像文本化由文字定位和文字识别两部分组成,其中文字识别算法有纹理特征法[2][3]、边缘检测法[4][5]、连通区域法[6][7]和深度学习法[8][9]。 其中,纹理特征法是一种描述图像全局特征的方法,同时也描述了图像或者图像区域的表面性质,如常见的基于统计和基于几何的描述方法;缺点是当图像分辨率变化的时候,计算出的纹理存在较大偏差。 而边缘检测法关注点在于轮廓,此方法的目的是基于图像像素特征找到图像中亮度变化剧烈的像素点构成的集合,如常见的Sobel 滤波器、Canny 检测器;缺点是在复杂特殊场景下,不具鲁棒性。 而连通区域法目的是将图像中各个连通区域标记出,其中连通区域指的是图像中具有相同像素值且位置相邻的前景像素点组成的图像区域,常见的有两遍扫描法和种子填充法。 以上3 种算法,在亮度变化剧烈,存在强光、反光、反射的情况下,不具备良好的表现。在获取到文字位置后, 对单个文字采用结构模式识别方法,利用统计模式识别算法[10]和深度学习识别算法[11][12]进行文字识别。
繁体中文文本化面临的主要问题有:第一,不同古籍文献书写字体和版式存在较大差异, 如古籍文献有雕版印刷、活字印刷、手工抄录等不同版式,字体也存在差异;……
登录APP查看全文
