文档识别及其在藏文古籍识别中的应用探讨
2017-02-24李振江
李振江
摘 要:文档识别技术能自动识别文档中的文本、图片、表框等信息,为纸质文档的全文数字化提供了便利。文章分析了文档识别过程中预处理、版面分析、行字切分、特征提取以及分类的流程,对文档识别技术的发展做了一个简单的综述,并结合藏文古籍识别的具体应用,对该技术在藏文古籍识别方面的应用难点进行了探讨。
关键词:文档识别;版面分析;藏文古籍
中图分类号:G273.3
文献标识码:A
一、引言
从20世纪90年代开始,文档分析与识别吸引了越来越多的研究者,目前有多个专门的国际会议对该项工作进行研究。
例如,ICDAR(International Conference on Document Analysis and Recognition),ICFHR(International Conference on Frontiers in Handwriting Recognition),DAS(IAPR International Workshop on Document Analysis Systems)等,在相关领域的期刊(IEEE Transaction on Pattern Analysis and Machine Intelligence、Pattern Analysis and Applications、International Journal of Computer Vision、International Journal on Document Analysis and Recognition等)上也有大量文档分析识别相关的论文出现,整个领域的研究工作处在一个快速发展的阶段。
二、文档识别流程
从文档识别工作的流程步骤上来说,可以分为图像预处理与版面分析、行字切分、特征提取与分类等模块[1]。
1. 预处理与版面分析
预处理阶段主要工作是去噪以及图像的增强和修复,之后进行版面分析,将图像分为文字区域以及非文字区域,获取结构以便于重编和出版。文字区域需要进一步确定该区域的文字是属于题目、正文、标注或者其他信息等;对于非文字区域,则要判别其是插图、背景或者是噪音,并按照判别结果分别加以处理。在版面分析过程中,需要考虑的是不同类型区域特征选择的问题和不同的分析方法及其效果评价。
2. 文本行字切分
对于完成了预处理以及版面分析后抽取的文字区域,需要进一步的检测,将文本行以及单字进行分割。……
