APP下载

OCR在文书档案数字化中的应用

2021-06-22曾利萍贾晓彤

卷宗 2021年15期

曾利萍 贾晓彤

(1.浙江省地震监测预报研究中心,浙江 杭州 330009;2.浙江省工程地震研究所,浙江 杭州 330009)

1 概述

光学字符识别(Optical Character Recognition,OCR)是指对文本资料的图像文件进行分析识别处理,获取文字及版面信息的过程。OCR识别属于计算机视觉研究领域的分支之一,属于模式识别和人工智能,是计算机科学的重要组成部分[4]。OCR技术同时也是实现文字高速录入的一项关键技术。最早早在1929年德国科学家Taushek就取得了一项光学字符识别的专利。OCR技术在我的发展起步较晚,约从20世纪70年代末开始,大致可分为三个发展阶段,第一阶段探索阶段(1979一1985),这一阶段时间长,主要研究对象为数字和英文字母。这一阶段收效甚微但为后面的发展打下了基础。第二阶段研发阶段(1986~1988)这三年是汉字识别技术研究的高潮期,也是印刷体汉字识别技术研究的丰收期。11家单位进行了14次印刷体识别成果鉴定,识别的字体多样,最多可以识别6763个字,正确率最高可达99.5%。但仍然存在文字模糊、笔划粘连、断笔、黑白不均、纸质质量差、油墨反透等等的抗干扰性差。从1989年至今为发展的第三个阶段应用阶段。这个阶段各种应用软件层出不穷,从清华大学电子工程系研制的清华TH一OCR产品和由汉王集团开发的尚书OCR产品,到百度OCR,腾讯OCR,OCR技术发展成熟并形成了服务型产业模式。目前,印刷体汉字识别技术的研究热点已经从单纯的文字识别转移到了表格的自动识别与录入,图文混排和多语种混排的版面分析、版面理解和版面恢复,名片识别,金融票据识别和古籍识别等内容上[5]。……

登录APP查看全文