APP下载

基于Tesseract_OCR文字识别的研究

2021-11-22马明栋

计算机技术与发展 2021年11期
关键词:区域信息

曾 悦,马明栋

(1.南京邮电大学 通信与信息工程学院,江苏 南京 210003;2.南京邮电大学 地理与生物信息学院,江苏 南京 210003)

0 引 言

在二十世纪三十年代末,德国科学家Tausheck提出了OCR的概念[1],并获得了OCR专利。之后美国科学家Handel也提出了利用技术进行文字识别[2]的想法。二十世纪六十年代,OCR技术首次被使用于生产实践中,至此第一批OCR系统诞生,其中Farrington3010最具有代表性[3],但是运行速度慢且只能识别简单的字符。1996年,IBM公司的Casey和Nagy完成了中文字符识别系统的研发,采用模板匹配法能识别1 000个印刷体汉字[4]。

中国在二十世纪七十年代才开始在字符识别方面的研究,主要是常见的字符,比如数字、英文和汉字。1986年进入到一个实质性的阶段,虽然很多研究单位推出了一些中文OCR的产品,但由于识别率低,硬件设备成本高,运行速度慢等,未能达到实际要求。只有信息部门、新闻出版社等个别单位使用汉字识别软件。

到二十世纪九十年代,随着平台式扫描仪的普及,以及信息科学技术的发展,大大推动了该技术的发展,使得识别的速度、效率大大满足了用户的使用要求,并在学校、医院、企业等地方得到了广泛的应用。

Tesseract是一个OCR库,目前由Google赞助[5]。Tesseract是目前公认最优秀、最精确的开源OCR系统。除了极高的精确度,Tesseract也具有很高的灵活性。它可以通过训练识别出任何字体,也可以识别出任何Unicode字符[6]。

文中在分析了文字识别系统的需求后,结合相关技术和方法设计了一个基于Tesseract文字识别框架的文字识别系统,主要工作如下:

登录APP查看全文

猜你喜欢

区域信息
永久基本农田集中区域“禁废”
分割区域
订阅信息
关于四色猜想
分区域
基于严重区域的多PCC点暂降频次估计
展会信息
区域
信息
健康信息