基于Tesseract_OCR文字识别的研究
2021-11-22马明栋
计算机技术与发展 2021年11期
曾 悦,马明栋
(1.南京邮电大学 通信与信息工程学院,江苏 南京 210003;2.南京邮电大学 地理与生物信息学院,江苏 南京 210003)
0 引 言
在二十世纪三十年代末,德国科学家Tausheck提出了OCR的概念[1],并获得了OCR专利。之后美国科学家Handel也提出了利用技术进行文字识别[2]的想法。二十世纪六十年代,OCR技术首次被使用于生产实践中,至此第一批OCR系统诞生,其中Farrington3010最具有代表性[3],但是运行速度慢且只能识别简单的字符。1996年,IBM公司的Casey和Nagy完成了中文字符识别系统的研发,采用模板匹配法能识别1 000个印刷体汉字[4]。
中国在二十世纪七十年代才开始在字符识别方面的研究,主要是常见的字符,比如数字、英文和汉字。1986年进入到一个实质性的阶段,虽然很多研究单位推出了一些中文OCR的产品,但由于识别率低,硬件设备成本高,运行速度慢等,未能达到实际要求。只有信息部门、新闻出版社等个别单位使用汉字识别软件。
到二十世纪九十年代,随着平台式扫描仪的普及,以及信息科学技术的发展,大大推动了该技术的发展,使得识别的速度、效率大大满足了用户的使用要求,并在学校、医院、企业等地方得到了广泛的应用。
Tesseract是一个OCR库,目前由Google赞助[5]。Tesseract是目前公认最优秀、最精确的开源OCR系统。除了极高的精确度,Tesseract也具有很高的灵活性。它可以通过训练识别出任何字体,也可以识别出任何Unicode字符[6]。
文中在分析了文字识别系统的需求后,结合相关技术和方法设计了一个基于Tesseract文字识别框架的文字识别系统,主要工作如下:……p>
登录APP查看全文
