基于Tesseract 的会计票据图像识别系统设计研究
2021-09-18李沛霖尚丹梅
李沛霖,吕 巍,姚 琳,尚丹梅
(锦州医科大学,辽宁 锦州 121001)
0 引言
随着会计管理信息化的不断发展,会计票据的信息化需求也越来越迫切。会计管理工作每天都要面对大量的纸质票据,各种纸质票据按照传统的工作流程,需要人工手动录入信息,按流程逐级人工审核,并管理大量的纸质票据档案,这使得整体录入和审核工作量繁重,效率较低。在目前的会计信息化中可以将会计票据以图像的形式存档,但其本身是一种非结构化的数据格式,不利于信息的进一步利用。
光学字符识别(Optical Character Recognition,OCR)是一种通过光学技术扫描文本和字符以获得图像信息的方法,通过形态特征的分析确定标准文本和字符编码,转化为计算机内码,并存储在文本文件中,是快速文本输入的一种方式。如果将OCR 技术应用于会计票据识别,对于数字化的票据图像,OCR技术能将其内容逐项识别出来,方便进一步转化为会计文档。
目前,市场上已有很多成熟的OCR 产品,如汉王、文通、ABBYY FineReader OCR、Tesseract OCR、IRIS ReadIRIS、百度OCR 等。在众多OCR 识别产品中,Tesseract 作为谷歌的免费开源OCR 软件,使用集束搜索算法和K-近邻算法(KNN)进行预识别,并支持样本训练,可以形成特定的语言库。相对于其他价格昂贵的商业化识别软件,Tesseract 可以用较低成本针对会计场景建立专用字库,从而提高识别准确度。
1 会计票据图像识别系统构成
基于Tesseract 的会计票据图像识别平台系统构成如图1所示,主要包括图像预处理模块、OCR 字符识别模块及识别文本处理模块。图像预处理接收用户导入的票据图像,进行图像去噪声、图像二值化、图像倾斜矫正等操作,为图像后续的检测和识别做好准备。……
