浅谈OCR识别技术在科技档案管理中的运用
2021-08-06王瑜
卷宗 2021年21期
王 瑜
(中国电建集团北京勘测设计研究院有限公司,北京 100024)
OCR文字识别技术的英文全称是Optical Character Recognition,译为光学字符识别。OCR文字识别是视觉感知中一个重要的技术,目的是从图片中提取文字信息。它是利用光学技术和计算机技术把印在或写在纸上的文字读取出来,并转换成一种计算机能够接受、人也可以理解的格式。文字识别是计算机视觉研究领域的分支之一,这个课题已经在很多行业得到应用。OCR识别技术主要可应用的场景有:教育场景文字识别、卡证文字识别、财务票据文字识别、医疗票据文字识别和汽车场景文字识别。
1 OCR技术的流程
OCR文字识别从本质上可以归类为序列化标注问题,主要目标是寻找文本串图形到文本串内容的映射。在工作流程上,《DA/T77-2019纸质档案数字复制件光学字符识别(OCR)工作规范》已有所规定,主要流程是:
1.1 图像输入
首先对图像的分辨率、倾斜度、清晰度、失真度等方面进行评估,并进行适当的调整。然后把不同的格式和压缩方式的图像进行解码。
1.2 图像预处理
主要包括二值化、去噪、倾斜矫正等。
1)二值化:图像录入设备采集到图像,一般都是彩色图像。二值化就是将具有灰度级的彩色图像转换为黑白图像,设定任意的阈值,并与各像素值进行比较,当大于阈值时转换为黑,小于阈值转换为白。
2)去噪:主要方法是均值滤波器、自适应维纳滤波器、中值滤波器、形态学噪声滤除器、小波去噪。
3)倾斜矫正:对图像识别前先对相关的内容进行校正。……
登录APP查看全文
