APP下载

基于短文本分类的电子发票自动生成会计分录

2020-08-04李燕萍宋磊

青年生活 2020年23期
关键词:分类文本模型

李燕萍?宋磊

引言

电子发票中的信息抽取属于自然语言处理中信息抽取子领域。自然语言处理可以分成3个层级,分别是文本理解、信息抽取和信息检索。在以往的纸质发票报销中,通常要经过一系列流程,层层审批,然后财务部门根据报销的內容进行分类,做账。而线上报销流程与线下一致,软件自动识别发票,报销人虽无需填写发票,但财务依旧需要根据报销内容制作会计分录才能做账。将报销内容自动生成分录,可节约财会人员时间和精力[1]。

一、自动生成目录可行性

电子发票具有文字稀疏性、产品术语、名词术语较多等特点,将其内容分类自动生成会计分录,可减少企业资金投入,提高企业做账效率。在报销的项目内容中,大多数是一些属性相近的词,可以看作是单个词语到语义一般概念的映射。词聚类算法可以分为三种:第一,各种启发式量度表示聚类过程中的元素的距离;第二,以统计模型计算距离量度并给定聚类结果的类总数;第三,同样以统计模型计算距离量度,但增减例如困感度等量度的值[2]。

二、短文本分类存在问题

报销的内容较为简洁明了,属于短文本,但传统的向量空间模型(VSM, Vector Space Model)对长文本的分类有较高的敏感度,而用于短文本分类时却存在特征稀疏性等问题。1、传统的向量进行空间分析模型对关键字的文档数据处理方式方法是依据词频信息,难以分辨自然语言的语义模糊性。2、传统的向量空间模型的假设词与词之间是相互独立的,是一一对应的关系,但在实际情况中,文档存在着很多一词多义和同义词的现象,所以这种假设难以满足实际情况。……

登录APP查看全文

猜你喜欢

分类文本模型
一半模型
分类算一算
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本