基于语义的档案数据智能分类方法研究
2021-03-23霍光煜孙艳丰尹宝才
计算机工程与应用 2021年6期
霍光煜,张 勇 ,2,孙艳丰,尹宝才
1.北京工业大学 信息学部 多媒体与智能软件技术北京市重点实验室,北京 100124
2.北京市交通信息中心,北京 100055
随着我国数字化档案建设的发展,面对海量的数字化档案数据,简单的统计方法或者传统的数据分析并不能发现档案数据之间的关联关系。对档案进行手工分类、编研等工作也需要投入大量的人力物力,耗时过长。因此,如何发掘和利用档案数据中的隐含价值,从而对海量数字化档案进行快速、准确的分类,是目前档案管理领域所面临的一项重大挑战。
现有的档案数据管理方法多是依赖于传统的数据库技术,其目标是档案信息的罗列整理与基础的统计分析,数据库管理的局限是需要人为设计分析内容,要求制定分析内容的人有丰富的经验支撑。随着知识的快速更新,通过传统统计分析方法不能满足发掘档案数据内容方面的关联,无法满足档案更高层次智能管理要求。目前,自然语言处理已经成为人工智能的一个重要分支。自然语言处理可以针对数字档案的内容对数字档案进行分类、聚类的操作,可以很好地展现出数字档案内容关联的变化。在众多关联分析方法中,基于语义特征的方式为档案管理提供宝贵的参考。因此,对于数字档案内容的挖掘是档案智能管理的基础。对现有数字档案数据进行深入分析,可以更加了解不同类型档案的内在关联规律,对其可能存在的关联关系进行预测,从而为档案管理者的档案关联分析、自动分类工作等方面提供帮助。……
登录APP查看全文
