档案管理中文本数据的增量多模态聚类方法
2022-06-21刘丽华
重庆大学学报 2022年5期
刘丽华
(内蒙古财经大学 档案馆,呼和浩特 010010)
海量档案文本数据急剧增长,也伴随着文本数据描述的多样化[1]。例如,一则新闻消息可以通过不同的语言进行表达和传播;一个文本可以利用不同的特征描述(Word2Vec、TF-IDF等)进行分析。这样的数据称为多模态数据,不同领域或不同描述形式可以代表一种模态。通常,不同模态之间可以为语义相同的数据对象相互补充信息,结合多个模态的数据信息对一个物体进行描述相比于单模态可以更加全面地了解该物体的特征并且精准对该物体进行辨别。另外,随着档案文本不断增长,给档案管理带来了一定困难,有效对档案数据进行聚类、划分,能够按主题对档案文本进行分类管理,便于后期查阅、处理。
近年来多模态文本数据聚类或分类算法的研究备受关注[2]。例如,Amini等[3]将不同语言的文档看作是原始文档的不同模态,成功设计了多视图多数投票和多视图共分类[4]等方法对文档进行学习;Bickel等[5]研究了众多多模态数据形式下的聚类方法,例如k-means、k-medoids和EM(expectation-maximization)等。挖掘不同模态结合过程中潜在的数据信息是研究者们共同的目标,由此可见,研究多模态数据融合的有效方法已成为文本大数据分析中的重要方向。文中针对海量档案文本数据的多模态特点,研究有效的增量多模态文本聚类方法。
非负矩阵分解[6](NMF, nonnegative matrix factorization)是一种经典的矩阵分解技术,它可以将每个观测对象解释为非负基向量的线性组合相加后得到的结果[7],这恰好符合了人们在大脑和心理上所习惯的“局部构成整体”的思想[8-9]。……
登录APP查看全文
