基于侧重点聚类的数学表达式相似度计算方法
2021-03-23司建辉刘宏媛
计算机工程与应用 2021年6期
关键词:数学
杨 芳,尹 曦,司建辉,刘宏媛,汪 雪
河北大学 网络空间安全与计算机学院,河北 保定 071002
数学表达式是科技文档中不可缺少的表现形式,对科技文档的检索有着重要的参考价值。随着科技文档数量的指数级增长和对科技文档检索要求的提高,对数学表达式的相似度计算也提出了更高的要求[1-2]。数学表达式具有丰富的语义和复杂的结构,目前对数学表达式相似度计算的方法主要从表达式的内容和结构匹配两个方面展开。
基于内容的相似度计算是较早提出的方法,MathDex[3]、ZHANG 等[4]、XU 等[5]均是根据数学表达式的内容为表达式分配权重,计算相似度。同时表达式的结构相似度计算也受到了重视,树形结构是常用的结构表示方法。文献[6-8]在树形结构的基础上利用关键词、关键字数目比例、运算符等信息构建索引得到查询表达式的相似表达式集合。ZHONG等[9]使用倒排索引和秩的动态剪枝算法来提高表达式匹配效率,实现更快的表达式子结构匹配。
数学表达式的内容与结构相结合的相似度计算方法也受到了广泛关注[10-11]。SHUNSUKE 等人[12]提出了一种基于散列的近似计算算法,采用Subtree Hash、Modular Trick、SIGURE Hash 三种哈希算法分别对应表达式的变量名称、功能结构和α-等价三种测度来计算表达式的相似度,在考虑到表达式结构的同时可以捕捉到数学表达式不同特征的语义相似性,该方法所用的计算时间较短,且对表达式中各个元素考虑周全,得到的相似度计算结果准确度较高。
侧重点是一个较为主观的概念且数学表达式数目庞大,很难人为地对其进行归纳,本文使用K-means++算法[14]对表达式的侧重点进行聚类归纳。……
登录APP查看全文
