综合词位置和语义信息的专利文本相似度计算
2018-10-24李宝安吕学强
计算机工程与设计 2018年10期
夏 冰,李宝安,吕学强
(北京信息科技大学 网络文化与数字传播北京市重点实验室,北京 100101)
0 引 言
专利文献具有相对固定的组织结构,其组织结构主要包括IPC分类号、标题、摘要、说明书、权利要求书等。其中IPC分类号是国际通用分类号,根据IPC分类号可以判定专利类别,权利要求书是发明或者实用新型专利要求保护的内容,是申请专利的核心。专利文献为保持其新颖性以及避开专利雷区,在用词方面一般使用独特或不常用的词或短语来表达一些常见性的语义,例如用“一种盛水的容器”来表达“水杯”的含义,再例如用“没有固定停放地点的单车”替代“共享单车”的概念在专利文献中使用。因此专利文献相似度计算的准确与否很大程度上取决于词语间语义相似度的计算。
根据研究方法的不同,词语间的语义相似度的研究大体上可以分为两大类:基于知识的词语语义分析和基于统计的词语语义分析。基于知识的词语语义分析需要一个庞大而丰富的知识库[1,2],库中包含了词语概念、上下位等逻辑关系,通过计算不同词语在知识库中的语义距离来表示词语间的相似程度。基于统计[3,4]的词语语义分析主要是在概率论,统计论等数学理论的基础上,对大规模语料进行统计,通过判断词语的上下文语境是否相似来判断词语之间的相似程度。
文本相似度的计算方法主要包括基于统计、基于语义信息、基于句法结构、基于编辑距离的方法。……
登录APP查看全文
