句子比较相似度的算法实现?
2016-05-19吴宏洲
吴宏洲



摘要:一种文本句子比较相似度算法,以连续文字串为单元块,相同单元块越大越多越相似,相异部分的单元块越小越少越相似,依此计算相似度值。可用来消除传统相似度取值置信区间中模糊区,精确到一个非此即彼的二元逻辑值。
关键词:文本句子比较;连续文字串;单元块;相似度
中图分类号:TP301 文献标识码:A 文章编号:1009-3044(2016)07-0183-07
The Realization of the Sentences to Compare Similarity Algorithm
WU Hong-zhou
(The China Patent Information Center, Beijing 100088, China)
Abstract: A comparison a text sentence similarity algorithm, order to a continuous text string as a unit, the same parts of unit block , the more and bigger the more similar, the different parts of unit block,the less and more small the more similar, according to it to calculate the similarity values.It can be used to eliminate the traditional similarity confidence interval of fuzzy area, accurate to a “yes or no” binary logic values.
Key words: the comparison of the text sentence;Continuous text string;Unit block;Similarity
在专利文献自动摘要的技术研究与应用中,需要了解专利说明书中最具代表性的发明内容部分、权利要求书中最具代表性的独立权利要求部分,还包括发明的有益效果。这些部分摘选组合搭配是重构专利摘要的重要依据。从文献中抽取所需的最能代表发明专利中其技术方法的最重要的句子成分,作为文摘参考备选,这一过程是自动摘要的一个重要技术环节。然而在抽取技术特征最为集中的句子时,如果单单以句子本身的权重为依据来抽取句子的话,那么很有可能将某些句子权重高、相似度也高的句子同时都抽取出来。从而忽略了其他次重要的句子,从而导致算法偏好失衡。这时就需要用到一个句子比较相似度的方法,将相似内容的句子依据权重以及位置作取舍,对舍去的句子作参考值权重的衰减,从而达到消除相似或重复的内容的目的,使算法趋于偏好均衡。目前句子比较相似度算法大家公认的算法多采用cosine相似度算法,该算法取值通常会在[下限值,上限值] 置信区间的广阔中间区域出现判断上的不确定性,使得相似度算法的能力受到质疑。……
