密度峰值算法在中文自动文摘中的应用研究
2016-07-21李明丽孙连英石晓达
北京联合大学学报 2016年2期
李明丽,孙连英,邢 邗,石晓达
(北京联合大学信息学院,北京 100101)
密度峰值算法在中文自动文摘中的应用研究
李明丽,孙连英,邢 邗,石晓达
(北京联合大学信息学院,北京 100101)
[摘 要]随着自然语言处理技术的不断创新,自动文摘的质量得到显著提高。面向科技成果文档的中文自动文摘成为研究热点,具有一定的应用价值。把聚类算法应用到自动文摘中,选取聚类中心的思想对文摘去冗余具有一定意义。结合密度峰值算法,设计实现了面向科技成果文档的中文自动文摘系统。实验结果表明:应用密度峰值算法有利于文摘的冗余处理,具有借鉴意义。
[关键词]自动文摘;密度峰值;冗余处理
互联网信息的指数级增长,使得自动文摘的实用价值不断提高。随着文本处理算法的创新,自动文摘的质量不断提高,自动提取文摘有利于科技成果的转化推广。自动文摘从文摘产生的形式上看,可分为抽取式文摘和生成式文摘。抽取式文摘通过对文档原句打分,抽取文档原句组成文摘。生成式文摘通过重组句子或填充文摘模板来生成文摘[1]。生成式文摘的相关技术仍不够成熟,较难应用。从文本数量上看,可分为单文本文摘和多文本文摘。抽取式文摘从句子的权值计算方法上来看,可分为句子独立打分式和通过句子之间关系打分式两种方法。应用于自动文摘的方法有图模型、语义分析、机器学习和聚类等。本文主要研究的是聚类算法在自动文摘系统中的应用。……
登录APP查看全文
