一种短正文网页的正文自动化抽取方法
2016-05-03郗家贞俞晓明程学旗
中文信息学报 2016年1期
郗家贞,郭 岩,黎 强,赵 岭,刘 悦,俞晓明,程学旗
(1. 中国科学院 计算技术研究所 中国科学院网络数据科学与技术重点实验室,北京 100190; 2. 中国科学院大学, 北京 100080)
一种短正文网页的正文自动化抽取方法
郗家贞1,2,郭 岩1,黎 强1,2,赵 岭1,刘 悦1,俞晓明1,程学旗1
(1. 中国科学院 计算技术研究所 中国科学院网络数据科学与技术重点实验室,北京 100190; 2. 中国科学院大学, 北京 100080)
随着互联网的发展,网页形式日趋多变。短正文网页日益增多,传统的网页正文自动化抽取方式对短正文网页抽取效果较差。针对以上问题,该文提出一种单记录(新闻、博客等)、短正文网页的正文自动化抽取方法,在该方法中,首先利用短正文网页分类算法对网页进行分类,然后针对短正文网页,使用基于页面深度以及文本密度的正文抽取算法抽取正文。
短正文;正文抽取
1 引言
1.1 自动化的短正文网页正文抽取
面对层出不穷的信息来源,数量呈指数级增长的网络页面,网页正文抽取技术越来越受到学术界和工业界的重视,Microsoft、Google 、百度、腾迅等公司均在相关方向进行了研究。网页内容抽取技术被广泛应用在互联网服务和应用中,例如,信息检索、文本自动分类、话题跟踪、机器翻译、自动摘要等。从网页中抽取出高质量的正文对于这些应用来说非常关键。例如,对于信息检索,正文抽取的质量会直接影响检索的准确率。在这些应用中,网页正文抽取作为必不可少的一个步骤,为后面的分析、挖掘提供了最基础的数据。……
登录APP查看全文
