APP下载

一种短正文网页的正文自动化抽取方法

2016-05-03郗家贞俞晓明程学旗

中文信息学报 2016年1期
关键词:页面分类文本

郗家贞,郭 岩,黎 强,赵 岭,刘 悦,俞晓明,程学旗

(1. 中国科学院 计算技术研究所 中国科学院网络数据科学与技术重点实验室,北京 100190; 2. 中国科学院大学, 北京 100080)

一种短正文网页的正文自动化抽取方法

郗家贞1,2,郭 岩1,黎 强1,2,赵 岭1,刘 悦1,俞晓明1,程学旗1

(1. 中国科学院 计算技术研究所 中国科学院网络数据科学与技术重点实验室,北京 100190; 2. 中国科学院大学, 北京 100080)

随着互联网的发展,网页形式日趋多变。短正文网页日益增多,传统的网页正文自动化抽取方式对短正文网页抽取效果较差。针对以上问题,该文提出一种单记录(新闻、博客等)、短正文网页的正文自动化抽取方法,在该方法中,首先利用短正文网页分类算法对网页进行分类,然后针对短正文网页,使用基于页面深度以及文本密度的正文抽取算法抽取正文。

短正文;正文抽取

1 引言

1.1 自动化的短正文网页正文抽取

面对层出不穷的信息来源,数量呈指数级增长的网络页面,网页正文抽取技术越来越受到学术界和工业界的重视,Microsoft、Google 、百度、腾迅等公司均在相关方向进行了研究。网页内容抽取技术被广泛应用在互联网服务和应用中,例如,信息检索、文本自动分类、话题跟踪、机器翻译、自动摘要等。从网页中抽取出高质量的正文对于这些应用来说非常关键。例如,对于信息检索,正文抽取的质量会直接影响检索的准确率。在这些应用中,网页正文抽取作为必不可少的一个步骤,为后面的分析、挖掘提供了最基础的数据。……

登录APP查看全文

猜你喜欢

页面分类文本
大狗熊在睡觉
刷新生活的页面
分类算一算
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
教你一招:数的分类
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
同一Word文档 纵横页面并存
浅析ASP.NET页面导航技术