APP下载

基于网络爬虫和文本挖掘的实体关系研究与实现

2016-06-08谢文彬

现代计算机 2016年13期
关键词:文本信息

谢文彬

(同济大学电子与信息工程学院,上海 201804)



基于网络爬虫和文本挖掘的实体关系研究与实现

谢文彬

(同济大学电子与信息工程学院,上海201804)

摘要:

关键词:

0 引言

随着科技不断进步,越来越多的生物资源在网上发布,PubMed Central(PMC)[1]是一个免费的生物和生命科学文本全文数据库。但是作为国外数据,数据下载速度慢,能够下载的资料并不是完整的PMC数据,而且,仅仅只是下载原文,并不能给许多生物学者提供很多有价值的信息。现在PMC数据库中总计大约拥有380万篇全文数据,但是能够通过FTP下载的文章只占到一半不到。其次,PMC自带的搜索引擎并不能提供很好的实体关系搜索,例如要研究疾病和基因之间的关系。所以我们急需一种快捷有效的方法把生物学者所需的研究数据从网页上下载下来,经过预处理,成为本地可以批量处理的数据,再通过本地的服务器对数据进行快速的搜索抽取工作。

1 系统体系结构

文本挖掘的主要用途是从原本未经处理的文本中提取出未知的知识,但是文本挖掘也是一项非常困难的工作,因为它必须处理那些本来就模糊而且非结构化的文本数据,所以它是一个多学科混杂的领域,涵盖了信息技术、文本分析等技术,而且在网络时代,原始数据的获取主要通过网络途径,所以在实际挖掘过程中,系统分为4个大模块:

1.1收集与实体相关的论文

在PMC中,有官方网页提供的搜索引擎(http:// www.ncbi.nlm.nih.gov/pmc/),通过该搜索引擎,可以先做粗筛选。例……

登录APP查看全文

猜你喜欢

文本信息
初中群文阅读的文本选择及组织
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
订阅信息
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
論《柳毅傳》對前代文本的繼承與轉化
展会信息
如何快速走进文本
信息
健康信息