基于网络爬虫和文本挖掘的实体关系研究与实现
2016-06-08谢文彬
现代计算机 2016年13期
谢文彬
(同济大学电子与信息工程学院,上海 201804)
基于网络爬虫和文本挖掘的实体关系研究与实现
谢文彬
(同济大学电子与信息工程学院,上海201804)
摘要:
关键词:
0 引言
随着科技不断进步,越来越多的生物资源在网上发布,PubMed Central(PMC)[1]是一个免费的生物和生命科学文本全文数据库。但是作为国外数据,数据下载速度慢,能够下载的资料并不是完整的PMC数据,而且,仅仅只是下载原文,并不能给许多生物学者提供很多有价值的信息。现在PMC数据库中总计大约拥有380万篇全文数据,但是能够通过FTP下载的文章只占到一半不到。其次,PMC自带的搜索引擎并不能提供很好的实体关系搜索,例如要研究疾病和基因之间的关系。所以我们急需一种快捷有效的方法把生物学者所需的研究数据从网页上下载下来,经过预处理,成为本地可以批量处理的数据,再通过本地的服务器对数据进行快速的搜索抽取工作。
1 系统体系结构
文本挖掘的主要用途是从原本未经处理的文本中提取出未知的知识,但是文本挖掘也是一项非常困难的工作,因为它必须处理那些本来就模糊而且非结构化的文本数据,所以它是一个多学科混杂的领域,涵盖了信息技术、文本分析等技术,而且在网络时代,原始数据的获取主要通过网络途径,所以在实际挖掘过程中,系统分为4个大模块:
1.1收集与实体相关的论文
在PMC中,有官方网页提供的搜索引擎(http:// www.ncbi.nlm.nih.gov/pmc/),通过该搜索引擎,可以先做粗筛选。例……
登录APP查看全文
