基于Web挖掘的化学物质信息提取应用研究
2012-05-04李书琴杨会君
计算机工程与设计 2012年8期
冯 硕,李书琴,杨会君
(西北农林科技大学 信息工程学院,陕西 杨凌712100)
0 引 言
Internet作为世界上最大的信息资料库,已经成为化学工作者快速获取信息的主要途径。然而Web信息的急速膨胀,对化学工作者如何大规模的获取和有效利用分布在Internet上的化学资源方面提出了一个巨大的挑战[1]。解决这一问题的基本思路是建立网络资源与其网址的索引[2]。目前在化学领域已经建立起了几个比较有代表性的化学资源导航系统[3-4],虽然已有了以上诸多的的Internet化学导航系统,但其目前主要靠人工来搜集资源[1]。如果单纯地采用人工方式去查找和处理信息,会对人力资源大大浪费。而且当信息源站点数据更新后,靠人工发现非常困难,而且更容易出错。为此,希望能有一套计算机软件系统自动地持续地获取国内外一些权威的网站中化学物质的相关数据,从而提高信息获取的效率和数据的准确性。在计算机领域,基于Web信息挖掘技术日益成为人们研究的热点问题[5]。现有的Web信息提取方法包括基于自然语言方式、基于包装器、基于Ontology方式、基于HTML(hypertext markup language,HTML)结构、基于Web查询等信息抽取方法,但无论是自然语言处理还是包装器技术,只是针对一个特定的信息源,一个特定主题和领域[6],目前在很多行业和领域都可以看到垂直搜索引擎的应用研究,然而在化学领域应用较少。
本文在研究现有抽取程序的基础上,实现自动抽取指定网站中化学信息并集成到数据库,以解决人工手动获取信息效率低下和准确率低等问题。……
登录APP查看全文
