面向标注数据稀缺专利文献的科技实体抽取
2021-10-27原之安彭甫镕钱宇华
郑州大学学报(理学版) 2021年4期
原之安,彭甫镕,谷 波,钱宇华
(1.山西大学 大数据科学与产业研究院 山西 太原 030006;2.山西大学 计算智能与中文信息处理教育部重点实验室 山西 太原 030006;3.山西大学 计算机与信息技术学院 山西 太原 030006)
0 引言
专利是指专有的权利和利益,囊括了全球95%以上的最新技术情报[1]。通常科技类文献可以通过关键字快速掌握文献信息。但在专利文献中,没有关键词这一重要属性,读者想要快速获取专利的科技信息,需要了解专利分类号的含义。我国采用国际专利分类号对专利进行标注,即便是专利工作者,也很难了解每一条分类号的分类信息,导致不能像读论文一样快速了解文献中的信息。针对这一问题,本文将抽取专利文献中富含科技信息的词,即科技实体,这将有利于读者通过科技实体快速了解专利文献中蕴含的科技信息、提高专利检索的精度、构建专利知识图谱、提升专利自动分类的效果、梳理专利发展趋势等。
科技实体具体指在专利文献中能够反映某种科技成就、经验与方法、科学理论等的实体。反映科技成就的实体有物联网、存储器等;反映经验与方法的实体有人工智能、汉字识别等;反映科学理论的实体有微分方程、波函数等。科技实体的定义包括但不限于以上描述。
在类似的科技实体抽取研究中,Jang等[2]通过句法分析处理专利数据,对描述一项技术的单词TechWord进行依赖关系分析并识别其词性,从名词短语和SAO(subject-action-object)结构中提取TechWord候选词,通过中心性指标将每个词之间的关系解释为一个网络,评估TechWord候选词的重要性,进而抽取出专利中的TechWord。……
登录APP查看全文