APP下载

基于孪生BERT网络的科技文献类目映射

2021-08-17何贤敏李茂西何彦青

计算机研究与发展 2021年8期
关键词:语义文本模型

何贤敏 李茂西 何彦青

1(江西师范大学计算机信息工程学院 南昌 330022) 2(中国科学技术信息研究所 北京 100038)

分类法是一种具有层级结构的分类体系,根据内容和属性不同进行组织.虽然不同分类法的层级结构和编制原则差异很大,但其编制的基本原理和目的是相同的,都是为了提高检索效率而编制的一系列表达概念及概念关系的标识.因此,不同分类法在概念表达上存在一定的相似性,所以可以建立它们之间的映射关系[1].

专利信息作为一种特殊的科技文献,通常使用国际专利分类法(international patent classification, IPC)来对其进行组织和管理,为了标识专利所属的领域和范畴,每份专利文件会标明适当的IPC分类号.如表1第1行给出了IPC中“输入机构”有关的专利信息分类号及其类目文字描述,其中,符号“|”的个数表示分类法的类目层级数.而在中文学术期刊中,普遍使用中国图书馆分类法(Chinese library classification, CLC)来标识文献,如表1第2行给出了CLC中“输入设备”有关的期刊分类号及其类目文字描述.

Table 1 Examples of Identification of Patent and Journal Related to “Input Mechanisms (Devices)”

建立IPC与CLC之间的类目映射对实现专利信息与期刊文献相互关联以及它们组织体系间交叉浏览和检索有着重要的意义,因此,许多学者对此展开了研究.基于规则的方法[2-6]大都是对IPC和CLC类目描述文本分别提取关键词集或特征词集,用于替代原始类目的含义,通过计算词集之间的相似性间接得出类目之间的相似度,从而建立映射关系.基于传统机器学习的方法[7]将类目映射转化为分类问题,利用分……

登录APP查看全文

猜你喜欢

语义文本模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
语言与语义
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
3D打印中的模型分割与打包
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本