APP下载

辽代历史文化资源知识图谱构建研究

2021-04-01谭楠楠

大连民族大学学报 2021年1期
关键词:文本历史模型

刘 爽,谭楠楠,杨 辉

(大连民族大学 计算机科学与工程学院,辽宁 大连116650)

随着语义网的发展,目前互联网上发布越来越多的结构化数据、半结构化数据、非结构化数据,并将其作为链接数据发布。在此背景下,Google在2012年提出知识图谱(Knowledge Graph)这一概念,旨在改善搜索引擎效果[1]。知识图谱以结构化三元组的形式来进行存储,基本组成单位由头实体、尾实体以及描述这两实体之间的关系组成。通用表示方式为G=(E,R,S),其中E={e1,e2,e3…,e|E|}表示实体集合,R={r1,r2,r3…,r|R|}表示关系集合,S⊆E×R×E表示知识图谱中的三元组集合。目前对知识图谱的研究应用主要分为通用领域知识图谱和垂直领域知识图谱。典型的中文通用领域知识图谱有CN-DBpedia[2]、zhishi.me[3]、Ownthink[4]、XLore[5]等。上述通用领域知识图谱虽收集了大量的领域知识,但无法深入对某一领域内的知识进行详细描述。垂直领域知识图谱在这方面的优势大于通用领域知识图谱,但是该领域知识图谱构建通常采用手工构建,需要消耗大量的人力财力。

经过调查发现,现有通用领域知识图谱中含有部分关于辽代历史文化资源相关的内容,但是现有知识图谱从规模化、规范化、形式化等方面任有很大的提升空间[6]。目前垂直领域中关于辽代历史文化资源的知识图谱还没有,如何基于高效的知识工程方法以及先进的文本数据挖掘技术,构建大规模、高质量的辽代历史知识图谱,仍是极具挑战性的课题。

本文初步探讨了辽代历史领域知识图谱当前面临的机遇和挑战,从新的领域知识图谱角度提出了辽代历史领域知识图谱构建技术。……

登录APP查看全文

猜你喜欢

文本历史模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
3D打印中的模型分割与打包
新历史
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本