APP下载

面向中文关系抽取的句子结构获取方法

2021-06-22杨卫哲秦永彬黄瑞章程华龄唐瑞雪程欣宇陈艳平

数据采集与处理 2021年3期
关键词:文本方法模型

杨卫哲,秦永彬,黄瑞章,王 凯,程华龄,唐瑞雪,程欣宇,陈艳平

(1.贵州大学省部共建公共大数据国家重点实验室,贵阳550025;2.贵州大学计算机科学与技术学院,贵阳550025;3.贵州省智能医学影像分析与精准诊断重点实验室,贵阳550025;4.贵州省智能人机交互工程技术研究中心,贵阳550025)

引 言

关系抽取(Relation extraction,RE)是自然语言处理(Natural language processing,NLP)领域中的一项基础任务,该任务旨在识别并抽取文本中已知实体之间的语义关系,在中英文等多种语言中已有广泛研究。例如:对于句子实例“任正非是华为公司总裁”,关系抽取系统能自动识别出实体“任正非”和“华为公司”之间的语义关系是“雇佣”。关系抽取的研究成果在信息抽取[1]、问答系统[2⁃3]、智能问答[4]和知识图谱构建[5]等任务中都有广泛应用,然而关系抽取任务的研究主要基于句子级别,实例文本中包含的文字数量通常较少,用仅有的文本信息难以获取足够的特征来支撑抽取实体之间的语义关系,造成了严重的特征稀疏问题。如何利用有限的文本信息获取句子结构特征以解决特征稀疏问题,从而支撑关系抽取任务是本文研究的重点。

首先,从语言层面来看,中西方思维方式存在差异,语言产生的背景环境不同等特点使得中英文的语言结构不尽相同。语言有分析型和综合型之分,分析型语言语序固定,综合型语言语序灵活。英语是综合型语言,在语言结构上较重视形式分析和逻辑推理,语法严格,从句形式较多,句子一般较长;中文属于分析型语言,语序较为固定,没有曲折变化,其词语组合成句依靠语序和虚词,短句较为常见[6]。……

登录APP查看全文

猜你喜欢

文本方法模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
3D打印中的模型分割与打包
用对方法才能瘦
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
四大方法 教你不再“坐以待病”!
捕鱼
如何快速走进文本