一种结合BERT与双层LSTM的复杂长句意图分类方法
2021-12-14杨振宇张登辉
计算机应用与软件 2021年12期
杨振宇 张登辉,2
1(常州大学信息科学与工程学院 江苏 常州 213000)2(浙江树人大学信息科技学院 浙江 杭州 310015)
0 引 言
学术文献是科研人员展示研究成果、交流学术观点的主要文字载体。句子意图为语句本身承载的语义信息和语句在上下文所体现的关联作用。分析句子的意图信息可洞察作者写作逻辑,剖析文章整体结构与风格,已成为文献质量分析[1]、信息抽取[2]和自动摘要[3]等任务的典型技术手段。学术文献一般含有很多复杂长句,从篇章整体看,句子间注重逻辑顺序[4];从句子结构看,组成句子的多个子句、词组都具有一定的语义,通过陈述、对比等修辞方法表达句子的整体意图。句子意图分类旨在提取复杂长句整体语义特征,以及子句、词组间的细粒度结构关系。然而,学术文献复杂长句具有的多分句、一词多义等特点给句子意图分类任务带来一定的挑战。
意图分类属于短文本分类任务,处理该任务的模型主要有基于规则的分类模型、基于传统机器学习的分类模型和基于神经网络的深度学习分类模型。基于规则的分类模型需要构建分类词典,通过规则制定一系列关键词所对应的类别构建分类模型,然后根据关键词匹配进行文本分类。该类模型的问题:① 依赖人工制定规则,且面向不同领域的数据需要重新制定;② 关键词匹配方法无法区分不同语境下一词多义现象。传统机器学习分类模型大多从语言学特征考虑,特征提取与模型选择对分类效果具有较大影响。……
登录APP查看全文
